Google avasi agenttimaisen videoymmärryksen Gemini-malleille. Ominaisuus on käytössä Gemini 3.7 Flashissa, 3.6 Flashissa ja 3.5 Flash-Litessä. Se muuttaa tavan, jolla malli lukee videota: kiinteän ruutunopeuden sijaan malli päättää itse, mitä kohtia se katsoo.
Google DeepMindin ilmoituksen mukaan muutos leikkaa tokenien kulutusta jopa 88 prosenttia. Analyysin kustannukset laskevat enimmillään 66 prosenttia, ja tarkkuus paranee jopa 7 prosenttia. Ominaisuus on saatavilla heti Gemini-rajapinnassa Google AI Studiossa ja Gemini Enterprise Agent Platformissa.
Kiinteästä ruutunopeudesta tavoitteelliseen selaamiseen
Aiemmin Gemini luki videon kiinteällä ruutunopeudella. Oletus oli yksi ruutu sekunnissa, ja arvoa saattoi säätää rajapinnan kautta. Malli sai siis saman määrän tietoa riippumatta siitä, mitä siltä kysyttiin.
Agenttimaisessa tilassa malli ottaa aktiivisen roolin. Se päättää, mitä kohtaa videosta katsotaan, millä nopeudella ja minkä kanavan kautta. Vaihtoehtoina ovat kuvaruudut, ääniraita ja tekstitys.
Tekninen toteutus muistuttaa agenttisilmukkaa. Malli kutsuu sisäistä työkalua, joka lataa videotiedostosta vain tarvittavan osan. Kehittäjät pystyivät tekemään saman aiemmin käsin, mutta se vaati oman putken rakentamisen.

Mitä uusi tila mahdollistaa
Google listaa neljä käyttötapausta. Ensimmäinen on alle sekunnin tarkkuudella tapahtuva hetkien haku. Yhden ruudun sekuntinopeudella nopeat tilanmuutokset ja tiukat leikkausrajat jäävät helposti huomaamatta.
Toinen on neulan etsiminen heinäsuovasta pitkissä videoissa. Monituntisesta tallenteesta voi kysyä monimutkaisia kysymyksiä ilman, että konteksti syö miljoonia tokeneita.
Kolmas on poikkeamien havaitseminen. Malli voi ottaa kiinnostavasta aikaikkunasta lisää ruutuja ja tarkastella nopeaa liikettä lähempää. Neljäs on toistuvien liikkeiden ja erillisten objektien laskeminen.
Hyödyt korostuvat pitkässä sisällössä. Google mainitsee esimerkkeinä kymmenen minuutin ohjevideot, puolentoista tunnin luennot ja monituntiset tallenteet. Aiemmin kehittäjän piti valita korkeiden tokenkustannusten ja yksityiskohtien karsimisen väliltä.

Kustannukset ja käyttöönotto kehittäjille
Ominaisuus ei maksa erikseen. Se käyttää Gemini-rajapinnan normaalia tokenhinnoittelua ilman lisämaksua. Säästö syntyy siitä, että tokeneita kuluu vähemmän.
Käyttöönotto vaatii yhden asetuksen. Rajapintakutsussa videon processing-kenttä asetetaan arvoon agentic. Muutoin kutsu näyttää tavalliselta Gemini-pyynnöltä.
Tila toimii sekä ladatuille videoille että YouTube-videoille. Google kertoo Gemini 3.7 Flashin tarjoavan parhaan kokonaislaadun ja parhaan laadun ja hinnan yhdistelmän testatuista malleista.

Seuraavaksi Gemini-sovellukseen ja YouTubeen
Google ei jätä ominaisuutta pelkäksi kehittäjätyökaluksi. Yhtiö kertoo tuovansa saman tehokkuuden ja laadun myös omiin tuotteisiinsa. Gemini-sovelluksessa ominaisuus on tulossa kaikille käyttäjille Flash- ja Flash-Lite-malleilla.
Tulevina kuukausina agenttimainen videoymmärrys tukee myös YouTuben Ask YouTube -toimintoa videon katselusivulla. Vastaukset perustuvat silloin suoraan videon visuaaliseen sisältöön.
Käyttäjämäärä on merkittävä. Google puhuu miljardeista käyttäjistä omissa tuotteissaan. Tokenien kulutuksen leikkaaminen tässä mittakaavassa vaikuttaa suoraan myös yhtiön omiin laskentakustannuksiin.

Yhteenveto
Muutos on periaatteessa yksinkertainen: malli lakkaa lukemasta videota tasaisella tahdilla ja alkaa etsiä. Käytännön vaikutus on iso, koska videoanalyysin hinta on tähän asti kasvanut suoraan videon pituuden mukana.
Kehittäjälle kynnys on matala, sillä käyttöönotto vaatii yhden kentän muutoksen. Kiinnostavampi kysymys on, siirtyykö sama logiikka myös muihin raskaisiin syötteisiin kuin videoon.
