Google julkaisi Gemini Omni 1.1 Flashin, videomallin, joka on suunnattu sovelluskehittäjille. Painopiste ei ole kuvanlaadussa vaan siinä, kuinka tarkasti kehittäjä voi ohjata lopputulosta.
Malli on saatavilla Google AI Studiossa, Gemini Enterprise Agent Platform -rajapinnassa, Google Flow’ssa ja Gemini-sovelluksessa. Jakelu on maailmanlaajuinen. Kohderyhmä on kerrottu suoraan: generatiivisia videosovelluksia, luovia työkaluja ja mediaeditoreita rakentavat tiimit.
Kohtaus jatkuu 40 sekuntiin
Näkyvin muutos on kohtauksen jatkaminen. Malli tuottaa lisää videota kymmenen sekunnin paloissa, ja kokonaispituus voi yltää 40 sekuntiin. Aiemmin generoitu klippi loppui käytännössä siihen, mihin ensimmäinen ajo päättyi.
Ratkaisevaa on se, kuinka paljon aiempaa materiaalia malli lukee jatkoa tehdessään. Gemini Omni 1.1 Flash analysoi jopa kymmenen sekuntia edeltävää kontekstia. Googlen mukaan aiemmat mallit viittasivat vain viimeiseen sekuntiin.
Ero näkyy jatkuvuudessa. Kun malli näkee kymmenen sekuntia taaksepäin, hahmot, valaistus ja kameran liike pysyvät paremmin kasassa leikkauskohdan yli. Yhden sekunnin kontekstilla jatko ajautui helposti sivuun heti ensimmäisen liitoksen jälkeen.
Rajapinnassa jatkaminen tapahtuu previous_interaction_id -parametrilla client.interactions.create-kutsussa. Kehittäjä viittaa siis edelliseen generointiin sen sijaan, että lataisi videon uudelleen syötteeksi. Se pitää ketjun palvelimen puolella ja vähentää siirrettävän datan määrää.
Neljäkymmentä sekuntia ei riitä kokonaiseen tarinaan, mutta se riittää mainokseen, tuote-esittelyyn ja sosiaalisen median klippiin. Juuri niissä muodoissa generoitua videota käytetään tällä hetkellä eniten.

Avainkuvat ja videoviitteet
Kehittäjä voi määrittää kohtauksen ensimmäisen ja viimeisen ruudun. Malli täyttää välin, mikä tekee kameraliikkeistä ja siirtymistä ennakoitavia.
Käytännössä tämä siirtää videogeneroinnin lähemmäs kuvakäsikirjoitusta. Lopputulosta ei enää arvota kehotteella, vaan kaksi kiintopistettä lukitaan etukäteen. Kehotteen tehtäväksi jää kuvata se, mitä pisteiden välissä tapahtuu.
Toinen uutuus on videoviite. Malli ottaa syötteenä jopa kolme sekuntia videota multimodaalisena viitteenä. Sillä pidetään hahmo tai visuaalinen tyyli samana useassa erillisessä klipissä.
Yhdessä nämä kaksi ominaisuutta ratkovat samaa ongelmaa. Sarjamuotoisen sisällön tekeminen on kaatunut siihen, ettei kahta peräkkäistä klippiä ole saanut näyttämään samalta. Mainoskampanjassa tai tuotevideosarjassa juuri se on ollut este tuotantokäytölle.
Videoviitteen kolmen sekunnin raja on samalla muistutus rajoitteista. Se riittää tyylin ja hahmon lukitsemiseen, mutta ei pitkän kohtauksen yksityiskohtien siirtämiseen klipistä toiseen.

Resoluutiot ja kustannukset
Malli tuottaa 360p-vedoksia, 720p-vakiolaatua, 1080p:tä sekä 4K-skaalauksen. Vedostaso on lisätty nimenomaan iterointia varten.
Googlen mukaan 360p-vedos syntyy jopa 60 prosenttia nopeammin ja maksaa kolmasosan verrattuna Omni 1.1:n 720p-vakioresoluutioon. Kehittäjä voi hakea oikean kompositiion halvalla ja renderöidä lopullisen version vasta sitten.
Työnkulku on sama kuin 3D-renderöinnissä. Ensin nopea esikatselu, sitten lopullinen ajo. Videogeneroinnissa tämä askel on ollut pitkään puutteellinen, koska jokainen yritys maksoi täyden hinnan täydellä resoluutiolla.
Vaikutus näkyy suoraan sovelluksen kate-laskelmassa. Jos käyttäjä kokeilee kymmentä versiota ennen kuin valitsee yhden, yhdeksän niistä voidaan nyt ajaa kolmasosahinnalla.
Google ei julkaissut vertailulukuja kilpaileviin videomalleihin. Julkistuksen painopiste on ohjattavuudessa, ja laatuväitteet jäävät kehittäjän itse todennettaviksi.

Mitä tämä tarkoittaa kehittäjälle
Gemini Omni 1.1 Flash on selvästi asemoitu rakennuspalikaksi eikä kuluttajatyökaluksi. Ominaisuuslista koostuu asioista, joita tarvitaan sovelluksen sisällä: viittaus edelliseen ajoon, avainkuvat, tyylin lukitseminen ja halpa vedos.
Kohtauksen jatkaminen on saatavilla Gemini-sovelluksessa Plus-, Pro- ja Ultra-tilaajille. Google Flow’ssa malli on samojen tasojen käytössä, joten sama toiminnallisuus näkyy sekä rajapinnassa että Googlen omissa tuotteissa.
Saatavuus kattaa sekä kokeilun että tuotannon. Google AI Studio riittää prototyyppiin, kun taas rajapinta ja Enterprise-alusta on tarkoitettu skaalattuun käyttöön. Sama malli kulkee siis läpi koko putken ilman vaihtoa toiseen versioon.
Yrityskäyttöä varten malli on tarjolla Gemini Enterprise Agent Platform -rajapinnan kautta. Se sitoo videogeneroinnin samaan hallintakerrokseen kuin muut Googlen agenttipalvelut.
Avoin kysymys on hinnoittelun tarkka rakenne pidemmissä kohtauksissa. Neljänkymmenen sekunnin klippi syntyy neljästä perättäisestä ajosta, ja jokainen niistä lukee aiempaa kontekstia. Kustannus ei siis skaalaudu suoraviivaisesti sekunneissa.

Yhteenveto
Gemini Omni 1.1 Flash ei myy uutta kuvanlaatua vaan hallintaa. Avainkuvat, videoviitteet ja pidempi konteksti tekevät generoidusta videosta työkalun, jota voi ohjata kuin leikkauspöytää.
Julkistus kertoo myös siitä, mihin videogeneroinnin kilpailu on siirtymässä. Kun perusraaka laatu riittää useimpiin käyttötarkoituksiin, erot syntyvät toistettavuudesta ja siitä, saako saman kohtauksen tehtyä kahdesti samanlaisena.
Kehittäjälle merkittävin yksityiskohta on halpa 360p-vedos. Se muuttaa videogeneroinnin kustannusrakennetta enemmän kuin mikään yksittäinen laatuparannus.
