Google julkaisi tiistaina kaksi uutta puhemallia, jotka on rakennettu reaaliaikaiseen keskusteluun. Gemini 3.8 Live ja Gemini 3.8 Live Extended Thinking korvaavat yhtiön aiemmat Live-mallit. Molemmat ovat saatavilla Gemini-rajapinnassa ja Google AI Studiossa heti julkaisupäivästä.

Google DeepMindin blogin mukaan kyse ei ole pelkästä puheen laadun hienosäädöstä. Uudet mallit suorittavat työkalu- ja rajapintakutsuja taustalla samalla kun keskustelu jatkuu. Aiemmissa ääniratkaisuissa tämä on tarkoittanut hiljaista taukoa, jonka aikana käyttäjä jää odottamaan.

Julkaisu jatkaa Googlen tiheää mallitahtia. Yhtiö toi Gemini 3.8 Flashin markkinoille kaksi viikkoa aiemmin, ja Gemini 3.5 Transcribe julkaistiin elokuussa. Live-mallit täydentävät nyt saman perheen ääniosuuden.

Kaksi mallia eri käyttötarkoituksiin

Julkaisu sisältää kaksi erillistä mallia, joilla on eri painotus. Gemini 3.8 Live on suunniteltu mittakaavaan ja kustannustehokkuuteen. Se yhdistää sujuvan vuoropuhelun ja visuaalisen kontekstin ymmärtämisen.

Gemini 3.8 Live Extended Thinking on tarkoitettu monimutkaisiin tehtäviin. Se päättelee ja puhuu yhtä aikaa, eli monivaiheinen ajattelu ei keskeytä keskustelua. Google kertoo mallin nousseen ensimmäiseksi Artificial Analysisin speech-to-speech-vertailussa.

Ero näkyy käytännössä siinä, kuinka paljon taustalaskentaa tehtävä vaatii. Yksinkertainen tiedustelu tai asiakaspalvelun rutiinipyyntö kulkee kevyemmällä mallilla. Useita vaiheita ja työkaluja vaativa työ ohjataan Extended Thinking -versiolle.

Molemmat mallit ovat natiiveja puhe-puhe-malleja. Ne eivät ketjuta erillistä puheentunnistusta, kielimallia ja puhesynteesiä peräkkäin. Google pitää tätä keskeisenä erona aiempiin kaskadiarkkitehtuureihin.

Kaksi rinnakkaista hehkuvaa ääniaaltoa tummassa studiossa

Työkalut suoritetaan kesken keskustelun

Uusien mallien näkyvin muutos on asynkroninen funktiokutsu. Malli voi käynnistää rajapintakutsun ja jatkaa puhumista samaan aikaan. Vastaus tehtävään liitetään keskusteluun sitten, kun se valmistuu.

Extended Thinking -versio kertoo etenemisestään ääneen. Se käyttää lyhyitä kuittauksia ennen kuin varsinainen työ valmistuu. Monivaiheisen tehtävän edetessä malli kuvaa vaiheita käyttäjälle reaaliajassa.

Google nostaa esiin myös aakkosnumeerisen tarkkuuden. Mallit lukevat vahvistuskoodeja, vahinkonumeroita ja teknisiä tunnisteita aiempaa luotettavammin. Asiakaspalvelussa juuri nämä kohdat ovat perinteisesti kaatuneet väärin tunnistettuun merkkiin.

Visuaalinen konteksti täydentää kuvaa. Malli käsittelee kuvasyötettä lähes reaaliajassa ja voi perustaa vastauksensa siihen, mitä käyttäjä näyttää kameralle. Tämä avaa ääniagentit tilanteisiin, joissa pelkkä puhe ei riitä.

Taustasuoritus muuttaa myös virhetilanteiden käsittelyä. Jos työkalukutsu epäonnistuu, malli voi kertoa siitä keskustelun kuluessa eikä vasta pitkän hiljaisuuden jälkeen. Käyttäjälle tämä näkyy ennen kaikkea odotusajan katoamisena.

Mikrofoni etualalla ja taustalla epäterävät tehtäväpaneelit

Kieli vaihtuu ilman erillistä käskyä

Gemini 3.8 Live tukee 97 kieltä. Malli tunnistaa kielen vaihdon itse ja siirtyy siihen kesken keskustelun. Käyttäjän ei tarvitse ilmoittaa vaihdosta erikseen tai aloittaa istuntoa alusta.

Google korostaa myös aksenttien pysyvyyttä. Sama ääni säilyttää luonteensa kielestä toiseen siirryttäessä. Monikielisissä asiakaspalvelutilanteissa tämä poistaa tarpeen reitittää puhelu erilliseen jonoon.

Suomen kaltaisille pienille kielialueille laaja kielituki on merkityksellinen. Ääniagenttien käyttöönotto on tähän asti kaatunut usein siihen, että laatu on riittänyt vain suurimmilla kielillä. Google ei kuitenkaan julkaissut kielikohtaisia laatulukuja.

Rinnalle jäi elokuussa julkaistu Gemini 3.5 Transcribe. Se on omistettu puheen litterointiin ja kattaa yli 85 kieltä. Yhtiön mittauksissa sen sanavirheaste oli 4,0 prosenttia suoratoistossa ja 2,6 prosenttia jälkikäteen ajettuna.

Valonauhoista muodostuva maapallo tummalla heijastavalla pinnalla

Hinnoittelu ja käyttöönotto kehittäjille

Hinnoittelu perustuu minuutteihin eikä tokeneihin. Äänisyöte maksaa 0,005 dollaria minuutilta ja äänivaste 0,018 dollaria minuutilta. Molemmat mallit jakavat saman hinnaston.

Mallit ovat käytettävissä Live API:n kautta. Google listaa integraatiokumppaneiksi muun muassa LiveKitin, Pipecatin, LangChainin, Vercelin ja Agoran. Kumppanit hoitavat mediavirtojen siirron, joka on ollut ääniagenttien työläin osuus.

Yrityksille mallit avautuvat ensin yksityisenä esikatseluna Gemini Enterprisessa. Kuluttajapuolella 3.8 Live näkyy Search Livessä ja Extended Thinking Gemini Livessä. Google AI Pro- ja Ultra-tilaajat saavat sen myös Workspacen Docsiin.

Käyttöönoton kynnys on matala niille, jotka jo käyttävät Gemini-rajapintaa. Uusi malli vaihdetaan olemassa olevaan Live API -integraatioon mallitunnusta vaihtamalla. Isompi työ on suunnitella, mitä agentti saa taustalla tehdä.

Kehittäjän työpiste, kaksi näyttöä ja mikrofoni puomivarressa

Yhteenveto

Gemini 3.8 Live siirtää ääniagenttien painopisteen keskustelun sujuvuudesta työn tekemiseen. Taustalla suoritettavat työkalukutsut ja puhuva päättely poistavat hiljaiset tauot, jotka ovat tehneet aiemmista ääniagenteista kankeita.

Ratkaisevaa on, kestävätkö luvatut kyvyt tuotantokäytön. Aakkosnumeerinen tarkkuus ja kielen vaihto kesken puhelun ovat juuri niitä kohtia, joissa ääniagentit ovat aiemmin pettäneet. Minuuttipohjainen hinnoittelu tekee laskelmista ainakin ennakoitavia.

Suomalaisille toteuttajille kiinnostavin kohta on 97 kielen tuki ja sen todellinen laatu suomeksi. Sitä ei voi päätellä julkaisutiedoista, vaan se selviää vasta omissa testeissä.