Google julkaisi keskiviikkona Gemini 3.5 Transcriben, yhtiön tarkimman puheesta tekstiksi muuntavan mallin. Se korvaa aiemman Chirp 3:n sekä Googlen omissa tuotteissa että kehittäjien rajapinnoissa. Malli on nyt julkisessa esikatselussa.

Julkistus poikkeaa tavanomaisesta puheentunnistuksen päivityksestä. Googlen virallisen blogin mukaan malli ei pelkästään tunnista sanoja, vaan siivoaa täytesanat, tulkitsee puhujan itsekorjaukset ja muotoilee tekstin luettavaan muotoon. Raaka ääni muuttuu siis suoraan valmiiksi dokumentiksi.

Ero on tärkeä juuri nyt, kun puheagentit siirtyvät kokeiluista tuotantoon. Litteroinnin laatu määrää sen, mitä kielimalli saa syötteekseen. Virheellinen tuotenimi tai kadonnut kielto muuttaa koko keskustelun lopputuloksen.


Kaksi rajapintaa eri käyttötapauksiin


Malli jakautuu kahteen versioon, joilla on oma rajapintansa. Reaaliaikainen gemini-3.5-transcribe-live toimii Live API:n kautta ja tarjoaa jatkuvan kaksisuuntaisen yhteyden alle sekunnin viiveellä. Se on tarkoitettu puheagenteille ja suoraan tekstitykseen.

Tallenteita varten on gemini-3.5-transcribe, joka kulkee Interactions API:n läpi. Se litteroi kokoukset, puhelutallenteet ja muut äänitiedostot jälkikäteen. Mukana tulevat puhujien erottelu ja sanatason aikaleimat, joita tarvitaan analytiikassa ja hakutoiminnoissa.

Puhujia malli tunnistaa luotettavasti kolme. Sitä useamman erottelu on vielä kokeellisella asteella. Rajaus kannattaa huomioida, jos litteroitavana on isompi palaveri tai paneelikeskustelu, jossa puheenvuorot menevät päällekkäin.

Kahtiajako on kehittäjän kannalta olennaisin muutos. Puheagentti tarvitsee matalan viiveen ja sietää pienen tarkkuustappion, kun taas jälkikäteinen analytiikka hyötyy tarkemmasta tallennemallista. Aiemmin sama malli yritti palvella molempia käyttötapauksia yhdellä kompromissilla.



Studiomikrofoni suoran lähetyksen valossa ja arkistoituja äänitallentimia viileämmässä valossa työpöydällä.


Tarkkuus nousi selvästi Chirp 3:sta


Artificial Analysisin mittauksissa mallin keskimääräinen sanavirheaste on 4,0 prosenttia reaaliaikaisessa käytössä. Tallenteiden litteroinnissa luku putoaa 2,6 prosenttiin. Käytännössä se tarkoittaa noin yhtä virhettä neljääkymmentä sanaa kohden.

Monikielisessä FLEURS-vertailussa tulokset ovat 5,50 prosenttia reaaliaikaisesti ja 5,04 prosenttia tallenteista. Molemmat ovat parannuksia Chirp 3:een. Malli tunnistaa ja litteroi yli 85 kieltä ja käsittelee alueelliset aksentit automaattisesti ilman erillistä kielivalintaa.

Nopeus muuttui vielä tarkkuutta enemmän. Aika lopulliseen litterointiin lyheni 70 prosenttia edeltäjäänsä verrattuna. Ero näkyy erityisesti puheagenteissa, joissa vastauksen odottaminen rikkoo keskustelun luontevuuden nopeammin kuin yksittäinen kirjoitusvirhe.

Google korostaa mallin pärjäävän myös meluisissa ympäristöissä. Se tunnistaa aakkosnumeeriset jonot kuten postinumerot ja tilausnumerot, jotka ovat perinteisesti kaataneet puheentunnistimet asiakaspalvelupuheluissa. Juuri niiden varassa moni automatisoitu palveluprosessi seisoo tai kaatuu.



Terävä äänen aaltomuoto studiomonitorilla, taustalla tarkkuusäänilaitteistoa kylmässä valaistuksessa.


Malli siivoaa puheen automaattisesti


Perinteinen puheentunnistin kirjoittaa ylös sen, mitä mikrofoni kuulee. Gemini 3.5 Transcribe menee askeleen pidemmälle. Se poistaa täytesanat, tulkitsee itsekorjaukset ja muotoilee lopputuloksen valmiiksi tekstiksi ilman erillistä jälkikäsittelyvaihetta.

Googlen oma esimerkki havainnollistaa eron. Kun puhuja sanoo "tavataan tiistaina, ei sittenkin keskiviikkona", malli kirjaa lopputulokseksi keskiviikon. Kokonaista väliajatusta ei jää tekstiin sotkemaan, eikä sitä tarvitse siivota erillisellä kielimallikutsulla.

Mukana on myös mukautettu sanasto. Käyttäjä voi syöttää mallille ammattitermit, tuotenimet ja poikkeavat kirjoitusasut, jolloin litterointi mukautuu niihin ilman uudelleenkoulutusta. Erikoisalojen sanasto on ollut puheentunnistuksen pitkäaikainen kompastuskivi lääketieteessä sekä laki- ja teknologia-alalla.

Uutta on lisäksi funktiokutsujen tuki. Malli voi siirtää raskaammat tehtävät, kuten kuvien generoinnin tai tiedostojen analyysin, muille Gemini-malleille. Toiminto on toistaiseksi käytössä vain Geminin macOS-sovelluksessa, mutta se hämärtää rajaa litterointimallin ja varsinaisen assistentin välillä.



Hiljainen kotitoimiston työpöytä illalla: kannettava tietokone, kuulokemikrofoni ja kondensaattorimikrofoni.


Mihin tuotteisiin malli tulee


Kehittäjille malli on julkisessa esikatselussa Gemini-rajapinnassa Google AI Studion ja Antigravityn kautta. Yrityskäytössä se löytyy Gemini Enterprise Agent Platformista, ja Gemini Enterprise for Customer Experience saa sen myöhemmin.

Kuluttajapuolella malli on jo Geminin macOS-sovelluksessa englanniksi ja Androidin Rambler-toiminnossa valituissa maissa. Chromeen se on tulossa, jolloin sanelu onnistuu mihin tahansa verkkolomakkeen kenttään ilman erillistä laajennusta.

Googlen omissa työkaluissa malli yhdistää puheen ja ruudun kontekstin. Antigravityssa se tunnistaa tiedostonimet ja agentin ajatukset käyttäjän luvalla. AI Studion Build-tilassa sovelluksia voi rakentaa puhumalla, mikä kaventaa eroa sanelun ja ohjelmoinnin välillä.

Gboardin Rambler-toiminto muuttaa ääneen puhutut ajatukset muotoilluksi tekstiksi. Samalla äänellä voi tehdä muokkauksia, korjata kirjoitusvirheitä ja vaihtaa tekstin tyyliä ilman näppäimistöä. Kyse ei siis ole enää sanelusta vaan äänellä ohjatusta editorista.



Puhelin, tabletti, kannettava ja pöytänäyttö rivissä, kaikissa hehkuu sininen puhekäyttöliittymän pulssi.


Yhteenveto


Gemini 3.5 Transcribe siirtää puheentunnistuksen painopisteen sanojen tunnistamisesta valmiin tekstin tuottamiseen. Virheaste 2,6 prosenttia ja 70 prosenttia lyhyempi vasteaika tekevät siitä käyttökelpoisen tuotannossa, ei vain demoissa.

Ratkaiseva valinta on rajapinta, ei tarkkuusluku. Reaaliaikainen malli sopii puheagentteihin ja tekstitykseen, tallennemalli kokousten ja puheluiden jälkianalyysiin. Väärä valinta näkyy joko viiveenä tai turhina litterointivirheinä.

Molemmat versiot ovat toistaiseksi esikatselussa. Tuotantokäyttöön siirtyvän kannattaa varautua rajapinnan muutoksiin ja testata mukautettu sanasto omalla termistöllään ennen käyttöönottoa.