SpaceXAI julkaisi perjantaina Grok Voice Transcribe 2.0:n, yhtiön uuden puheentunnistusmallin. Yhtiön omien mittausten mukaan malli on kaksi kertaa tarkempi kuin edeltäjänsä. Hinta pysyi silti ennallaan: eräajo maksaa kymmenen senttiä äänitunnilta. Malli on heti saatavilla samassa rajapinnassa kuin versio 1.0.
Julkaisussa on harvinainen piirre. Mikään ominaisuus ei siirry maksumuurin taakse, vaan puhujantunnistus, sanatason aikaleimat ja termipainotus sisältyvät perushintaan. Käytännössä SpaceXAI siirtää koko parannuksen asiakkailleen ja jättää hinnoittelun koskematta.
Tarkkuus kaksinkertaistui, hinta pysyi paikallaan
SpaceXAI kuvaa Grok Voice Transcribe 2.0:aa yhdeksi tarkimmista tällä hetkellä saatavilla olevista litterointimalleista. Vertailukohta on yhtiön oma edellinen versio, ei kilpailija. Parannus perustuu yhtiön mukaan harjoitusaineistoon, joka koostuu meluisasta ja monikielisestä puheesta oikeissa käyttöympäristöissä.
Selkein yksittäinen luku koskee lyhyitä monikielisiä komentoja. Yhtiön 19 kielen ääniassistenttiaineistossa sanavirheaste putosi 20,6 prosentista 6,8 prosenttiin. Parannus osuu juuri siihen käyttötapaukseen, jossa vanhemmat mallit ovat perinteisesti kompastelleet. Lyhyt lausahdus tarjoaa vähän kontekstia, josta malli voisi päätellä epäselvän sanan.
Hinnoittelu pysyy identtisenä edeltäjän kanssa. Tallennetun äänen litterointi maksaa 0,10 dollaria äänitunnilta ja reaaliaikainen suoratoisto 0,20 dollaria. Puhujantunnistus, aikaleimat ja avaintermit kuuluvat samaan hintaan ilman erillistä veloitusta.
Luvut kannattaa lukea varauksella. Kaikki mittaukset ovat yhtiön itsensä tekemiä, eikä SpaceXAI ole julkaissut versioiden välistä vertailutaulukkoa tarkkuudesta tai viiveestä. Riippumatonta vahvistusta parannuksen suuruudelle ei siis vielä ole. Hankintapäätös kannattaa perustaa omaan koeajoon.

Mitä rajapinta tarjoaa kehittäjille
Uusi malli toimii samassa Speech-to-Text -rajapinnassa kuin edeltäjänsä. Olemassa olevat integraatiot saavat tarkkuusparannuksen ilman koodimuutoksia, kun mallin tunnisteeksi vaihtaa grok-voice-transcribe-2.0. Oletusmallina on toistaiseksi yhä versio 1.0, joten tuotantojärjestelmät eivät siirry uuteen ilman nimenomaista valintaa.
Rajapinta tarjoaa kaksi reittiä. Tallennetut tiedostot ja URL-osoitteet kulkevat REST-kutsuna, ja yksittäinen tiedosto saa olla enintään 500 megatavua. Reaaliaikainen litterointi kulkee WebSocket-yhteyden yli, ja malli valitaan yhteyttä avattaessa.
Jokainen sana palautuu omalla aloitus- ja lopetusaikaleimallaan sekä luottamusluvullaan. Aikaleimat helpottavat tekstitysten kohdistamista ja haun rakentamista pitkiin tallenteisiin. Luottamusluvut taas auttavat merkitsemään epävarmat kohdat ihmisen tarkistettavaksi.
Termipainotus on kehittäjän kannalta käytännöllisin lisä. Yhtä pyyntöä kohti voi välittää enintään sata toimialatermiä, kuten tuotenimiä tai lääketieteellistä sanastoa. Näin malli tunnistaa erisnimet, joita se ei muuten osaisi odottaa. Vaikutus näkyy heti puheluissa, joissa toistuvat samat tuotekoodit.

Puhujantunnistus ja kahdeksan rinnakkaista kanavaa
Puhujantunnistus merkitsee litteraattiin, kuka puhuu milloinkin. SpaceXAI tarjoaa sen ilman lisämaksua, mikä poikkeaa useiden kilpailijoiden käytännöstä. Monella palveluntarjoajalla puhujien erottelu on erikseen hinnoiteltu lisäosa.
Monikanavainen litterointi käsittelee enintään kahdeksan äänikanavaa toisistaan riippumatta. Puhelinpalvelun tallenteissa asiakas ja asiantuntija tallentuvat usein eri kanaville, jolloin erottelu on tarkempaa kuin jälkikäteen tehty puhujantunnistus. Kahdeksan kanavaa riittää myös kokouspuheluihin ja podcast-tuotantoon.
Mukana on myös joukko pienempiä käytännön ominaisuuksia. Malli palauttaa numerot, päivämäärät, valuutat, puhelinnumerot ja sähköpostiosoitteet kirjoitetussa muodossa. Täytesanojen poisto siivoaa litteraatista empimiset, jos kehittäjä niin haluaa.
Ääniagenteille on oma ominaisuutensa. Vuoronvaihdon tunnistus päättelee, milloin puhuja lopettaa vuoronsa. Ilman sitä ääniagentit joko keskeyttävät käyttäjän kesken lauseen tai jäävät odottamaan liian pitkään. Kummassakin tapauksessa keskustelu tuntuu kömpelöltä.

Kilpailu litterointirajapinnoista kiristyy
Kymmenen senttiä äänitunnilta painaa koko markkinan hintatasoa. Google toi elokuun lopussa Gemini 3.5 Transcriben, joka litteroi puhetta 2,6 prosentin virheasteella. Kun useampi tarjoaja asettuu samalle hintatasolle, malli itsessään lakkaa olemasta erottava tekijä.
SpaceXAI kertoo avoimesti, mistä sen etu tulee. Grok Voice -pino käsittelee yhtiön mukaan kymmeniätuhansia asiakaspalvelupuheluita päivässä, litteroi miljoonia tunteja videokerrontaa ja pyörittää Teslan autoihin upotettua ääniassistenttia. Harjoitusaineisto syntyy siis omasta tuotantoliikenteestä.
Sama koskee arviointiaineistoja. Yhtiö mittaa sanavirheastetta neljällä sisäisellä aineistolla, jotka on poimittu tuotantoliikenteestä: asiakaspalvelupuhelut, keskustelut Grokin kanssa, lyhyet monikieliset komennot ja ääneen luetut tunnistetiedot. Viimeksi mainittu koostuu tilinumeroista, puhelinnumeroista, sähköpostiosoitteista ja katuosoitteista.
Versio 1.0 poistuu käytöstä lähiviikkoina. Siirtymän ajaksi kehittäjä voi kiinnittää mallin tunnisteella grok-voice-transcribe-1.0, mutta pysyvää vaihtoehtoa se ei ole. Asiakkaat siirtyvät uuteen malliin riippumatta siitä, pyysivätkö he sitä.

Yhteenveto
Grok Voice Transcribe 2.0 on ennen kaikkea hintapoliittinen julkaisu. Tarkkuus paranee yhtiön mukaan selvästi, mutta laskutus ei muutu lainkaan, ja aiemmin lisämaksullisia ominaisuuksia siirtyy perushintaan. Kehittäjälle kynnys kokeiluun on siten käytännössä olematon.
Puuttuva pala on riippumaton mittaus. Ennen kuin ulkopuolinen vertailu vahvistaa kaksinkertaistuneen tarkkuuden, siirtymä kannattaa tehdä oman aineiston koeajon perusteella. Aikaa harkintaan ei silti ole loputtomasti, sillä edellinen versio poistuu käytöstä viikkojen kuluessa.
