Google julkaisi keskiviikkona kaksi uutta puhesynteesimallia: Gemini 3.8 Flash TTS:n ja Gemini 3.8 Flash-Lite TTS:n. Molemmat ovat heti saatavilla Gemini-rajapinnassa ja AI Studiossa ilman jonotuslistaa. Näkyvin uutuus on äänen kloonaus, joka tarvitsee vain 30 sekunnin näytteen.

Julkaisu jakaa Googlen puhelinjan kahtia. Aiemmin rajapinnassa oli yksi esikatseluvaiheen malli, nyt tarjolla on erikseen laatutason ja volyymitason vaihtoehto. Samalla tuotetun äänen hinta putosi yli puoleen edeltäjästään, mikä on julkaisun huomaamattomin mutta konkreettisin muutos.

Kaksi mallia eri kuormille

Gemini 3.8 Flash TTS on linjan laatumalli. Google DeepMindin ilmoituksen mukaan se tukee 130 kieltä ja tunnistaa syötteen kielen automaattisesti. Yhtiö suosittelee sitä äänikirjoihin, studiokerrontaan ja monimutkaisiin vuoropuheluihin, joissa murteet ja vaikeat ääntämykset korostuvat.

Flash-Lite TTS on halvempi työjuhta. Se kattaa 101 kieltä ja on viritetty suureen läpimenoon ja matalaan viiveeseen. Google asemoi sen korvaajaksi aiemmalle gemini-3.1-flash-tts-preview-mallille, joka on ollut rajapinnassa huhtikuusta asti.

Mallit jakavat saman rajapintaskeeman ja saman äänikirjaston. Vaihto niiden välillä onnistuu yhtä parametria muuttamalla, joten vertailun voi tehdä ajamalla saman käsikirjoituksen kahdesti. Molemmat tukevat yhden ja kahden puhujan syntetisointia sekä äänen suunnittelua ja kloonausta.

Suomi on mukana molempien mallien kielilistoilla. Nimi Gemini 3.8 TTS on sateenvarjotermi, jota Google käyttää itsekin julkaisunsa otsikossa. Rajapinnassa malleja on vain kaksi, eikä erillistä 3.8 TTS -mallitunnusta ole olemassa.

Äänitysstudio ja palvelinteline rinnakkain, kaksi eri käyttötarkoitusta

Äänen kloonaus vaatii suostumuksen

Uusi ääni syntyy kahdella tavalla. Ensimmäinen on äänen suunnittelu: kehittäjä kuvaa luonnollisella kielellä halutun sävyn, tempon ja korostuksen, ja malli tuottaa sitä vastaavan puhujan ilman yhtäkään referenssinauhoitusta.

Toinen tapa on kloonaus olemassa olevasta äänestä. Se vaatii 30 sekunnin näytteen ja järjestelmän tekemän suostumuksen tarkistuksen. Valmiiseen ääneen liitetään SynthID-vesileima ja C2PA-alkuperätiedot, jotka kertovat äänen synteettisestä alkuperästä.

Google ei ole kertonut, mitä tapahtuu, jos suostumuksen tarkistus epäonnistuu tai se kierretään. Riippumaton taho ei ole arvioinut suojausten toimivuutta käytännössä. Äänen remiksaus, jolla valmiin äänen sävyä ja tempoa voisi säätää jälkikäteen, on listattu tulevaksi ilman päivämäärää.

Valmiiden äänten määrästä liikkuu ristiriitaisia lukuja. Google puhuu julkaisussaan yli 2 000 tuotantovalmiista äänestä, kun taas dokumentaatio listaa oletuksena 30 studioääntä ja näiden lisäksi erillisen laajemman äänikirjaston. Luku kannattaa tarkistaa omasta käyttöliittymästä.

Studiomikrofoni ja ajastin, taustalla läpikuultava vesileimakuvio

Äänitokenin hinta putosi yli puoleen

Gemini 3.8 Flash TTS:n äänen ulostulo maksaa yhdeksän dollaria miljoonalta tokenilta vuoden 2026 loppuun asti. Korvattu esikatselumalli maksoi kaksikymmentä dollaria samasta määrästä.

Ääni laskutetaan 25 tokenina sekunnissa. Käytännössä se tarkoittaa noin 0,02 senttiä jokaista tuotettua puhesekuntia kohden. Tunnin mittaisen äänitteen hinta jää siten muutamaan euroon.

Flash-Lite TTS on vielä tätäkin halvempi, mikä tekee siitä oletusvalinnan suurille tuotantomäärille. Ero mallien välillä kasvaa sitä suuremmaksi, mitä enemmän ääntä tuotetaan. Valinta kannattaa siksi tehdä mitatun volyymin eikä arvion perusteella.

Google ei ole kertonut, poistuuko vanha esikatselumalli käytöstä. Sitä käyttävien kannattaa suunnitella siirtymä itse sen sijaan, että jäisi odottamaan erillistä lopetusilmoitusta.

Laskeva porrasmainen metallipalikkarivi vaalealla taustalla, kuvaa hinnan laskua

Ohjaus rivi riviltä ja pitkät äänitteet

Mallit eivät pelkästään lue tekstiä ääneen. Käsikirjoitukseen voi kirjoittaa ohjeita rivikohtaisesti: tempon, painotuksen ja tunnesävyn saa määrättyä samaan tapaan kuin näyttelijälle annetaan ohjeita.

Kahden puhujan kohtauksen voi lavastaa yhdellä kutsulla. Äänet pysyvät erillään ja vuorottelevat keskustelunomaisesti. Käsikirjoitukseen voi upottaa myös sanattomia äännähdyksiä ja lyhyitä myötäilyjä, jotka tekevät synteettisestä keskustelusta luontevamman.

Pitkissä äänitteissä keskeisin ongelma on puhujan ajautuminen: ääni muuttuu vähitellen toiseksi kesken nauhoituksen. Google kertoo mallien pitävän puhujan tunnistettavana tuntien mittaisissa tallenteissa. Juuri tämä virhe paljastuu ensimmäisenä, kun tuotetaan pitkä äänikirjan luku.

Yhtiön mukaan mallit ottivat Hume AI:n äänenlaatuvertailussa kaksi ensimmäistä sijaa. Google aikoo tuoda uudet äänet myös Gemini Notebookiin ja Google Vidsiin, mutta aikataulua se ei ole kertonut.

Käsin merkitty käsikirjoitus miksauspöydällä, taustalla kaksi mikrofonitelinettä

Yhteenveto

Gemini 3.8 TTS on ennen kaikkea hinnanalennus, joka on puettu äänenlaadun julkistukseksi. Kloonaus 30 sekunnin näytteestä on tekninen harppaus, mutta sen käytännön merkitys ratkeaa vasta sillä, kuinka hyvin suostumuksen tarkistus kestää.

Kehittäjälle valinta on suoraviivainen. Laatu ja kielikatto puoltavat Flash TTS:ää, volyymi ja viive Flash-Liteä. Vaihto niiden välillä on yhden rivin muutos, joten päätöksen voi tehdä mittaamalla.