NVIDIA kertoi maanantaina Hot Chips -konferenssissa, että Groq 3 LPX -kiihdytin on siirtynyt täyteen tuotantoon. Piiri on rakennettu vuorovaikutteiseen päättelyyn, ja se laajentaa yhtiön Vera Rubin -alustaa. Ensimmäisenä sen ottaa käyttöön tekoälypilvi Nebius.

Kohde on nimenomaan agenttityö. Agentti tuottaa valtavia tokenimääriä satojen tai tuhansien päättelyaskelten yli. Generoinnin nopeus ratkaisee siksi, ehtiikö järjestelmä toimia reaaliajassa vai jääkö käyttäjä odottamaan.


Generointivaihe ratkaisee agentin vasteajan


Agenttitekoäly asettaa laskennalle kaksi eri vaatimusta. Ensin on käsiteltävä suuria konteksteja tehokkaasti, sitten tuotettava tokeneita erittäin matalalla viiveellä. Groq 3 LPX on suunniteltu nimenomaan jälkimmäiseen tehtävään. Vera Rubin NVL72 hoitaa raskaan kontekstin käsittelyn.

NVIDIAn tiedotteen mukaan piiri kasvattaa erityisesti interaktiivisuutta. Sillä tarkoitetaan nopeutta, jolla tokeneita syntyy yhdelle käyttäjälle. Luku määrää, kuinka nopeasti agentti saa yhden työvaiheensa valmiiksi. Kokonaisläpisyöttö ei kerro siitä mitään.

Ero on olennainen myös ostajalle. Konesali voi tuottaa yhteensä valtavan määrän tokeneita, mutta yksittäinen agentti odottaa silti omaa vuoroaan. Interaktiivisuus mittaa juuri tätä odotusta. Se näkyy käyttäjälle suoraan ruudulla.

Nopeampi generointi antaa agentille enemmän aikaa varsinaiseen työhön. Se ehtii lukea tiedostoja, kirjoittaa ja testata koodia, kutsua työkaluja ja tarkistaa tuloksensa saman vasteajan sisällä. Askelten määrä kasvaa ilman, että käyttökokemus kärsii.



Valokuitutaustalevyn lähikuva, jossa valopulssit virtaavat tiheänä jonona


Ennätys Gemma 4 31B -mallilla


Artificial Analysisin mittauksissa Groq 3 LPX tuotti 3 400 tokenia sekunnissa. Testimallina oli avoin agenttimalli Gemma 4 31B ja kontekstina 100 000 tokenia. NVIDIA kuvaa lukua mallin nopeimmaksi koskaan mitatuksi tulokseksi.

Kontekstin pituus ei ole sivuseikka. Agentti kantaa mukanaan työhistoriaansa, tiedostojen sisältöä ja työkalujen vastauksia. Sadantuhannen tokenin ikkuna vastaa siten todellista käyttöä paremmin kuin lyhyet vertailuajot. Pitkä konteksti myös hidastaa generointia selvästi.

Yhtiö lupaa nelinkertaista vasteaikaa lähimpään vaihtoehtoiseen alustaan verrattuna. Lupaus koskee agentteja ja muita viiveherkkiä kuormia, joissa käyttäjä odottaa vastausta ruudun ääressä. Vertailualustaa NVIDIA ei tiedotteessaan nimeä.

Käytännön esimerkkinä tiedotteessa mainitaan koodaus. Tehtävät, joihin agentilta on aiemmin kulunut tunteja, on tarkoitus saada minuutteihin. Vertailukohtaa yksittäisiin työkaluihin ei kuitenkaan avata tarkemmin.



Mittalaitteisto, jonka näytöllä suorituskykykäyrä nousee jyrkästi


Nebius ensimmäisenä pilvipalveluna


Nebius on ensimmäinen tekoälypilvi, joka ottaa piirin käyttöön. Yhtiö tuo sen Nebius Token Factory -tuotantoalustalleen, jonka kautta kehittäjät ajavat päättelyä jo nyt. Aikataulua yhtiö ei ole täsmentänyt.

Nebiuksen teknologiajohtaja Danila Shtan korostaa generointivaiheen merkitystä. Hänen mukaansa juuri se määrää, miten responsiiviselta järjestelmä todella tuntuu. Nopeus tulee saataville saman rajapinnan kautta, jota kehittäjät jo käyttävät.

Siirtymää uuteen pinoon ei siis tarvita. Se on olennaista, koska päättelyalustan vaihto tarkoittaa yleensä integraatioiden uudelleenkirjoittamista. Nebiuksen jälkeen käyttöönottoa suunnittelee myös Groq, joka on erikoistunut päättelyn ajamiseen.

Piiri kulkee samassa telinemittakaavan järjestelmässä kuin Vera Rubin NVL72. Alustaan kuuluvat myös BlueField-4-DPU:t, Vera-suorittimet ja Spectrum-6 SPX -verkko. Kokonaisuus on viritetty moniagenttijärjestelmien läpisyötölle ja matalalle viiveelle.



Pitkä käytävä valaistuja konesalitelineitä, vihreät tilamerkkivalot riveissä


Mitä tämä merkitsee koodausagenteille


Kehittäjän kannalta kiinnostava luku ei ole konesalin kokonaiskapasiteetti vaan oman agentin vasteaika. Pitkässä ajossa jokainen askel odottaa generointia. Viiveet kertautuvat, ja lopputulos mitataan minuuteissa tai tunneissa.

Jos yksi askel nopeutuu nelinkertaisesti, sadan askeleen ketju muuttuu toisenlaiseksi työkaluksi. Agenttia voi seurata reaaliajassa sen sijaan, että ajon käynnistää ja palaa tarkistamaan tuloksen myöhemmin. Ohjaaminen kesken ajon muuttuu käytännölliseksi.

Lukuja kannattaa silti lukea tarkasti. Mittaus tehtiin 31 miljardin parametrin avoimella mallilla, eivätkä tulokset siirry sellaisenaan selvästi suurempiin huippumalleihin. Niiden generointi on raskaampaa ja vaatii enemmän muistikaistaa.

Käyttöön pääsee toistaiseksi pilvipalvelujen kautta. Suoraa hinnoittelua tai saatavuutta yksittäisille kehittäjille NVIDIA ei tiedotteessaan kertonut, joten kustannusvaikutus jää avoimeksi. Hinta ratkaisee, kuinka moni pääsee nopeutta kokeilemaan.



Kehittäjän työpiste yöllä, näytöllä nopeasti vierivää koodia valojuovina


Yhteenveto


Groq 3 LPX ei kasvata mallien kyvykkyyttä vaan poistaa niiden ympäriltä odotusta. Muutos on merkittävä juuri agenteille, joiden työ koostuu suuresta määrästä peräkkäisiä askelia.

Riippumatonta vahvistusta kannattaa silti odottaa. Mittaus on tehty yhdellä mallilla ja yhdellä kontekstipituudella, ja tuotantokuormat näyttävät harvoin samalta kuin vertailutestit.

Jos nelinkertainen vasteaika toteutuu myös tuotannossa, raja interaktiivisen ja taustalla ajettavan agentin välillä hämärtyy. Se näkyy ensimmäisenä koodaustyökaluissa.