OpenAI ja Cerebras avasivat Ultrafast-nimisen palvelutason OpenAI:n rajapintaan. Tasolla GPT-5.6 Sol tuottaa jopa 750 tokenia sekunnissa. Cerebrasin mukaan nopeus ei vaadi tinkimään vastausten laadusta.

Nopeuden ja älykkyyden välinen vaihtokauppa on ollut alan perusrajoite. Mitä suurempi malli, sitä enemmän laskentaa ja tiedonsiirtoa jokainen vastaus vaatii. Käyttäjä on joutunut valitsemaan hyvän vastauksen ja nopean vastauksen väliltä.

Ultrafast on toistaiseksi rajatussa esikatselussa valikoiduille asiakkaille. Käyttöoikeus laajenee sitä mukaa kuin kapasiteettia vapautuu. Cerebras kertoi järjestelystä blogissaan.

Humanity's Last Exam yhdessä työpäivässä


Cerebras ajoi Ultrafast-tilan Humanity's Last Exam -vertailua vastaan. Kokeessa on 2 500 kysymystä, joihin tyypillisesti vastaavat vain alansa tohtorit. Aihepiirit ulottuvat kemiasta taloustieteeseen ja kirjallisuuteen.

GPT-5.6 Sol vastasi kaikkiin kysymyksiin 11 tunnissa ja 11 minuutissa. Vertailukohtana Claude Fable 5 tarvitsi samaan 78 tuntia ja 27 minuuttia. Ero on lähes seitsenkertainen vastaavalla tarkkuudella. Käytännössä kolmen vuorokauden ajo kutistui yhteen työpäivään.

Toinen mittaus tehtiin GDP-Val-vertailulla, joka mittaa taloudellisesti arvokasta tietotyötä. Siinä Ultrafast tuotti 5,6-kertaisen läpimenonopeuden ilman laadun heikkenemistä. Cerebras nostaa esiin juuri tämän: nopeampi päättely nopeuttaa myös työtä, jolla on suora rahallinen arvo.

Mittaukset ovat Cerebrasin omia, mikä kannattaa pitää mielessä. Ne on tehty heinäkuussa Codex- ja Claude Code -ympäristöissä korkeilla päättelyasetuksilla. Riippumatonta vahvistusta luvuille ei toistaiseksi ole.



Sekuntikello tiheiden koepaperien pinon päällä hämärässä kirjastossa


Wafer-Scale Engine poistaa muistipullonkaulan


Nopea päättely on ennen kaikkea tiedonsiirto-ongelma. Näytönohjaimilla suurten mallien ajoa rajoittaa muistikaista. Mallin painot siirtyvät toistuvasti sirun sisäisen muistin ja ulkoisen muistin välillä jokaista tuotettua tokenia varten.

Cerebras ratkaisee tämän pakkaamalla 44 gigatavua SRAM-muistia yhdelle kiekon kokoiselle sirulle. Painot pysyvät sirulla, ja tokenit virtaavat keskeytyksettä mallin kerrosten läpi useiden kiekkojen yli. Ratkaisu on tietoisesti vastavirtaan valtavirran GPU-arkkitehtuurista.

Yhtiön mukaan lähestymistapa skaalautuu mallikoon kasvaessa. Se on myös perustelu sille, miksi nopeusetu säilyisi tulevissakin huippumalleissa. Väite on kuitenkin ennuste eikä mitattu tulos.

Vertailulukuina Cerebras kertoo Ultrafast-tilan olevan 11 kertaa nopeampi kuin Fable 5 ja viisi kertaa nopeampi kuin Opus 4.8 nopeassa tilassa. Luvut perustuvat Artificial Analysis -palvelun raportoimiin tuottonopeuksiin. Vertailu koskee siis nopeutta, ei tarkkuutta.



Suuri piikiekko puhdastilan pidikkeessä, pinnalla sateenkaarenhohtoisia piirikuvioita


Mitä nopeus muuttaa käytännön työssä


Nopeus siirtää agentit tehtäviin, joissa viive on aiemmin ollut este. Cerebras nostaa esiin tuotantohäiriöiden juurisyyanalyysin. Verkkopalvelua pyörittävälle yhtiölle jokainen minuutti näkyy suoraan palvelutasosopimuksessa ja menetettynä liikevaihtona.

Toinen esimerkki on tietoturva. Hyökkäystilanteessa puolustavan tiimin on tunnistettava ja rajattava uhka nopeasti. Hidas malli ei ehdi mukaan päätöksentekoon, jolloin sen tuottama analyysi valmistuu vasta vahingon jälkeen.

OpenAI:n tutkija Jeffrey Wang kuvaa vaikutusta arkisemmin. Aiemmin minuuttien odotus pakotti vaihtamaan tehtävää välissä, nyt ajo ehtii valmiiksi ennen kuin keskittyminen katkeaa. Muutos on pieni, mutta se poistaa tarpeen hallita useaa rinnakkaista istuntoa.

Käytännössä työnjako muuttuu. Vaativimmat ja kiireellisimmät tehtävät ajetaan Ultrafast-tilassa, ja tavanomainen rinnakkaistettava massatyö jää normaalille tasolle. Valinta on siis tehtäväkohtainen eikä koko organisaatiota koskeva.



Hämärä valvomo, jonka näyttöseinällä hehkuu kuvaajia ja tilaruudukoita


Rajattu esikatselu ja avoimet kysymykset


Palvelutaso on saatavilla vain valikoiduille asiakkaille. Cerebras kertoo laajentavansa pääsyä kapasiteetin kasvaessa. Ilman aikataulua lupaus jää toistaiseksi avoimeksi.

Hinnoittelusta ei kerrottu julkistuksen yhteydessä. Se on olennainen puuttuva tieto, sillä nopeuden arvo riippuu siitä, mitä siitä joutuu maksamaan. Erikoislaitteistolla ajettu palvelutaso on harvoin halvin vaihtoehto.

Kapasiteetti on myös tekninen kysymys. Kiekonkokoisia siruja valmistetaan huomattavasti pienempiä määriä kuin tavanomaisia näytönohjaimia. Se rajaa väistämättä sitä, kuinka moni pääsee tasolle lähikuukausina.

Kiinnostavaa on myös asetelma itsessään. OpenAI ajaa lippulaivamalliaan kumppanin laitteistolla oman ja Microsoftin infrastruktuurin rinnalla. Se kertoo, että päättelyn erikoistuminen on siirtymässä tutkimusaiheesta kaupalliseksi tuotteeksi.



Yksittäinen hehkuva palvelinkaappi lasiseinän takana pimeässä konesalissa


Yhteenveto


Ultrafast ei tuo uutta mallia vaan uuden tavan ajaa olemassa olevaa. Merkitys syntyy siitä, että nopeuden ja älykkyyden välinen vaihtokauppa on ollut alan perusrajoite. Jos se murtuu, muuttuu myös se, mihin tehtäviin malleja kannattaa laittaa.

Rajatun esikatselun takia vaikutus jää toistaiseksi kapeaksi. Luvut ovat valmistajan omia, ja hinnoittelu puuttuu kokonaan. Näiltä osin julkistus on enemmän suunnannäyttö kuin valmis tuote.

Seuraavaksi kannattaa seurata kahta asiaa: milloin pääsy laajenee ja mitä taso maksaa. Ne ratkaisevat, jääkö Ultrafast harvojen työkaluksi vai muuttuuko sekunneissa mitattava agenttiajo tavanomaiseksi.