SpaceXAI julkaisi keskiviikkona Grok 4.6:n, yhtiön uusimman lippulaivamallin. Julkaisun painopiste on pitkäkestoisissa agenttiajoissa ja aiempaa kunnianhimoisemmassa visuaalisessa työssä. Malli rakentuu heinäkuussa esitellyn Grok 4.5:n päälle.
SpaceXAI:n julkaisutiedotteen mukaan Grok 4.6 pysyy tehtävässä useiden vaiheiden ajan. Se tutkii aihetta, analysoi tietoa ja työskentelee koodikannan läpi ilman jatkuvaa ohjausta. Malli on saatavilla heti Cursorissa ja Grok Buildissa.
Painopiste siirtyi pitkiin ajoihin
Grok 4.6:n keskeisin muutos ei ole yksittäinen kyky vaan kestävyys. SpaceXAI kertoo testanneensa mallia projekteilla, jotka venyttävät sen kykyä pitää työ kasassa kymmenien askelten yli. Painopiste on siirtynyt yksittäisistä vastauksista kokonaisiin työsuorituksiin.
Yhtiön mukaan malli on erityisen vahva muuttamaan väljän tuoteidean toimivaksi ensimmäiseksi versioksi. Se perehtyy tuntemattomaan aihealueeseen, rakentaa sovelluksen rungon ja toteuttaa keskeiset vuorovaikutukset. Tämän jälkeen se hioo tulosta useammalla palautekierroksella.
Visuaalisissa ja vuorovaikutteisissa projekteissa ensimmäiset versiot ovat SpaceXAI:n mukaan aiempaa vahvempia. Malli kykenee määrittämään sovelluksen rakenteen ja visuaalisen ilmeen yhdellä kierroksella. Käytännössä tämä siirtää työn painopisteen tyhjältä pöydältä aloittamisesta valmiin luonnoksen hiomiseen.
Pidemmissä ajoissa SpaceXAI havaitsi mallin myös testaavan itseään. Grok 4.6 tarkistaa oman työnsä ennen seuraavaan vaiheeseen siirtymistä. Juuri tämä erottaa agentin tavallisesta koodiavustajasta, joka luovuttaa vastauksen tarkistamatta sitä.
Ero näkyy myös siinä, miten mallia kannattaa käyttää. Lyhyet kysely-vastaus-kierrokset eivät hyödy kestävyydestä juuri lainkaan. Hyöty realisoituu vasta, kun agentti saa tehtäväkseen kokonaisuuden ja työskentelee sen parissa ilman jatkuvia välitarkistuksia.

Vertailuluvut asettuvat kärkijoukkoon
Grok 4.6 saa Artificial Analysis Intelligence Index -indeksistä 61 pistettä. Sama lukema on GPT-5.6 Sol Maxilla, ja Fable 5 Max jää pisteen edelle tuloksella 62. Grok 4.5 ylsi 56 pisteeseen, joten harppaus edelliseen sukupolveen on selvä.
Agenttivertailuissa asetelma kääntyy Grokin eduksi. GDPVal-AA v2 -testissä Grok 4.6 johtaa lukemalla 1753, kun GPT-5.6 Sol Max jää 1728:aan ja Fable 5 Max 1741:een. Myös AA-Briefcase-testissä Grok 4.6 on kärjessä 1577 pisteellä.
Koodauspuolella kuva on epätasaisempi. CursorBench v3.2:ssa Grok 4.6 yltää 69,9 prosenttiin, mikä jää niukasti Fable 5 Maxin 70,5 prosentista. DeepSWE v1.1:ssä ero kasvaa: Grok 4.6 saa 65,9 prosenttia, GPT-5.6 Sol Max 73 prosenttia.
Erikoistuneemmissa vertailuissa erot kasvavat. APEX-Agents-testissä Grok 4.6 saa 57,5 prosenttia, kun Grok 4.5 jäi 47,1 prosenttiin. Juridiikkaan painottuvassa Harvey LAB -testissä Grok 4.6:n 15,8 prosenttia ohittaa selvästi sekä GPT-5.6 Sol Maxin 2,5 prosenttia että Fable 5 Maxin 11,3 prosenttia.
Selvin heikkous löytyy Terminal-Bench v3.0 -testistä. Grok 4.6:n 26 prosenttia jää kauas GPT-5.6 Sol Maxin 34,6 prosentista ja Fable 5 Maxin 34,1 prosentista. Edelliseen versioon nähden tulos silti lähes kaksinkertaistui 15,7 prosentista.

Koulutuksessa nojattiin edeltäjän jälkiin
SpaceXAI ajoi Grok 4.6:lle pidemmän täydentävän koulutusjakson kuin Grok 4.5:lle. Aineistona käytettiin kuratoitua mallin itsensä tuottamaa dataa päättelystä ja teknisistä käsitteistä sekä laadukasta insinöörityön aineistoa. Mukana oli myös parannettu optimoija ja hiottu koulutusresepti.
Ohjatun hienosäädön vaiheessa yhtiö käytti Grok 4.5:tä uusien harjoituspolkujen tuottamiseen. Polut kattoivat eri päättelytasot, agenttikehykset sekä STEM-alat, ohjelmistokehityksen ja tietotyön. Ongelmalliset jäljet suodatettiin pois mallipohjaisilla tarkistuksilla.
Vahvistusoppimisen vaihe keskittyi agenttitehtäviin. Yleisen koodauksen rinnalla mukana oli kohdennettuja ympäristöjä ytimien optimointiin, verkkokehitykseen ja tietokoneavusteiseen suunnitteluun. Tämä selittää osaltaan, miksi parannukset näkyvät juuri agenttivertailuissa.
Menetelmä on kiinnostava myös laajemmin. Edellisen sukupolven mallin käyttäminen seuraavan opetusaineiston tuottamiseen on halvempaa kuin ihmisdatan kerääminen. Samalla se sitoo uuden mallin edeltäjänsä tapoihin, mikä voi rajoittaa todella uudenlaisten ratkaisujen syntymistä.

Hinta ja saatavuus kehittäjille
Grok 4.6 maksaa kaksi dollaria miljoonalta syötetokenilta ja kuusi dollaria miljoonalta tulostokenilta. Nopeasta variantista peritään kaksinkertainen hinta. Hinnoittelu asettuu selvästi kalleimpien huippumallien alapuolelle.
Malli on saatavilla Cursorissa, Grok Buildissa ja SpaceXAI:n omassa rajapinnassa. Lisäksi se välittyy OpenRouterin, Vercelin ja Cloudflaren kautta. Ensimmäisen viikon ajan Cursorissa ja Grok Buildissa on kaksinkertainen sisältyvä käyttökiintiö.
Hinnan merkitys korostuu juuri agenttikäytössä. Pitkät ajot kuluttavat tokeneita moninkertaisesti yksittäiseen kyselyyn verrattuna, joten tokenin hinta ratkaisee käytännön kustannukset. Halvempi malli voi olla kokonaistaloudellisesti järkevä silloinkin, kun se tarvitsee muutaman kierroksen enemmän.
Yhtiö kertoo myös laajentaneensa turvallisuustestausta. Julkaisua edelsi SpaceXAI:n mukaan sen tähänastisista laajin esijulkaisutestien sarja, jota täydentävät julkaisun jälkeinen ja kolmannen osapuolen testaus. Suojaukset on kalibroitu mallin kasvaneiden kykyjen mukaan.

Yhteenveto
Grok 4.6 ei mullista mallikenttää vaan kiristää sen kärkeä. Yleisindeksissä se yltää GPT-5.6 Sol Maxin tasolle ja jää pisteen päähän Fable 5 Maxista, mutta koodausvertailuissa hajonta on suurta.
Kehittäjälle kiinnostavinta on hinnan ja agenttikeston yhdistelmä. Kahden dollarin syötehinnalla pitkien ajojen ajaminen tulee halvemmaksi kuin kalleimmilla kilpailijoilla. Terminal-Bench-tulos muistuttaa silti, ettei malli ole vielä kaikilla osa-alueilla kärjessä.
