OpenAI julkaisi torstaina GPT-6 Astran, yhtiön uuden lippulaivamallin. Yhtiö kuvaa sitä sukupolven harppaukseksi kyberturvallisuudessa, ammattityössä, ohjelmistokehityksessä ja tietokoneen käytössä. Edellisestä numeroidusta sukupolvesta eli GPT-5:stä on kulunut reilu vuosi.
Julkaisu ei avautunut kerralla kaikille. Ensimmäisinä mallin saivat OpenAI:n Daybreak-ohjelman kyberturva-asiakkaat. Plus-, Pro-, Business- ja Enterprise-käyttäjille sekä rajapintaan ja AWS:ään malli tulee lähipäivinä.
Julkaisu alkoi yritysasiakkaista
OpenAI:n oman ilmoituksen mukaan Pro-, Business- ja Enterprise-käyttäjät saavat myös järeämmän GPT-6 Astra Pron. Rajapinnan asiakkaille luvataan Astra ilman datan säilytystä, jos ehdot täyttyvät. Tämän sukupolven mallistossa ei ole Luna-, Terra- eikä Sol-versioita, vaan pelkkä Astra ja Astra Pro.
Hinta asettuu kymmeneen dollariin miljoonalta syötetokenilta ja viiteenkymmeneen miljoonalta tuotostokenilta. Se on noin 2,5-kertainen GPT-5.6 Solin kampanjahintaan verrattuna. Samalla se osuu käytännössä samaan kohtaan kuin Anthropicin Claude Fable 5.1.
Astra saa myös uuden tavan käsitellä pitkiä työjaksoja. Malli voi kirjoittaa muistiinpanoja kontekstien yli ja hakea aiempia viestejä sekä työkalujen tuotoksia. Ominaisuus on toistaiseksi kokeellinen ja kytketään päälle config.toml-asetuksesta.
OpenAI aikoo tehdä siitä Astran oletuksen lähiviikkoina. Muutos on merkittävä pitkissä agenttiajoissa, joissa konteksti loppuu tyypillisesti kesken. Aiemmin ratkaisu oli tiivistää historia, nyt malli voi palata alkuperäiseen.

Koodaus ja agenttitehtävät harppasivat
Astra sai DeepSWE v1.1 -testissä 74,1 prosenttia, kun GPT-5.6 Sol ylsi 70,8 prosenttiin. Testi sisältää 113 agenttikoodaustehtävää. Meta raportoi alkuviikosta Muse Spark 1.3:lle 75,4 prosenttia korkeimmalla päättelyasetuksella, mutta se asetus on vielä turvallisuusarvioinnissa.
Työpöytätehtävissä ero edeltäjään on selvempi. OSWorld V2-Offline -testissä Astra ylsi 72,6 prosenttiin ja Sol 65,7 prosenttiin. Samalla keskimääräinen tehtäväaika putosi noin 75 minuutista 40 minuuttiin.
OpenAI muutti myös Codexin harnessia eli agentin ympärille rakennettua ajoympäristöä. Mind2Web-testissä Astra uudella harnessilla suoritti tehtävät 1,9 kertaa nopeammin kuin nykyinen Sol-pohjainen kokoonpano. Harnessin osuus lopputuloksesta on viime kuukausina noussut yhtä tärkeäksi kuin itse malli.
Yksi muutos kohdistuu suoraan tuttuun kipupisteeseen. Astra voi esittää käyttäjälle kysymyksen ja jatkaa samalla työtä, joka ei riipu vastauksesta. Aiemmin yksi ratkaisematon päätös pysäytti koko tehtävän.

Kyberkyvyt siirsivät julkaisua
Astra on ensimmäinen OpenAI:n malli, joka ylittää yhtiön Preparedness Frameworkin kriittisen tason kyberturvallisuudessa. Käytännössä se tarkoittaa, että malli löytää ennestään tuntemattomia haavoittuvuuksia ja ketjuttaa niistä toimivia hyökkäyksiä ilman vaiheittaista ihmisohjausta. Aiemmat mallit tarvitsivat ihmisen osoittamaan kohteen.
Testeissä Astra sai ExploitBench-vertailusta täydet sata prosenttia. Tuloksen varmistamiseksi OpenAI rakensi toisen kokeen kahdestakymmenestä tuoreesta Googlen V8-moottorin haavoittuvuudesta. Astra löysi ja ketjutti kaksi ennestään tuntematonta nollapäivähaavoittuvuutta, joita yhtiö kertoo yhä ilmoittavansa ylläpitäjille.
Kyvyt viivästyttivät julkaisua. OpenAI keskeytti Astran kehityksen elokuussa, kun kyberkyvyt kehittyivät odotettua nopeammin. Yhtiö piti tällä viikolla erillisen tiedotustilaisuuden pelkästään turvallisuustyökalujen parantamisesta.
Valvontaan luvataan ympärivuorokautinen eskalointi ja nopea reagointi, ja tutkijoille ilmoitetaan huolista puolessa tunnissa. Edistyneimmät kyberkyvyt avataan aluksi vain valikoiduille puolustajille Daybreak Blue -ohjelman kautta. Käyttökohteita ovat haavoittuvuuksien varmistaminen, haittaohjelma-analyysi ja havainnointisääntöjen rakentaminen.

Mitä vertailuluvut kertovat kilpailusta
Näyttävin yksittäinen luku on 98,6 prosenttia ARC-AGI-3-testistä. Numeroa kannattaa lukea varauksella. OpenAI ajoi Astran Responses-rajapinnan harnessilla, joka säilyttää päättelyn vuorojen välillä ja tiivistää pitkää kontekstia, joten vertailu mittaa mallia ja agenttijärjestelmää yhdessä.
Tiedetehtävissä ero kilpailijaan on iso. Terminal-Bench Science -testissä Astra sai 64,6 prosenttia, kun Anthropic raportoi Claude Fable 5.1:lle 52,6 prosenttia. Julkisen tulostaulun kärki on ollut 30 prosentin tuntumassa.
BenchCAD-vertailussa Astra ylsi 95,9 prosenttiin, Fable 5.1 84,3:een ja Sol 83,3:een. Testissä malli rakentaa CAD-ohjelman renderöidyistä näkymistä. OpenAI huomauttaa, että Claude-tulokset ajettiin muokatuilla asetuksilla.
Astra oli The New Stackin raportoinnin mukaan OpenAI:n tähän asti suurin koulutusajo. Yhtiö esikoulutti mallia ensimmäistä kertaa yli 100 000 näytönohjaimella Texasin Stargate-laitoksessa. Aiemmat mallit osallistuivat merkittävässä roolissa koulutuksen valvontaan.

Yhteenveto
GPT-6 Astra on kaksi asiaa yhtä aikaa. Se on selvä parannus koodauksessa, työpöytätehtävissä ja pitkissä agenttiajoissa. Samalla se on ensimmäinen malli, jonka jakelua rajoitetaan sen kyberkyvykkyyden takia. Nämä eivät ole toisistaan erillisiä, sillä sama kyky lukea ja muokata monimutkaisia järjestelmiä tuottaa molemmat.
Kehittäjän kannalta olennaista on, mitä rajapinnasta lopulta saa ja millä hinnalla. Vertailulukuihin sisältyy harness- ja asetusvalintoja, joten oman työkuorman testaaminen kertoo enemmän kuin tulostaulu. Hinnoittelu asettuu samaan luokkaan Anthropicin kärkimallin kanssa, joten valinta ratkeaa käytännön tuloksilla.
