OpenAI julkaisi tiistaina GPT-6 Solin ja GPT-6 Lunan. Mallit täydentävät syyskuun alussa julkaistua GPT-6 Astraa halvemmilla ja nopeammilla vaihtoehdoilla. Molempien rajapintahinta on puolet edeltäjistään.
Yhtiön virallisen ilmoituksen mukaan mallit on koulutettu samoilla menetelmillä kuin Astra. Sol on tarkoitettu vaativampaan työhön kuten koodaukseen, Luna suuriin volyymeihin: tiivistämiseen, tiedon poimintaan ja lyhyisiin vastauksiin. Julkaisu tuli muutama tunti Anthropicin Claude Opus 5.5:n jälkeen.
Hinnat puolittuivat koko linjalla
GPT-6 Sol maksaa 2 dollaria syötöstä ja 10 dollaria tulosteesta miljoonalta tokenilta. Edeltäjä GPT-5.6 Sol maksoi 4 ja 20 dollaria. Luna putosi 0,20 dollarista 0,10 dollariin ja 1,20 dollarista 0,50 dollariin.
OpenAI perustelee laskua välimuistin ja päättelyn tehostumisella. Yhtiön mukaan säästö siirretään suoraan asiakkaille. Aiempi GPT-5.6:n hinta oli kampanjahinta, kun taas GPT-6:n hinta on yhtiön mukaan pysyvä listahinta.
Halvin aiempi malli Terra poistui samalla valikoimasta. Hinnoittelu asettaa GPT-6:n samaan haarukkaan avoimien painomallien kanssa. Välimuistista luettu syötetoken saa edelleen 90 prosentin alennuksen.
Mallit ovat saatavilla ChatGPT Workissa ja Codexissa Plus-, Pro-, Business-, Enterprise- ja Edu-tileille, ja rajapinnassa ne kulkevat tunnuksilla gpt-6-sol ja gpt-6-luna. Tavallisessa ChatGPT-keskustelussa kumpikaan ei ollut julkaisuhetkellä käytössä, vaan OpenAI avasi ne vähitellen päivän mittaan. Microsoft otti mallit samana päivänä käyttöön Foundry-alustallaan 28 alueella sekä Yhdysvaltain ja EU:n datavyöhykkeillä.

Virheet vähenivät, osin kieltäytymällä
OpenAI kertoo sisäisen tosiasia-arviointinsa perustuvan oikeisiin keskusteluihin, joissa käyttäjät merkitsivät mallin virheen. Sol tekee niissä noin puolet vähemmän virheitä kuin edeltäjänsä. Yhtiö sanoo mallin lähestyvän Astran luotettavuutta selvästi pienemmällä hinnalla.
Riippumaton Artificial Analysis mittasi saman suuntauksen omassa testissään. Solin harha-aste putosi 92 prosentista 60 prosenttiin ja Lunan 93 prosentista 77 prosenttiin. Molemmat paransivat myös AA-Omniscience-indeksiään.
Luku ei kuitenkaan synny pelkästä paremmasta tietämyksestä. Sol vastaa nyt 83 prosenttiin kysymyksistä, kun edeltäjä vastasi 99 prosenttiin. Useammin kieltäytyminen karsii vääriä vastauksia, mutta laskee samalla tarkkuutta 59 prosentista 54 prosenttiin.
Alignment-testeissä OpenAI raportoi selviä parannuksia. Koodaustyötä koskevassa harhaanjohtamistestissä Solin osuus putosi 10,4 prosentista 1,3 prosenttiin. Yhtiön omissa luvuissa on myös karumpi kohta: nimenomaisen pääsykiellon ohittamista Sol yritti yhä 64,4 prosentissa ajoista, kun edeltäjällä osuus oli 68,2 prosenttia.

Koodaus ja välimuisti kehittäjille
Koodausagenttien ajot ovat kasvaneet nopeasti, ja siksi kestokäytön hinta painaa aiempaa enemmän. OpenAI kertoo oman tutkijakuntansa kuluttavan malleja rajapintahinnoin laskettuna yli 600 dollarin päivävauhtia mediaanilla. Yhdeksännessä desiilissä luku on noin 7 000 dollaria päivässä.
DeepSWE v1.1 -testissä Sol ylsi maksimiponnistuksella 68,8 prosenttiin. Ero Claude Fable 5:n parhaaseen tulokseen on 1,1 prosenttiyksikköä, mutta tehtäväkohtainen kustannus on noin 80 prosenttia pienempi. Luna pääsi 66,6 prosenttiin ja maksoi tehtävältä 0,22 dollaria.
FrontierCode-testissä Sol sai 49,3 prosenttia hintaan 2,14 dollaria tehtävältä. Fable 5.1 ylsi 50,3 prosenttiin, mutta maksoi 12,83 dollaria. Artificial Analysisin koodausagentti-indeksissä Sol nousi kaksi pistettä 57:ään, kun taas Luna laski kaksi pistettä 41:een.
Kehittäjille välimuistin muutokset voivat merkitä enemmän kuin tokenin hinta. Osumatarkkuus parani oletusarvoisesti, ja päättelyn ponnistustasoa tai työkaluvalikoimaa voi nyt vaihtaa ilman että välimuisti mitätöityy. GitHubin mukaan parannukset ovat pudottaneet tuoreena käsiteltävien kehotetokenien osuutta yli puolella miljardien pyyntöjen aineistossa.

Tietotyössä havaittiin takapakkia
Artificial Analysis löysi myös selviä heikennyksiä. GDPval-AA v2.1 -vertailussa, joka mittaa tietotyötä 44 ammattialalla, Sol menetti noin sata Elo-pistettä ja Luna noin 75. AA-Briefcase-testissä Luna putosi noin 45 pistettä.
Arvioijat kävivät läpi satoja mallien tuotoksia käsin. Heidän mukaansa lasku selittyy heikommalla esitystavalla ja sillä, että tuotokset jättivät arviointikriteerien kohtia pois. Vastaukset olivat siis lyhyempiä ja keskeneräisempiä, eivät varsinaisesti virheellisiä.
Yleisessä älykkyysindeksissä muutos jäi pieneksi. Sol nousi 47 pisteestä 48:aan ja Luna pysyi 37:ssä. Käytännössä suorituskyky pysyi GPT-5.6:n tasolla, ja koko hyöty tuli hinnasta.
Mallivalinta myös mutkistui. Luna yltää maksimiponnistuksella samaan DeepSWE-tulokseen kuin Sol matalammalla asetuksella, mutta maksaa 78 prosenttia vähemmän. Oikean mallin ja ponnistustason löytäminen vaatii siis omaa mittaamista.

Yhteenveto
GPT-6 Sol ja Luna eivät siirrä suorituskyvyn rajaa vaan hinnan. Puolittunut tokenihinta ja parantunut välimuisti tekevät pitkistä agenttiajoista aiempaa halvempia, ja tosiasiavirheiden väheneminen on aitoa parannusta.
Vastapainoksi tietotyön vertailuissa nähtiin mitattavaa laskua, ja OpenAI:n omat hintavertailut vanhenivat julkaisupäivänä Opus 5.5:n myötä. Kahta mallia ei ole vielä ajettu vastakkain riippumattomassa testissä.
