Anthropic julkaisi tiistaina Claude Opus 5.5:n, ensimmäisen mallin uudesta Claude 5.5 -perheestä. Yhtiön mukaan malli yltää useimmissa töissä Claude Fable 5.1:n tasolle. Sen ajaminen maksaa silti 40 prosenttia vähemmän kuin Opus 5:n.
Julkaisu on Anthropicin ensimmäinen sen jälkeen, kun yhtiö vaati tekoälykehityksen tahdin hidastamista. Se osui myös samaan päivään OpenAI:n oman mallijulkaisun kanssa. Molemmat yhtiöt lupasivat käytännössä samaa: hieman enemmän suorituskykyä selvästi pienemmällä hinnalla.
Hinta laski ja nopeus nousi
Syötetokenin hinta on nyt 4 dollaria ja tulostokenin 20 dollaria miljoonalta. Molemmat ovat 20 prosenttia halvempia kuin Opus 5:ssä. Suurin muutos koskee kuitenkin välimuistia.
Välimuistin lukeminen maksaa 0,20 dollaria miljoonalta tokenilta. Hinta putosi 60 prosenttia. Anthropicin mukaan juuri välimuistin luku muodostaa valtaosan agentti- ja koodaustyön kuluista, joten pitkät ajot halpenevat eniten.
Yhtiö kertoo mallin vaativan vähemmän laskentaa kuin Opus 5. Hinnoittelu heijastelee tätä suoraan. Oletusasetuksilla tyypillinen työkuorma maksaa noin 40 prosenttia vähemmän kuin ennen.
Nopeus parani samalla. Opus 5.5 tuottaa vastauksia yli 30 prosenttia nopeammin kuin edeltäjänsä. Anthropic nosti myös viiden tunnin käyttörajoja Pro-, Max-, Team- ja Enterprise-tilauksissa, ja tilaajat saavat käyttörajan nollauksen, jonka voi säästää myöhemmäksi.

Mitä vertailut ja testaajat kertovat
Anthropicin omissa mittauksissa Opus 5.5 johtaa agenttikoodauksessa, tietokoneen käytössä ja tietotyössä. Terminal-Bench 4.0 -testissä tulos on 66,4 prosenttia. Fable 5.1 jäi 55,8 prosenttiin ja GPT-6 Astra 57,9 prosenttiin.
CursorBench 4.0:ssa malli ylsi 57,8 prosenttiin ja FrontierCode-testissä 54,4 prosenttiin. Tietotyön GDPval-vertailussa pistemäärä nousi 1 846:een, kun Opus 5 jäi 1 708:aan. Tietokoneen käytön OSWorld 2.0 -testissä tulos oli 81,8 prosenttia.
Yhtiö varoittaa itse tulkitsemasta lukuja liian tarkasti. Näillä kyvykkyystasoilla vertailujen marginaalit ennustavat sen mukaan yhä huonommin todellista eroa käytännön työssä. Anthropicin oman käytön perusteella kuilu Opus 5.5:n ja Fable 5.1:n välillä on kapeampi kuin pisteet antavat ymmärtää.
Konkreettisemmat esimerkit tulevat varhaisilta testaajilta. Yksi heistä vei läpi 680 000 rivin koodimigraation alle vuorokaudessa, mikä olisi vienyt insinööritiimiltä viikkoja. Toisessa kokeessa mallia pyydettiin lyhentämään verkkosovelluksen latausaikoja jokaisella sivulla: Opus 5.5 onnistui 39 kertaa neljästäkymmenestä, kun Opus 5 sai aikaan pienempiä parannuksia ja muutti samalla sovelluksen toimintaa.

Turvallisuusarvio ja rajatut käyttöoikeudet
Anthropic kertoo Opus 5.5:n saaneen parhaat pisteet yhtiön automatisoidussa käyttäytymisauditissa. Testi ajaa mallin läpi tuhansia simuloituja tilanteita. Malli ryhtyy aiempia harvemmin vaikeasti peruttaviin toimiin ja pysyy paremmin sille annetuissa rajoissa.
Kestävyys kehotehyökkäyksiä vastaan parani Opus 5:een verrattuna. Yhtiö laajensi arviointinsa kattamaan myös pitkiä tehtäviä, mahdottomia tehtäviä ja oikeisiin tapauksiin perustuvia tilanteita. Ulkopuolisina arvioijina toimivat ennen julkaisua Frontier Design ja METR.
Biologiassa ja kyberturvallisuudessa Opus 5.5 vastaa kyvyiltään Claude Mythos 5.1:tä. Siksi se julkaistiin samoilla suojauksilla kuin Fable 5.1. Suojausten lauetessa kyberturvatehtävät ohjautuvat Opus 4.8:lle sekä biologian ja mallikehityksen tehtävät Opus 5:lle.
Hyväksytyt organisaatiot voivat hakea Life Sciences Verification Program -ohjelmaan biologian tutkimuskäyttöä varten. Kyberturvan vastaava ohjelma laajenee yhtiön mukaan lähiviikkoina. Anthropic myöntää itse, että laajennetullakin testauksella on rajansa.

OpenAI vastasi samana päivänä
Muutama tunti Opus 5.5:n jälkeen OpenAI julkaisi GPT-6 Solin ja Lunan. Sol maksaa 2 dollaria syötöstä ja 10 dollaria tulosteesta miljoonalta tokenilta. Tokenihinnaltaan se on puolet Opus 5.5:stä.
OpenAI:n vertailut oli kuitenkin tehty Opus 5:tä vastaan. Ne vanhenivat julkaisupäivänään. Kumpaakaan mallia ei ole vielä ajettu toistaan vastaan samoissa riippumattomissa testeissä.
Vertailu ei myöskään ratkea pelkällä tokenin hinnalla. Anthropic korostaa, että Opus 5.5 kuluttaa tehtävää kohden vähemmän tokeneita kuin edeltäjänsä. Tehtäväkohtainen kustannus voi siis erota listahinnasta selvästi molempiin suuntiin.
Claude Sonnet 5.5 ja Claude Haiku 5.5 seuraavat yhtiön mukaan lähiviikkoina. Nekin saavat samoja parannuksia suorituskykyyn, tehokkuuteen ja turvallisuuteen. Hintakilpailu jatkuu siis todennäköisesti myös halvemmissa malliluokissa.

Yhteenveto
Opus 5.5 siirtää Anthropicin kärkimallin hintatasolle, jolla pitkät agenttiajot ovat aiempaa edullisempia. Suurin yksittäinen muutos ei ole tokenin listahinta vaan välimuistin 60 prosentin halpeneminen, joka näkyy juuri koodaus- ja agenttityössä.
Avoimeksi jää, miten malli pärjää GPT-6 Solia vastaan riippumattomissa mittauksissa. Ensimmäiset vertailukelpoiset luvut ratkaisevat, kumpi kahdesta samana päivänä annetusta lupauksesta pitää paremmin.
