Anthropic julkaisi maanantaina 28. syyskuuta Claude Sonnet 5.5 -mallin. Kyseessä on yhtiön keskitason malli, joka sijoittuu järeän Opuksen ja kevyen Haikun väliin. Anthropicin mukaan Sonnet 5.5 toimii noin 30 prosenttia edeltäjäänsä nopeammin ja maksaa tyypillisissä käyttötapauksissa jopa 30 prosenttia vähemmän.
Julkaisu on osa kiivasta mallikilpailua, jossa suuret tekoälylaboratoriot päivittävät tuotteitaan muutaman kuukauden välein. Sonnet on Anthropicin malliperheen työjuhta, jota käytetään laajasti tuotannossa ja agenttien moottorina.
Edellinen versio, Sonnet 5, julkaistiin vain noin kolme kuukautta sitten. Sen myyntivaltti oli agenttien edullinen ajaminen. Uusi versio jatkaa samalla linjalla, mutta painopiste on nyt nopeudessa ja siinä, kuinka vähän tokeneita malli kuluttaa tehtävän ratkaisemiseen.
Nopeus on uuden mallin päävaltti
Anthropic kuvaa Sonnet 5.5:ttä arkityön kumppaniksi. Malli on suunniteltu hyvin rajattuihin tehtäviin, kuten ohjelmointiin, dokumenttien laatimiseen, esitysten tekemiseen ja tiedon analysointiin. Yhtiö lupaa, että luonnokset vaativat aiempaa vähemmän siistimistä, koska mallin kirjoitustyyli on selkeämpi ja suorempi.
Nopeusero näkyy erityisesti agenttityössä. Malli ratkaisee tehtävät aiempaa harvemmilla ja varmemmilla askelilla. Erään asiakkaan koodaustesteissä työkalukutsuja tarvittiin kolmanneksen vähemmän ja komentorivin ajoja noin puolet aiempaa vähemmän.
API-käyttäjät voivat säätää tarkasti, kuinka paljon malli käyttää päättelyyn. Näin kehittäjä voi valita yksinkertaisiin kysymyksiin nopean vastauksen ja vaativiin tehtäviin pidemmän harkinnan. Malli on käytössä tunnisteella claude-sonnet-5-5.
Asiakkaiden kokemukset tukevat lupausta. Eräs asiakaspalvelualusta kertoi tikettien käsittelyn nopeutuneen 20 prosenttia, ja toinen yritys arvioi agenttiensa toimivan jopa 30 prosenttia Sonnet 5:tä nopeammin. Eräs testaaja kertoi myös, että Sonnet 5:n taipumus turvautua verkkohakuun liian usein on uudessa mallissa poistunut.

Hinta ja tokenien kulutus laskevat
Sonnet 5.5:n listahinta on 2 dollaria miljoonalta syötetokenilta ja 10 dollaria miljoonalta tulostetokenilta. Kehotteiden välimuistitus eli prompt caching voi pudottaa kuluja jopa 90 prosenttia, ja eräajona tehtävät kyselyt maksavat puolet vähemmän. Jos laskenta on pidettävä Yhdysvalloissa, hinta on 1,1-kertainen.
Todellinen säästö syntyy kuitenkin siitä, että malli tarvitsee vähemmän tokeneita samaan lopputulokseen. Eräs finanssialan testaaja raportoi, että Sonnet 5.5 käytti noin 121 000 tokenia vastausta kohden, kun Sonnet 5 kulutti samaan tehtäväsarjaan 497 000 tokenia. Laatu oli silti edeltäjää parempi.
Malli on saatavilla Claude.ai-palvelussa verkossa sekä iOS- ja Android-sovelluksissa. Kehittäjät pääsevät siihen käsiksi Anthropicin omalla alustalla sekä Amazon Web Servicesin, Google Cloudin ja Microsoft Foundryn kautta.
Hinnoittelulla on suuri merkitys, sillä keskitason malleista käydään kovaa kisaa. OpenAI julkaisi viime viikolla päivitetyt Sol- ja Luna-mallinsa, jotka kilpailevat suoraan samasta asiakaskunnasta. Anthropic vastaa kisaan painottamalla kokonaiskustannusta eikä pelkkää tokenihintaa.

Koodauksessa Sonnet haastaa Opuksen
TechCrunchin mukaan Anthropicin omat vertailut näyttävät Sonnet 5.5:n suoriutuvan agenttimaisesta koodauksesta paremmin kuin yhtiön lippulaivamalli Opus 5.5. Selitys on todennäköisesti hinnassa: halvempi malli voi käynnistää useita rinnakkaisia agentteja ilman, että kustannusraja tulee vastaan.
Cursor-editorin tekijät kertovat, että malli saavutti CursorBench 4.0 -testissä 55,5 prosentin tuloksen. Parempaan pääsi vain Opus 5.5. Toisessa asiakastestissä Sonnet 5.5 rakensi 118 sovellusta Opus 5:n tasoisina, mutta tarvitsi keskimäärin 3,6 iteraatiota, kun Opus 5 tarvitsi 7,7.
Anthropic korostaa, että malli perehtyy koodikantaan nopeasti, rajaa muutokset ennen aloittamista ja pitää muokkaukset niin pieninä, että ne on helppo katselmoida. Tämä tekee siitä houkuttelevan vaihtoehdon päivittäiseen kehitystyöhön, kuten ominaisuuksien rakentamiseen ja virheiden korjaamiseen.

Kyberkyvyt toivat tiukemmat suojaukset
Suorituskyvyn kasvulla on myös kääntöpuolensa. Anthropicin mukaan Sonnet 5.5:n kyberturvallisuuskyvyt ovat verrattavissa Opus 5:n kykyihin. Siksi se on ensimmäinen Sonnet-malli, johon sovelletaan samoja kyberturvasuojauksia kuin Fable- ja Opus-malleihin.
Käytännössä tämä tarkoittaa, että mallin käyttöä hyökkäyksellisiin tietoturvatehtäviin rajoitetaan samoin keinoin kuin yhtiön järeimmissä malleissa. Päätös heijastaa alan laajempaa huolta siitä, että yhä halvemmat mallit tuovat edistyneet kyvyt myös väärinkäyttäjien ulottuville.
Anthropic julkaisi mallin rinnalle järjestelmäkortin, jossa turvallisuustestien tulokset käydään läpi tarkemmin. Yhtiö kertoi lisäksi julkaisevansa uuden version pienimmästä Haiku-mallistaan tulevien viikkojen aikana, mutta tarkkaa päivämäärää ei kerrottu.

Yhteenveto
Claude Sonnet 5.5 on nopeampi, halvempi ja säästeliäämpi kuin kolme kuukautta sitten julkaistu Sonnet 5. Hinta on 2 dollaria syötteen ja 10 dollaria tulosteen miljoonalta tokenilta, ja agenttikoodauksessa malli pärjää yhtiön omissa testeissä jopa Opus 5.5:ttä paremmin.
Kehittäjille ja yrityksille julkaisu tarkoittaa, että yhä suurempi osa arkisesta koodaus- ja toimistotyöstä onnistuu keskitason mallilla. Kyberkykyjen kasvu toi kuitenkin mukanaan tiukemmat rajoitukset, ja seuraavaksi vuorossa on uusi Haiku.
