Amazon julkaisi 21. elokuuta SOP-Bench-vertailun, joka mittaa tekoälyagenttien kykyä noudattaa yritysten oikeita työohjeita. Aineistossa on yli 2 000 tehtävää kahdeltatoista toimialalta.
Tulos yllätti tekijät itsensä. Yhdentoista kärkimallin testeissä uudempi malli ei aina pärjännyt vanhempaa paremmin, ja työkalujen lisääminen saattoi jopa laskea onnistumisprosenttia.
Mikä SOP-Bench on
Lyhenne SOP tulee sanoista standard operating procedure eli vakioitu työohje. Kyse on kirjatusta askelsarjasta, jolla organisaatio hoitaa toistuvan työn samalla tavalla joka kerta.
Esimerkkejä riittää joka toimialalta. Sairaala kirjaa uuden potilaan työohjeen mukaan, logistiikkatiimi päättää sen avulla onko lähetys vaarallista ainetta, pankki tunnistaa uuden yritysasiakkaan ja moderointitiimi ratkaisee sisällön poistamisen.
SOP-Bench yhdistää aidot ohjeet toimiviin työkaluihin ja tunnettuihin oikeisiin vastauksiin. Agentti ansaitsee pisteensä suorittamalla menettelyn loppuun, ei tuottamalla tekstiä joka sattuu miellyttämään automaattista arvostelijaa.
Vertailu esiteltiin KDD 2026 -konferenssissa. Aineisto, työkalut, kaksi perusagenttia ja arviointikoodi ovat saatavilla GitHubissa ja Hugging Facessa.

Miksi aiemmat vertailut jäävät vajaiksi
Useimmat agenttivertailut testaavat yhtä kykyä kerrallaan. Yksi tarkistaa, osaako malli valita oikean rajapinnan, toinen mittaa annettujen rajoitteiden noudattamista ja kolmas askelten suunnittelua kohti tavoitetta.
Ongelma piilee syötteessä. Testit käyttävät siistiä, koneellisesti muotoiltua kehotetta, josta puuttuu ihmisen kirjoittaman ohjeen monitulkintaisuus ja vaihtelu.
Oikea työohje näyttää siistimmältä kuin on. Amazonin esimerkki potilaan kirjaamisesta pyytää varmistamaan vakuutuksen kahdesti kertomatta miten tai miksi. Kokenut työntekijä tietää, että ensimmäinen vaihe varmistaa kattavuuden vakuutusyhtiöltä ja toinen sen, että tiedot kirjautuivat oikein järjestelmään.
Agentilla ei ole tätä taustatietoa. Sen on arvattava mitä varmistaminen tässä kohdassa tarkoittaa, muistettava mitä se teki aiemmin ja valittava lähes identtisten työkalujen väliltä. Tässä kohdassa kiillotettu demo hajoaa hiljaa.

Yksitoista mallia, yllättävät tulokset
Amazon ajoi testit kahdella tarkoituksella yksinkertaisella agenttirakenteella. Toinen nojaa funktiokutsuihin, toinen päättelytyyliseen työskentelyyn.
Kiinnostavin havainto koski mallin päivittämistä. Päättelytyylisellä agentilla uudempi Claude 4.5 -perhe jäi vanhemman Claude 4 -perheen taakse. Sama käänteisyys toistui verrattaessa yksittäisiä malleja samassa kokoonpanossa.
Työkalujen lisääminen ei sekään auttanut automaattisesti. Useammat vaihtoehdot laskivat joissakin tapauksissa onnistumisprosenttia, koska valinta lähes samanlaisten työkalujen välillä vaikeutui.
Mikään malli-agentti-yhdistelmä ei myöskään ollut paras kaikissa menettelyissä. Toimialakohtaiset erot olivat riittävän suuria, ettei yhtä voittajaa voi nimetä.

Mitä tämä tarkoittaa automaatiohankkeille
Tuotannossa agentteja ajavalle tiimille tämä on koko tutkimuksen tärkein havainto. Rutiininomainen mallipäivitys voi laskea onnistumisprosenttia ilman mitään selvää merkkiä siitä, että jokin muuttui.
Ainoa luotettava tapa huomata muutos on testata niillä menettelyillä, joita tiimi oikeasti ajaa. Yleinen vertailupistemäärä ei kerro, toimiiko agentti juuri sen laskutusprosessissa tai reklamaatioketjussa.
Käytännössä tämä tarkoittaa omaa regressiotestistöä. Kirjaa organisaation keskeiset työohjeet, rakenna niille tarkistettavat oikeat vastaukset ja aja setti läpi ennen jokaista mallinvaihtoa.
SOP-Bench tarjoaa tähän valmiin rungon. Kehykseen voi liittää omat agentit tai laajentaa sen uusille toimialoille samalla menetelmällä, jolla Amazon rakensi alkuperäiset menettelyt.

Yhteenveto
SOP-Bench siirtää agenttien arvioinnin demoista siihen työhön, jota organisaatiot oikeasti tekevät. Tulokset ovat vaatimattomampia kuin markkinointipuhe antaa ymmärtää.
Tärkein opetus ei ole yksittäinen pistemäärä vaan menetelmä. Ennen kuin agentti päästetään tuotantoon, se pitää mitata omilla työohjeilla ja mitata uudelleen aina kun malli vaihtuu.
