Specific Labs julkaisi Real-SWE-vertailun, joka ajaa koodausagentit yritysten lisensoiduilla tuotantokoodikannoilla julkisten GitHub-projektien sijaan. Tehtävät koskevat laskutusta, veroja, asiakasmigraatioita ja infrastruktuurimuutoksia. Paras tulos, Claude Codessa ajettu Fable 5.1, ratkaisi tehtävistä 38,8 prosenttia.
Luku on matala verrattuna julkisiin vertailuihin, joissa kärkimallit yltävät selvästi korkeammalle. Ero ei johdu mallien heikkenemisestä vaan siitä, mitä vertailussa mitataan.
Julkinen vertailu vuotaa koulutusdataan
Ongelma julkisissa vertailuissa on rakenteellinen. SWE-benchin kaltaiset testit rakentuvat avoimista repositorioista, joiden virheraportit ja korjauspatchit ovat verkossa kaikkien luettavissa. Sama aineisto päätyy myös mallien koulutusdataan.
Tällöin ei ole varmaa, ratkaiseeko agentti ongelman vai muistaako se korjauksen. Real-SWE sulkee tämän reitin pitämällä koodin ja ratkaisut poissa julkisesta verkosta.
Agentin on luettava järjestelmä, joka on sen edessä. Sen on pääteltävä koodikannan konventiot työtilasta eikä muistista. Specific Labsin mukaan juuri tämä erottaa tuotantotyön harjoitustehtävistä.
Lähestymistapa ei ole ainoa laatuaan. Scale AI:n SWE-Bench Pro sisältää 1 865 tehtävää 41 repositoriosta, joista 276 on kaupallisia. DeepSWE käyttää 113 alkuperäistä pitkän aikavälin tehtävää, ja CCBench noin 180 tehtävää käyttäjien omista lähetyksistä.

Fable 5.1 johtaa, mutta erot ovat kapeat
Julkaistulla tulostaululla kärjessä on Claude Codessa ajettu Fable 5.1 tuloksella 38,8 prosenttia. Toisena on GPT-6 Astra Codex CLI:n kanssa 33,8 prosentilla ja kolmantena Gemini 3.8 Flash Gemini CLI:llä 31,2 prosentilla. Neljäntenä tulee GLM 5.3 Claude Codessa 28,8 prosentilla.
Kärjen ja neljännen ero on kymmenen prosenttiyksikköä. Yksikään yhdistelmä ei ratkaise edes puolta tehtävistä.
Merkille pantavaa on mittaustapa. Specific ajaa jokaisen mallin sen omalla natiivilla koodausrungolla sen sijaan, että agenttikehys pidettäisiin vakiona. Mitattava yksikkö on siis malli ja runko yhdessä, ei malli erikseen.
Ratkaisu on perusteltu mutta kaventaa tulkintaa. Tulos kertoo, miten hyvin kokonaisuus toimii, mutta ei erota mallin ja rungon osuutta toisistaan. Aiemmat tutkimukset ovat osoittaneet rungon painavan pitkissä tehtävissä yllättävän paljon.

Ympäristöt jäljittelevät oikeaa tuotantoa
Real-SWE:n tehtäväympäristöt eivät ole riisuttuja hiekkalaatikoita. Ne voivat tarjota agentille PostgreSQL-, MySQL-, MongoDB- ja Redis-tietokantoja sekä Kubernetesin ja Dockerin.
Mukana voi olla myös yrityskäyttöön tarkoitettuja palveluita: Slack, Intercom, Google Drive ja ClickUp. Agentin on siis liikuttava koodin lisäksi niissä järjestelmissä, joissa työn konteksti oikeasti sijaitsee.
Tämä selittää osan matalista tuloksista. Laskutusmigraatio tai käyttöoikeussäännön muutos rajautuu harvoin yhteen tiedostoon. Se edellyttää tietoa siitä, mitä muut järjestelmät odottavat.
Juuri tällaista tietoa mallit eivät ole nähneet koulutuksessaan. Se on organisaation sisäistä ja usein dokumentoimatonta. Se elää käytännöissä eikä koodissa.

Vertailu toimii myös myyntikanavana
Real-SWE ei ole pelkkä mittari. Specificin Y Combinator -julkaisusivulla yhtiö kutsuu tekoälylaboratorioita lähettämään mallejaan arvioitaviksi tai pyytämään koko tehtäväjoukkoa koulutuskäyttöön.
Samalla se pyytää yrityksiä luovuttamaan koodikantojaan ja lupaa anonymisoinnin sekä tehtävien luottamuksellisen käsittelyn. Kumpikin tarjous kytkeytyy suoraan Specificin varsinaiseen liiketoimintaan, joka on datajoukkojen rakentaminen yritysten sisäisistä prosesseista.
Asetelma kannattaa pitää mielessä tuloksia lukiessa. Jokainen epäonnistunut laskutusmigraatio vahvistaa perustajien Janak Sunilin ja Siddhant Paliwalin myyntiargumenttia.
Se ei tee mittauksesta virheellistä. Se tekee siitä osapuolen, jolla on oma intressi lopputulokseen. Sama varaus koskee useimpia laboratorioiden itse julkaisemia vertailuja.

Yhteenveto
Real-SWE siirtää kysymyksen siitä, osaako agentti korjata tunnetun virheen, siihen, pärjääkö se vieraassa tuotantojärjestelmässä. Alle 40 prosentin kärkitulos kertoo, että ero näiden välillä on yhä suuri.
Kehittäjälle luku on hyödyllinen odotusten kalibrointiin. Agentti, joka ratkoo julkisesta vertailusta kaksi kolmesta, ei ratkaise samaa osuutta yrityksen omasta koodista. Vertailun arvo ratkeaa sillä, saako Specific kokoon riittävästi koodikantoja pitääkseen tehtäväjoukon edustavana.
