Kiinalainen tutkimusryhmä AllSpark julkaisi Iris-mini- ja Iris-pro-mallien painot Hugging Facessa. Kyse on hakuagenteista, jotka on koulutettu päättämään, mitä haetaan, miten tulokset luetaan ja milloin kerätty näyttö riittää. Syyskuun alussa ilmestynyt paperi Iris: Climbing to the Search Frontier lupasi painot vasta myöhemmin, ja nyt ne ovat ladattavissa.

Julkaisu on merkittävä kahdesta syystä. Mallit vievät tekijöiden mukaan avointen hakuagenttien kärkipaikan omissa kokoluokissaan neljässä vertailussa. Mukana tulee myös Iris Harness -ajoympäristö, jolla luvut voi yrittää toistaa itse.

Kaksi kokoluokkaa samasta reseptistä

Iris-mini rakentuu Qwen3.6-35B-A3B-mallin päälle ja Iris-pro Qwen3.5-397B-A17B:n päälle. Molemmat ovat Mixture of Experts (MoE) -malleja, joissa vain osa parametreista aktivoituu kerrallaan. Pienemmässä aktivoituu noin kolme miljardia parametria, isommassa 17 miljardia.

Aktivoituvien parametrien määrä ratkaisee ajokustannuksen. Iris-mini pyörii kolmen miljardin aktiivisen parametrin budjetilla, joten se on ajettavissa selvästi kevyemmällä kokoonpanolla kuin kokonaisparametrimäärä antaisi ymmärtää. Iris-pron 17 miljardia aktiivista parametria vaatii jo usean näytönohjaimen rinnakkaisajon.

Kontekstin pituus on molemmissa 256 000 tokenia. Hakuagentille se on olennaista, koska yksi tehtävä voi vaatia kymmeniä hakuja ja pitkiä sivulatauksia. Konteksti täyttyy nopeasti, jos jokainen haettu sivu jää muistiin kokonaisena.

Kokoluokkien ero ei ole pelkkä hintakysymys. AllSparkin mukaan sama koulutusresepti tuotti molemmissa saman käyttäytymisen. Pienempi malli on siis aito vaihtoehto silloin, kun 397 miljardin parametrin ajaminen ei ole realistista.

Kaksi erikokoista palvelinyksikköä vierekkäin viileässä konesalissa

Tulokset neljässä hakuvertailussa

Ryhmä mittasi mallit BrowseComp-, BrowseComp-ZH-, DeepSearchQA- ja Humanity's Last Exam -vertailuilla. Kontekstinhallinta päällä Iris-mini sai tulokset 82,2, 84,8, 86,9 ja 52,3. Iris-pro nousi lukemiin 88,6, 85,1, 92,9 ja 56,4.

Vertailut ovat vaativia. BrowseComp ja sen kiinankielinen versio mittaavat monivaiheista tiedonhakua verkosta, ja Humanity's Last Exam on suunniteltu nimenomaan kaatamaan nykyiset mallit. Yli 80 prosentin tulokset kahdessa ensimmäisessä ovat siksi huomionarvoisia.

Omassa kokoluokassaan Iris-mini johtaa kolmessa vertailussa neljästä. BrowseCompissa ero seuraavaan avoimeen malliin on 3,4 pistettä, mutta DeepSearchQA:ssa se jää taakse. Iris-pro johtaa tai on tasoissa isommassa luokassa ja lähestyy paikoin järjestelmiä, jotka vaativat selvästi enemmän laskentaa.

Ryhmä raportoi myös sivuvaikutuksen. Sama koulutusaineisto paransi tuloksia tehtävissä, joihin malleja ei erikseen opetettu, kuten yleisessä työkalujen käytössä ja toimistotyössä. Hakuun opetettu päättelysilmukka näyttää siis siirtyvän muihinkin tehtäviin.

Luvut kannattaa lukea yhdellä varauksella. Kaikki tulokset tulevat tekijöiden omista ajoista, ja ne on mitattu yhdellä ReAct-agentilla ilman aliagentteja tai vastausten jälkitarkistusta. Jokainen vertailu ajettiin sekä kontekstinhallinnalla että ilman sitä, koska se vaikuttaa tuloksiin enemmän kuin useimmat järjestelmien väliset erot.

Neljä eri korkuista hehkuvaa lasipylvästä tummalla heijastavalla pinnalla

Tehtävät rakennettiin linkkirakenteesta takaperin

Koulutusaineiston rakennustapa on julkaisun kiinnostavin osa. Ryhmä poimi siemensivun ja sen ulkoiset linkit, tiivisti niistä entiteettiverkon ja kirjoitti sen päälle monivaiheisia kysymysketjuja. Jokainen muu entiteetti kuin vastaus korvattiin kuvailevalla viittauksella.

Tarkoitus on estää oikaisut. Jos kysymyksessä mainitaan kaupunki nimeltä, malli voi löytää vastauksen pelkällä merkkijonohaulla. Kuvaileva viittaus pakottaa päättelemään, mistä kohteesta on kysymys.

Mukaan hyväksyttiin vain kysymykset, joihin verrokkimalli ei osannut vastata ulkomuistista mutta osasi, kun näyttö annettiin sille. Syntyneet suoritusketjut suodatettiin kahdesti: ensin kokonaisuutena ja sitten vuoro kerrallaan tuomarimallilla, jonka arviointiohje johdettiin aineistosta eikä kirjoitettu käsin.

Toinen vaihe on vahvistusoppiminen oikeaa hakua vasten. Palkintotuomari ja havaintojen tiivistäjä ajettiin koulutusklusterin sisällä, ja liian pitkät ajot keskeytettiin pyyntötasolla ja jatkettiin siitä, mihin ne olivat ehtineet. Vaiheita vuoroteltiin menetelmällä, jota tekijät kutsuvat SFT-RL-kiipeämiseksi: kunkin kierroksen vaikeimmat ratkaistut ja tehokkaimmat ajot palautetaan seuraavaan ohjattuun vaiheeseen.

Hehkuvista lasiaskelmista koostuva kierreportaikko nousee pimeässä tilassa

Ajoympäristö tuli mukaan, koulutusputki ei

Julkaisuun kuuluu Iris Harness: agenttisilmukka, työkalut, kontekstinhallinnan strategiat sekä kaikki neljä vertailua arviointiskripteineen. Ajoympäristö toimii mitä tahansa OpenAI-yhteensopivaa rajapintaa vasten, joten se ei ole sidottu Iris-malleihin.

Painot löytyvät Hugging Facesta ja koodi GitHubista. Mallikorttien esimerkit käynnistävät palvelimen SGLangilla, mikä kertoo kohdeyleisöstä. Tämä on tarkoitettu omalle raudalle, ei valmiiksi hinnoitelluksi rajapinnaksi.

Käytännössä julkaisu palvelee kahta ryhmää. Tutkijat saavat vertailukelpoisen arviointialustan, jolla omia hakuagentteja voi mitata samoilla säännöillä. Yrityksille kiinnostavampi on se, että hakuagentti on nyt ajettavissa kokonaan omassa ympäristössä, jolloin haetut dokumentit eivät kierrä ulkopuolisen palvelun kautta.

Kaikkea ei vielä annettu. Aineiston rakennus- ja koulutusputket on ryhmän mukaan tarkoitus julkaista myöhemmin. Toistettavuuden kannalta se on iso puute: arviointi voidaan toistaa nyt, koulutus ei.

Avattu puinen kuljetuslaatikko työpöydällä, osa lokeroista yhä tyhjinä

Yhteenveto

Iris-julkaisu ei tuo markkinoille uutta huippumallia vaan siirtää avointen hakuagenttien rajaa ylöspäin kahdessa kokoluokassa. Paketin arvokkain osa eivät ole painot vaan ajoympäristö, joka tekee lukujen tarkistamisesta mahdollista muillekin.

Seuraava kysymys on, pitävätkö tulokset kolmannen osapuolen ajoissa. Kun koulutusputki joskus julkaistaan, nähdään myös, siirtyykö SFT-RL-kiipeäminen muille pohjamalleille.