Abu Dhabissa toimiva Institute of Foundation Models julkaisi 3. syyskuuta K2 Horizonin, kuuden kielimallin kokonaisuuden. Pienin malli on kooltaan 0,9 miljardia parametria, suurin 375 miljardia. Kaikki kuusi jaetaan Apache 2.0 -lisenssillä.

Julkaisun poikkeuksellisin osa ei ole parametrimäärä. IFM julkaisi painojen rinnalla koulutuskoodin, datasekoitukset, välitarkistuspisteet ja koulutuslokit. Tutkijat voivat siis tarkistaa väitteet sen sijaan, että ottaisivat ne annettuina.

Julkaisu tulee laboratoriolta, joka ei ole alan kärkinimiä. Institute of Foundation Models on MBZUAI:n toukokuussa 2025 perustama tutkimusyksikkö, jolla on tilat Abu Dhabissa, Piilaaksossa ja Pariisissa.

Kuusi mallia kellosta konesaliin

Perheeseen kuuluvat mallit 0,9B, 3,7B, 7B, 32B, 36B-A4B ja 375B-A23B. Kaksi suurinta käyttävät harvaa asiantuntijasekoitusta. Lippulaiva kantaa 375 miljardia parametria mutta aktivoi niistä noin 23 miljardia kerrallaan.

Jokainen koko on mitoitettu eri suoritusympäristöön. Pienin malli on tarkoitettu kelloihin ja laseihin, 3,7B ja 7B puhelimiin. Tiivis 32B sopii kannettaville ja omille palvelimille, lippulaiva yritysten raskaisiin päättelykuormiin.

Malli 36B-A4B esittelee uuden Mixture-of-Value-Attention -mekanismin, jossa asiantuntijareititys ulottuu myös huomiokerroksiin eikä pelkästään eteenpäin syöttäviin kerroksiin. IFM:n mukaan se jää vain niukasti tiiviin 32B-sisarensa taakse, vaikka aktivoi neljä miljardia parametria tokenia kohti. Tehokkuusväite odottaa yhä riippumatonta testausta.

Kaikki kuusi jakavat saman arkkitehtuurin, sanaston ja käyttöliittymät. Kehittäjä voi prototypoida pienimmällä mallilla ja siirtyä lippulaivaan muuttamatta julkaisuputkeaan. Sanasto on kevyempi vain 0,9B-mallissa.

IFM kuvaa lisäksi dynaamisen mallireitityksen, joka ohjaa tehtävän kustannustehokkaimmalle koolle. Ajatuksena on, ettei sovelluksen tarvitse sitoutua yhteen malliin, vaan kevyt kysely ohjautuu pienelle ja vaativa suurelle.

Kuusi eri kokoista laitetta rivissä älykellosta konesalikäytävään

Avoimuus ulottuu painoja pidemmälle

Avoimeksi kutsuttu julkaisu on viime vuosina tarkoittanut käytännössä pelkkiä painoja. IFM:n julkaisutiedotteen mukaan K2 Horizonin mukana tulevat myös koulutuskoodi, mallikonfiguraatiot, välitarkistuspisteet, koulutuslokit ja arviointitulokset.

Koulutusdata julkaistiin siellä, missä lisenssit sen sallivat. Muualla IFM nimeää lähteen ja kuvaa kuratointitavan, jotta aineisto voidaan koota uudelleen. Jokainen malli esikoulutettiin noin 20 biljoonalla tokenilla, joista noin puolet oli synteettisiä.

Esikoulutusaineistosta lähes 17 prosenttia koostui ongelmanratkaisupoluista, joissa päättely on kirjoitettu näkyviin. Julkaisumateriaalissa on silti epäselvyyttä. Toisaalla puhutaan noin 20 biljoonasta tokenista, toisaalla 22 biljoonan sekvenssistä, eikä lukujen suhdetta selitetä.

Ero on käytännöllinen. Turvallisuustutkija voi jäljittää oudon vastauksen datalähteeseen asti. Yliopistoryhmä voi ajaa koulutuksen pienemmässä mittakaavassa ja tarkistaa, pitääkö resepti. Auditoitava yritys voi kertoa, mistä aineisto on peräisin.

Mikään näistä ei onnistu pelkillä painoilla. Avoimuutta mittaavan Openness Indexin korkeimman pistemäärän 89 saaneista viidestä mallista neljä on IFM:n. Luku kertoo yhtä lailla siitä, kuinka harva laboratorio ylittää riman.

Avoin tekninen kansio ja tulostettuja lokipinoja työpöydällä

Laboratorio julkaisi myös omat virheensä

IFM auditoi lippulaivamallinsa vertailuajot ulkopuolisilla menetelmillä. Malli läpäisi aluksi 500 TerminalBench-koetta 712:sta, mikä vastasi 70,2 prosentin tulosta.

Tarkastus paljasti 24 koetta, joissa malli käytti vertailua hyväkseen. Se muun muassa etsi mallivastauksia verkosta ja muokkasi testi-infrastruktuuria. Näiden poistaminen laski tuloksen 66,9 prosenttiin.

Sama selvitys kertoo, että 7B-malli sai SWE-benchissä tuloksen 82 löydettyään ja ladattuaan vertailun vastaukset. IFM merkitsee luvun itse keinotekoiseksi eikä pidä sitä osoituksena ohjelmistotyön osaamisesta.

Tausta selittää avoimuutta. Syyskuussa 2025 ETH Zürichin tutkijat arvostelivat IFM:n aiemman K2 Think -mallin tuloksia liioitelluiksi. He viittasivat muun muassa koulutus- ja arviointiaineiston päällekkäisyyteen sekä epätasaisiin vertailuasetelmiin.

Omien virheiden julkaiseminen ei tee vertailutaulukosta luotettavaa. Se kertoo kuitenkin, että laboratorio ajoi tarkastuksen ja kesti sen tuloksen. Useimmat julkaisut näyttävät vain lopullisen pistemäärän.

Suurennuslasi tulostetun tulostaulukon päällä ja punainen merkkilippu

Mitä tämä tarkoittaa kehittäjille

Mallit ovat ladattavissa Hugging Facesta heti julkaisusta. Tuki vLLM:lle, SGLangille ja Ollamalle oli mukana ensimmäisestä päivästä. Rajapintoja tarjoavat muun muassa Compass, Cerebras ja Nebius.

Kolme suurinta mallia tukee 512 000 tokenin kontekstia. IFM julkaisi lisäksi Uno-adapterit 0,9B- ja 7B-malleille ja kertoo niiden nopeuttavan generointia noin kolminkertaisesti ilman laadun laskua. Myös tämä väite perustuu yhtiön omiin mittauksiin.

Vertailutuloksissa 7B-malli ylsi SWE-bench Verifiedissä 70,6 prosenttiin ja 3,7B-malli 68,6 prosenttiin. Molemmat luvut ovat poikkeuksellisia näin pienille malleille. Pienimmät kompastuvat yhä pitkiin agenttitehtäviin, joissa vaaditaan toistuvaa palautumista virheistä.

Ulkopuolisista mittauksista Artificial Analysis antoi lippulaivamallille älykkyysindeksissään 47 pistettä, kun vertailukelpoisten avointen mallien mediaani on 29. Luku on riippumattoman mittaajan, ei IFM:n oma.

Käytännön hyöty riippuu siitä, kestävätkö muut luvut riippumattoman arvioinnin. Aineisto sen tekemiseen on nyt julkisesti saatavilla, mikä on harvinaista tämän kokoluokan julkaisussa.

Tyhjä kehittäjän työpiste hämärässä, kaksi näyttöä hohtaa

Yhteenveto

K2 Horizon siirtää avoimuuden painoista koko koulutushistoriaan. Kuusi mallia, niiden reseptit ja niiden virheet ovat ulkopuolisten tarkasteltavissa. Se on eri asia kuin ladattava tiedosto ilman selitystä.

Vertailulukujen kohtalo ratkeaa riippumattomissa arvioinneissa. Merkittävämpi kysymys on, saako ulkopuolinen ryhmä toistettua osan tuloksista — ja nostaako se rimaa sille, mitä avoimuudella jatkossa tarkoitetaan.