IBM julkaisi tiistaina Granite 4.2 -malliperheen. Kyseessä on yhtiön ensimmäinen tiheä, pelkkään dekoodaukseen perustuva päättelymalliperhe, ja se ilmestyi kolmessa koossa: 3, 8 ja 30 miljardia parametria. Painot julkaistiin Apache 2.0 -lisenssillä.
Julkaisu jatkaa IBM:n avointa mallilinjaa, mutta siirtää painopistettä. Aiemmat Granite-sukupolvet myytiin ohjeita seuraavina avustajina. Nyt kärjessä on eksplisiittinen päättely ja toiminta agenttiympäristöissä.
Samana päivänä yhtiö julkaisi myös Granite Speech 5.0 -puhemallin, joka sai oman erillisen tiedotteensa. Kielimallien puolella vuoro on nyt päättelyllä.
Kolme kokoa ja kytkettävä päättely
Jokaisessa kolmessa mallissa on kytkettävä ajattelutila. Käyttäjä voi siis päättää tapauskohtaisesti, tuottaako malli näkyvän päättelyketjun ennen vastausta vai vastaako se suoraan.
Ratkaisu on ennen kaikkea kustannuskysymys. Päättelyketju kuluttaa tokeneita ja aikaa, eikä sitä tarvita yksinkertaisissa tehtävissä. Sama malli palvelee siten sekä nopeaa luokittelua että monivaiheista ongelmanratkaisua.
Vastaava kytkin on nähty muissakin viime kuukausien julkaisuissa. Granitessa erikoista on se, että tila kuuluu jokaiseen kokoon myös pienimpään. Kolmen miljardin parametrin malli voi siis päätellä silloin, kun tehtävä sitä vaatii, ja vastata muuten suoraan.
Kolmen koon jako seuraa tuttua logiikkaa. Kolmen miljardin parametrin malli on tarkoitettu kevyeen käyttöön, esimerkiksi laitteelle tai reunapalvelimelle. Kolmenkymmenen miljardin lippulaiva on mitoitettu yhdelle usean näytönohjaimen palvelinsolmulle.
Lippulaiva ei ole rakennettu tyhjästä. Mallikortin mukaan 30B-versio jälkikoulutettiin Granite 4.1:n 30 miljardin parametrin pohjamallista. Mallit on testattu kahdellatoista kielellä, joukossa englanti, saksa, japani, arabia, korea ja kiina.

Vahvistusoppiminen oikeissa ympäristöissä
Julkaisun teknisesti kiinnostavin osa koskee kahta suurempaa mallia. Ne vietiin vahvistusoppimisen läpi oikeissa ohjelmistokehitys-, pääte- ja verkkohakuympäristöissä. Malli ei siis harjoitellut pelkkien esimerkkivastausten varassa.
Ero on merkittävä agenttikäytön kannalta. Ympäristössä harjoitellut malli saa palautetta siitä, toimiko komento, löytyikö tiedosto ja tuottiko haku käyttökelpoisen tuloksen. Staattinen aineisto ei anna tätä signaalia lainkaan.
Menetelmä on myös selvästi kalliimpi kuin tavallinen jälkikoulutus. Jokainen harjoituskierros vaatii ajettavan ympäristön, joka suorittaa komennot ja palauttaa tuloksen mallille. Juuri siksi IBM rajasi vaiheen kahteen suurempaan malliin eikä vienyt sitä läpi koko perheelle.
Sama suuntaus näkyy laajemmin alalla. Agenttivertailut ovat siirtyneet yksittäisistä vastauksista monivaiheisiin tehtäviin, joissa mallin on korjattava omia virheitään. Harjoittelutapa on seurannut mittaustapaa.
IBM ei kuitenkaan lupaa kärkisijoja yleisissä vertailuissa. Malliperhe on positioitu avoimeksi ja hallittavaksi vaihtoehdoksi, jonka koko ja lisenssi sopivat yritysten omiin ympäristöihin. Kolmen miljardin malli on tästä selkein esimerkki.

Työkalukutsut ja käyttöönotto
Työkalukutsut on rakennettu suoraan mallin kehotepohjaan. Malli päättelee ensin, mitä työkalua kannattaa kutsua ja miksi, ja tuottaa vasta sitten itse kutsun.
Erottelu on käytännössä tärkeä. Kun perustelu tulee ennen kutsua, virheellinen työkaluvalinta erottuu lokista ilman erillistä jäljitystyötä. Agenttia rakentavalle kehittäjälle se lyhentää vianetsintää tuntuvasti.
Kutsut noudattavat OpenAI:n funktiokutsuformaattia. Se on käytännössä alan de facto -standardi, joten mallit istuvat olemassa oleviin agenttirunkoihin ilman erillisiä sovittimia.
Palvelemisen puolella tuki kattaa vLLM:n ja SGLangin. Molemmat ovat yleisiä avoimen mallin ajoalustoja, joten käyttöönotto onnistuu tutuilla työkaluilla ilman uutta pinoa.
Muistivaatimukset pysyvät maltillisina pienemmissä koossa. Kolmen miljardin malli mahtuu kvantisoituna tavallisen työaseman muistiin, ja kahdeksan miljardin versio asettuu siihen väliin, jossa moni yritys ajaa sisäisiä työkalujaan omalla palvelimella.
IBM julkaisi myös kvantisoidut versiot, GitHub-repositorion ja dokumentaation. Kaikki on saatavilla Hugging Facessa samalla Apache 2.0 -lisenssillä kuin täysimittaiset painot.

Avoin resepti on julkaisun kiinnostavin osa
Painojen ohella IBM julkaisi koko koulutusreseptin. Mukana ovat datasekoituksen osuudet ja vaihekohtaiset hyperparametrit.
Resepti kertoo myös, mitä vaiheita jälkikoulutuksessa ajettiin ja missä järjestyksessä. Granite 4.2:n tapauksessa ketju kattaa sekä ohjatun hienosäädön että ympäristöissä tehdyn vahvistusoppimisen vaiheineen.
Tämä on harvinaista. Useimmat avoimen painon julkaisut kertovat lopputuloksen mutta vaikenevat siitä, miten sinne päästiin. Ilman reseptiä malli on ladattava artefakti, ei toistettava tulos.
Tutkimuksen kannalta ero on iso. Julkaistu resepti antaa muille mahdollisuuden toistaa vaiheet, vaihtaa yhtä muuttujaa ja katsoa mitä tapahtuu. Se tekee mallista lähtökohdan eikä päätepisteen.
Yrityksille avoin resepti tarkoittaa myös arvioitavuutta. Kun datasekoitus ja koulutusvaiheet ovat näkyvissä, mallin käyttäytymistä on helpompi perustella sisäisesti ja auditoinnissa. Sääntelyn kiristyessä tämä muuttuu nopeasti hankintakriteeriksi.

Yhteenveto
Granite 4.2 ei yritä olla suurin eikä nopein avoin malli. Se yrittää olla se, jonka voi ottaa käyttöön omassa ympäristössä ja jonka syntytavan voi lukea läpi.
Kytkettävä päättely, natiivit työkalukutsut ja ympäristöissä tehty vahvistusoppiminen osuvat siihen, mihin agenttikäyttö on menossa. Apache 2.0 -lisenssi ja julkaistu resepti tekevät kokonaisuudesta poikkeuksellisen läpinäkyvän.
Käytännön testi tulee siitä, kuinka moni ottaa 8B- tai 30B-version tuotantoon agenttityöhön. Sen ratkaisevat vertailuluvut ja käyttökokemus, eivät lisenssiehdot.
