IBM julkaisi tiistaina Granite 4.2 -malliperheen. Kyseessä on yhtiön ensimmäinen tiheä, pelkkään dekoodaukseen perustuva päättelymalliperhe, ja se ilmestyi kolmessa koossa: 3, 8 ja 30 miljardia parametria. Painot julkaistiin Apache 2.0 -lisenssillä.

Julkaisu jatkaa IBM:n avointa mallilinjaa, mutta siirtää painopistettä. Aiemmat Granite-sukupolvet myytiin ohjeita seuraavina avustajina. Nyt kärjessä on eksplisiittinen päättely ja toiminta agenttiympäristöissä.

Kolme kokoa ja kytkettävä päättely


Jokaisessa kolmessa mallissa on kytkettävä ajattelutila. Käyttäjä voi siis päättää tapauskohtaisesti, tuottaako malli näkyvän päättelyketjun ennen vastausta vai vastaako se suoraan.

Ratkaisu on ennen kaikkea kustannuskysymys. Päättelyketju kuluttaa tokeneita ja aikaa, eikä sitä tarvita yksinkertaisissa tehtävissä. Sama malli palvelee siten sekä nopeaa luokittelua että monivaiheista ongelmanratkaisua.

Kolmen koon jako seuraa tuttua logiikkaa. Kolmen miljardin parametrin malli on tarkoitettu kevyeen käyttöön, esimerkiksi laitteelle tai reunapalvelimelle. Kolmenkymmenen miljardin lippulaiva on mitoitettu yhdelle usean näytönohjaimen palvelinsolmulle.

Lippulaiva ei ole rakennettu tyhjästä. Mallikortin mukaan 30B-versio jälkikoulutettiin Granite 4.1:n 30 miljardin parametrin pohjamallista. Mallit on testattu kahdellatoista kielellä, joukossa englanti, saksa, japani, arabia, korea ja kiina.



Kolme eri kokoista kiillotettua kivilohkaretta rivissä betonipinnalla


Vahvistusoppiminen oikeissa ympäristöissä


Julkaisun teknisesti kiinnostavin osa koskee kahta suurempaa mallia. Ne vietiin vahvistusoppimisen läpi oikeissa ohjelmistokehitys-, pääte- ja verkkohakuympäristöissä. Malli ei siis harjoitellut pelkkien esimerkkivastausten varassa.

Ero on merkittävä agenttikäytön kannalta. Ympäristössä harjoitellut malli saa palautetta siitä, toimiko komento, löytyikö tiedosto ja tuottiko haku käyttökelpoisen tuloksen. Staattinen aineisto ei anna tätä signaalia lainkaan.

Sama suuntaus näkyy laajemmin alalla. Agenttivertailut ovat siirtyneet yksittäisistä vastauksista monivaiheisiin tehtäviin, joissa mallin on korjattava omia virheitään. Harjoittelutapa on seurannut mittaustapaa.

IBM ei kuitenkaan lupaa kärkisijoja yleisissä vertailuissa. Malliperhe on positioitu avoimeksi ja hallittavaksi vaihtoehdoksi, jonka koko ja lisenssi sopivat yritysten omiin ympäristöihin. Kolmen miljardin malli on tästä selkein esimerkki.



Kehittäjän työpiste hämärässä huoneessa, näytöillä epätarkkoja päätenäkymiä


Työkalukutsut ja käyttöönotto


Työkalukutsut on rakennettu suoraan mallin kehotepohjaan. Malli päättelee ensin, mitä työkalua kannattaa kutsua ja miksi, ja tuottaa vasta sitten itse kutsun.

Kutsut noudattavat OpenAI:n funktiokutsuformaattia. Se on käytännössä alan de facto -standardi, joten mallit istuvat olemassa oleviin agenttirunkoihin ilman erillisiä sovittimia.

Palvelemisen puolella tuki kattaa vLLM:n ja SGLangin. Molemmat ovat yleisiä avoimen mallin ajoalustoja, joten käyttöönotto onnistuu tutuilla työkaluilla ilman uutta pinoa.

IBM julkaisi myös kvantisoidut versiot, GitHub-repositorion ja dokumentaation. Kaikki on saatavilla Hugging Facessa samalla Apache 2.0 -lisenssillä kuin täysimittaiset painot.



Lähikuva palvelinräkin ristikytkentäpaneelista ja siististi reititetyistä kuiduista


Avoin resepti on julkaisun kiinnostavin osa


Painojen ohella IBM julkaisi koko koulutusreseptin. Mukana ovat datasekoituksen osuudet ja vaihekohtaiset hyperparametrit.

Tämä on harvinaista. Useimmat avoimen painon julkaisut kertovat lopputuloksen mutta vaikenevat siitä, miten sinne päästiin. Ilman reseptiä malli on ladattava artefakti, ei toistettava tulos.

Tutkimuksen kannalta ero on iso. Julkaistu resepti antaa muille mahdollisuuden toistaa vaiheet, vaihtaa yhtä muuttujaa ja katsoa mitä tapahtuu. Se tekee mallista lähtökohdan eikä päätepisteen.

Yrityksille avoin resepti tarkoittaa myös arvioitavuutta. Kun datasekoitus ja koulutusvaiheet ovat näkyvissä, mallin käyttäytymistä on helpompi perustella sisäisesti ja auditoinnissa.



Avoin tekninen muistikirja kaavioineen laboratoriopöydällä kannettavan vieressä


Yhteenveto


Granite 4.2 ei yritä olla suurin eikä nopein avoin malli. Se yrittää olla se, jonka voi ottaa käyttöön omassa ympäristössä ja jonka syntytavan voi lukea läpi.

Kytkettävä päättely, natiivit työkalukutsut ja ympäristöissä tehty vahvistusoppiminen osuvat siihen, mihin agenttikäyttö on menossa. Apache 2.0 -lisenssi ja julkaistu resepti tekevät kokonaisuudesta poikkeuksellisen läpinäkyvän.