Liquid AI julkaisi LFM2.5-2.6B:n, agenttimallin, joka on suunniteltu pyörimään kokonaan päätelaitteella. Malli tukee työkalukutsuja ja monivaiheisia työnkulkuja alle 2,5 gigatavun muistilla. Se toimii sekä kannettavissa että puhelimissa.
Yhtiön Hugging Face -blogin mukaan malli pärjää vertailussa jopa neljä kertaa suuremmille malleille työkalujen käytössä ja ohjeiden noudattamisessa. Paikallinen ajo poistaa pilvipäättelyn laskut ja pitää datan laitteella.
Agenttitaidot pieneen kokoon
Liquid AI vertasi LFM2.5-2.6B:tä neljään suurempaan malliin. Vertailujoukossa olivat Gemma 4 -mallit sekä Qwen3.5:n 4,7 ja 9,7 miljardin parametrin versiot. Testattava malli oli joukon pienin, ja kokoero vertailujoukkoon oli kaksin- tai nelinkertainen.
Vertailu kattoi kaksitoista mittaria neljältä osa-alueelta. Mukana olivat tietopainotteiset tehtävät, matematiikka, ohjeiden noudattaminen, työkalujen käyttö sekä agenttiajot selainympäristössä.
Ohjeiden noudattamisessa LFM2.5-2.6B johtaa jokaista vertailtua mittaria. Työkalujen käytössä se voittaa kaikki muut paitsi BFCLv4-testin, jossa 9,7 miljardin parametrin Qwen menee niukasti ohi. Agenttitehtävissä malli päihittää molemmat Gemma-mallit.
Koodaus on selkein poikkeus. Siinä suuremmat mallit pitävät edelleen selvän etumatkan, ja yhtiö suosittelee isompaa mallia varsinaiseen koodaustyöhön. Tietopainotteisissa tehtävissä LFM2.5-2.6B on kärjessä ja matematiikassa lähellä sitä.
Luvut kannattaa lukea yhtiön omana mittauksena. Vertailu on silti poikkeuksellisen läpinäkyvä, koska tulokset on julkaistu mallikohtaisesti kahdellatoista mittarilla. Yhtiö korostaa lisäksi, että malli on koulutettu suoraan suosituissa agenttikehyksissä, mikä parantaa yhteensopivuutta valmiiden ajoympäristöjen kanssa.

Nelivaiheinen jälkikoulutus
Pohjamalli on esikoulutettu noin 34 biljoonalla tokenilla. Välivaiheen koulutus kasvattaa kontekstin 128 000 tokeniin. Varsinainen agentiksi kouluttaminen tapahtuu vasta tämän jälkeen neljässä vaiheessa.
Ensin ajetaan kaksi kierrosta ohjattua hienosäätöä, jonka aineisto painottuu voimakkaasti työkalujen käyttöön, verkkohakuun ja agenttiympäristöjen tallennettuihin ajoihin. Toisessa vaiheessa koulutetaan erillinen asiantuntijamalli kullekin osa-alueelle, kuten matematiikalle, koodille ja työkalukutsuille.
Kolmannessa vaiheessa asiantuntijamallit tislataan yhdeksi oppilasmalliksi monialaisella on-policy-tislauksella. Neljäs vaihe on vahvistusoppiminen, joka ajetaan aidoissa agenttiympäristöissä useilla vuoroilla. Malli oppii toimimaan eri työkaluilla ja vaihtuvilla järjestelmäkehotteilla.
Vaiheistuksen tarkoitus on säilyttää erikoisosaaminen ilman mallin kasvattamista. Yhden suuren mallin sijaan osaaminen kerätään useasta kapeasta opettajasta ja puristetaan yhteen pieneen oppilaaseen.
Vahvistusoppimisen putki on eriytetty kolmeen osaan. Koulutusmoottori optimoi mallia, ajomoottori tuottaa toimintoja tuoreimmalla politiikalla, ja erillinen hiekkalaatikkopalvelu suorittaa toiminnot. Välityskerros antaa käyttää valmiita agenttikehyksiä sellaisenaan ilman muutoksia.

Nopeus suorittimella ja näytönohjaimella
Suoritinajossa LFM2.5-2.6B on Liquid AI:n testeistä nopein. Purkunopeus on 220 tokenia sekunnissa Apple M5 Max -piirillä ja 113 tokenia sekunnissa AMD:n Ryzen AI Max+ 395 -suorittimella.
Puhelimessa nopeudeksi ilmoitetaan noin 30 tokenia sekunnissa. Se riittää käyttökelpoiseen agenttiin, kun vastaus muodostuu vähitellen. Muistinkulutus jää alle 2,5 gigatavun, joten malli mahtuu tavalliseen kuluttajalaitteeseen.
Nopeus ei ole agenttikäytössä pelkkä mukavuuskysymys. Monivaiheinen tehtävä koostuu useasta peräkkäisestä kutsusta, joten yksittäisen vuoron viive kertautuu koko ketjussa. Purkunopeus ratkaisee siksi enemmän kuin yksittäisen vastauksen pituus.
Näytönohjaimella malli yltää lähes 15 000 tokeniin sekunnissa suurella rinnakkaisuudella. Yhdellä H100-kiihdyttimellä se vastaa noin 1,3 miljardia tokenia vuorokaudessa. Kokoluokassaan se on yhtiön mittauksissa nopein.
Tuki päättelykirjastoihin oli valmiina julkaisupäivänä. Malli toimii llama.cpp-, MLX-, vLLM-, SGLang- ja ONNX-ympäristöissä. Transformers-kirjastosta vaaditaan versio 5.0.0 tai uudempi.

Milloin paikallinen agentti kannattaa
Paikallinen agentti ratkaisee kolme ongelmaa kerralla. Data ei poistu laitteelta, päättelystä ei synny pilvilaskua, ja käyttömäärän kasvu ei nosta kustannuksia lineaarisesti. Nämä yhdessä muuttavat suurten käyttömäärien laskelmaa.
Yksityisyys on monessa käyttökohteessa ratkaiseva peruste. Terveystiedot, viestit ja yritysten sisäiset dokumentit voidaan käsitellä ilman, että sisältö siirtyy ulkopuoliselle palvelimelle. Sääntelyn kannalta tämä yksinkertaistaa perusteluja huomattavasti.
Liquid AI suosittelee mallia nimenomaan runsaan volyymin työkuormiin. Tyypillisiä kohteita ovat sovelluksen sisäiset avustajat, laitteella tehtävä luokittelu ja työkaluja kutsuvat taustaprosessit. Näissä pyyntöjä tulee paljon ja yksittäinen tehtävä on rajattu.
Rajat kannattaa tunnistaa etukäteen. Vaativa koodaus, pitkä päättelyketju ja laaja yleistieto sujuvat edelleen paremmin suurilta malleilta. Moni tuote päätyykin jakoon, jossa kevyet tehtävät ajetaan laitteella ja vaikeat ohjataan pilveen.

Yhteenveto
LFM2.5-2.6B siirtää agenttien perustyön päätelaitteelle. Työkalukutsut ja monivaiheiset työnkulut onnistuvat alle 2,5 gigatavun muistilla, ja nopeus riittää myös puhelimessa. Valmis tuki yleisimpiin päättelykirjastoihin madaltaa käyttöönoton kynnystä.
Julkaisu asettuu laajempaan kehitykseen, jossa pienten mallien agenttitaidot ovat parantuneet selvästi nopeammin kuin niiden yleistieto.
Koodaus jää edelleen suurempien mallien vahvuudeksi. Rajatuissa ja toistuvissa agenttitehtävissä ero on kuitenkin kaventunut siihen pisteeseen, että pilvipäättely ei ole enää itsestään selvä valinta.
