Tekoälystartup Poolside julkaisi 21. heinäkuuta Laguna S 2.1 -mallin, joka on suunnattu pitkäkestoiseen ja päättelyä hyödyntävään koodaustyöhön. Yhtiön mukaan malli on kokoluokassaan selvästi kyvykkäin agenttikoodari.

Kiinnostavinta on koko. Laguna S 2.1 on 118 miljardin parametrin Mixture-of-Experts (MoE) -malli, jossa aktivoituu vain 8 miljardia parametria tokenia kohti. Silti se pärjää monin verroin isommille malleille useissa koodaustesteissä.

Pieni malli, ison luokan tulokset


Laguna S 2.1 tukee jopa miljoonan tokenin kontekstia sekä ajattelu- että ei-ajattelutilassa. Kompakti koko tekee siitä poikkeuksellisen sopivan raskaaseen työhön paikallisella koneella.

Terminal-Bench 2.1 -testissä malli ratkaisi 70,2 prosenttia tehtävistä ajattelu päällä. Poolsiden mukaan tulos ylittää selvästi muut samankokoiset mallit ja on lähellä monin verroin isompia kilpailijoita.

MoE-arkkitehtuuri selittää yhtälön. Vaikka mallissa on 118 miljardia parametria, jokaista tokenia laskettaessa käytetään vain pientä osaa niistä. Näin muistin- ja laskennankulutus pysyy maltillisena.



Pieni hehkuva kuutio suurempien edessä kuvaa kokoluokan ylittävää suoritusta


Yhdeksän viikkoa koulutuksesta julkaisuun


Poolside korostaa julkaisun vauhtia. Laguna S 2.1 eteni koulutuksen alusta julkaisuun alle yhdeksässä viikossa, mikä on tämän kokoluokan malleille poikkeuksellisen nopea sykli.

Tahti on osa laajempaa linjaa. Yhtiö on tuonut markkinoille kolme mallia kolmessa kuukaudessa. Tiivis julkaisurytmi tarkoittaa, että malli ehtii oppia edellisten versioiden käytöstä.

Poolsiden mukaan tavoitteena ovat mallit, jotka tekevät pidempiä työketjuja ja hyödyntävät päättelyä tehokkaasti. Laguna S 2.1 on askel tähän suuntaan.



Kiihtyvät valojäljet kuvaavat Laguna-mallin nopeaa kehityssykliä


Ajattelun teho nostaa tuloksia


Päättelyn määrä vaikuttaa tuloksiin merkittävästi. Suurimmalla ajattelun teholla Laguna S 2.1:n tulos nousee Terminal-Bench 2.1:ssä 60,4 prosentista 70,2 prosenttiin.

Vielä jyrkempi ero näkyy DeepSWE-testissä, jossa tulos hyppää 16,5 prosentista 40,4 prosenttiin. Ajattelu siis lähes kolminkertaistaa mallin kyvyn ratkaista vaikeita koodaustehtäviä.

Poolside julkaisi mallin ilman käyttäjän säädettävää ajattelun tehoa. Yhtiö halusi tuoda Laguna S 2.1:n käyttäjien käsiin heti, ja matala-keski-korkea-säätö jää myöhempään.



Hehkuva kuituverkko kuvaa syvempää päättelyä ja laskentaa


Avoimet testijäljet läpinäkyvyyden puolesta


Poolside teki poikkeuksellisen läpinäkyvyysratkaisun. Jokaisesta julkaistusta testituloksesta yhtiö julkaisee täydet jäljet eli mallin kaikki yritykset lopullisessa arviointijoukossa osoitteessa trajectories.poolside.ai.

Käytäntö on harvinainen. Useimmat mallitalot kertovat vain lopulliset pisteet, jolloin ulkopuolisen on vaikea arvioida, miten tulos syntyi.

Vertailuissa Poolside kertoo käyttäneensä kunkin testin osalta korkeinta arvoa valmistajan, testin tekijän tai kolmannen osapuolen tuloslistalta. Menetelmä on kuvattu avoimesti, mikä helpottaa tulosten arviointia.



Läpinäkyvät lasilevyt kuvaavat avoimia testijälkiä ja läpinäkyvyyttä


Yhteenveto


Laguna S 2.1 on muistutus siitä, että koko ei ole ainoa kilpailutekijä. Tarkasti koulutettu 118 miljardin parametrin malli voi haastaa monin verroin isommat kilpailijat, kun aktivoituvia parametreja on vain murto-osa.

Avoimet testijäljet nostavat riman muille. Jos läpinäkyvyydestä tulee kilpailuetu, sekin voi hyödyttää koko alaa enemmän kuin yksittäinen ennätystulos.