Ohjelmistoautomaatioon on ilmestynyt uusi mallityyppi, joka ei kirjoita tekstiä lainkaan. TypeSafe AI:n Jev ja Cuan avoin CUA-S1-Forms palauttavat vastauksena todennäköisyyden ennalta määritellyille vaihtoehdoille. Kummankin lupaus on sama: halvempi ja nopeampi päätös kuin kielimallilta. Molemmat on suunnattu ohjelmistoautomaatioon, ei keskusteluun.
TechCrunchin mukaan Jevin kysyntä oli julkaisun jälkeen niin kova, että TypeSafe menetti hetkeksi kykynsä palvella rajapinta-asiakkaita. Cua julkaisi oman mallinsa 18. syyskuuta ja kuvaa sitä suoraan jev-tyyppiseksi. Julkaisujen väli oli neljä päivää.
Malli, joka ei kirjoita tekstiä
Jevin takana on TypeSafe AI, jonka perusti OpenAI:lta kaksi vuotta sitten lähtenyt Diogo Almeida. Hän oli mukana kehittämässä ihmispalautteeseen perustuvaa vahvistusoppimista eli RLHF:ää. Almeidan mukaan kielimallit on optimoitu ihmisen kieleen, kun taas automaatio puhuu tietokoneen kieltä. Ero on hänen mukaansa rakenteellinen eikä korjaannu paremmalla kehotteella.
Jev on transformer-pohjainen malli, mutta se ei tuota merkkijonoja. Käyttäjä määrittelee sallitut vastausvaihtoehdot etukäteen, ja malli pisteyttää ne. Koska vaihtoehdot on lyöty lukkoon, malli ei voi keksiä vastausta, jota ei ole olemassa. Samalla jää pois vaihe, jossa kielimallin vastaus pitää jäsentää ja validoida jälkikäteen.
Yhtiö kutsuu lopputulosta kalibroiduiksi päätöksiksi. Koulutus tehtiin pelkällä synteettisellä datalla tekniikalla, jota Almeida kutsuu nimellä reinforcement learning from calibrated decisions. Mallin arkkitehtuurista yhtiö vaikenee, ja ulkopuoliset arvelevat sen nojaavan avoimiin painoihin. Hinnoittelussa vastaustokenit ovat maksuttomia ja syötetokenit mitataan miljardeittain.

Vercelin mittauksessa 5-18 kertaa nopeampi
Konkreettisin luku tulee Verceliltä. Yhtiön ohjelmistokehittäjä Pranit Sharma kertoi TechCrunchille, että Vercel oli käyttänyt OpenAI:n Luna 5.6:ta luokittelijana komentojen turvallisuustarkistuksessa. Kun Luna vaihdettiin Jeviin, tulokset saatiin 5-18 kertaa nopeammin ja aiempaa tarkemmin. Kyse oli siis tuotannossa olleen luokittelijan suorasta korvaamisesta, ei laboratoriokokeesta.
Nopeus avaa käyttötapauksia, jotka kielimallilla olisivat liian kalliita. Kehittäjä Armin Ronacher nosti TechCrunchille esiin mallien reitityksen: sen arvioimisen, tarvitseeko pyyntö raskaan mallin vai riittääkö kevyt. Kielimallin käyttäminen tähän arviointiin söisi juuri sen säästön, jota haetaan. Päätösmalli tekee saman arvion murto-osalla kustannuksesta.
Toinen käyttötapa on agenttien valvonta. Almeidan mukaan Jev sopii agenttien toimintaketjujen seurantaan ja jailbreak-yritysten torjuntaan. Agentin valvominen toisella agentilla kallistuu nopeasti, mutta kapea päätösmalli maksaa murto-osan. Almeida kuvaa Jeviä System One -malliksi, joka tekee nopeita ratkaisuja tarkasti rajattuun tehtävään.

Cuan lomakemalli mahtuu 2,8 megatavuun
Cuan perustaja Francesco Bonacci julkaisi CUA-S1-Formsin 18. syyskuuta. Malli suunnittelee, miten agentti täyttää lomakkeen, ilman että kielimallia kutsutaan joka vaiheessa. Opetettavia parametreja on 706 048 ja tarkistuspiste vie 2,8 megatavua. Malli on siis pienempi tiedosto kuin useimmat verkkosivujen valokuvat.
Malli pisteyttää sallitut toiminnot yhdellä eteenpäinajolla ja palauttaa kullekin todennäköisyyden. Cua Driver kääntää valinnat käyttöliittymätoiminnoiksi ja järjestää ne: ensin kentät, sitten valintaruudut, ja lähetyspainiketta painetaan vasta kun siihen on lupa. Järjestys estää lomakkeen lähettämisen keskenäisenä.
Cua julkaisi mallin, koulutuskoodin ja aineiston MIT-lisenssillä. Kyseessä on ensimmäinen julkaisu perheessä, jota yhtiö kutsuu CUA-S1:ksi ja kuvaa System One -malleiksi. Yhtiön pääprojektilla oli syyskuun 19. päivänä noin 23 300 tähteä GitHubissa. Julkaisu tuo mallikerroksen sen työpöytäinfrastruktuurin päälle, jota yhtiö on rakentanut viimeisen vuoden ajan.

Mitä kapeat päätösmallit tarkoittavat automaatiolle
Ero Jevin ja CUA-S1-Formsin välillä on laajuudessa. TypeSafe myy Jeviä yleisenä päätösmallina luokitteluun, reititykseen ja muihin ohjelmistotyönkulkuihin. Cua koulutti ensimmäisen erikoismallinsa yhden työnkulun ympärille ja julkaisi painot. Yhteinen nimittäjä on System One -ajattelu: nopea ratkaisu rajattuun tehtävään.
Molemmat nojaavat samaan oletukseen: suuri osa automaation päätöksistä on valintoja rajatusta joukosta, ei vapaata tekstiä. Kun ongelma muotoillaan näin, generatiivinen koneisto käy tarpeettomaksi. Jäljelle jää luokittelija, joka on nopeampi, halvempi ja helpommin tarkistettavissa. Vastausavaruus on tiedossa jo ennen ajoa, joten myös testaaminen helpottuu.
Rajoitus on sama kuin vahvuus. Päätösmalli toimii vain, kun vaihtoehdot pystyy luettelemaan etukäteen. Avoimissa tehtävissä, joissa vastausavaruutta ei voi rajata, kielimalli on yhä ainoa vaihtoehto.
Cua pyytää nyt yrityksiä ehdottamaan seuraavaa erikoismallia toistuviin ja rajattuihin tietokonetyönkulkuihin. Se kertoo suunnasta: kapeita malleja tehdään työnkulku kerrallaan sen sijaan, että yksi iso malli hoitaisi kaiken. Mukana julkaisussa ovat myös datageneraattori ja arviointikoodi, joten mallin voi kouluttaa uudelleen omalle lomakejoukolle.

Yhteenveto
Päätösmallit eivät korvaa kielimalleja, mutta ne vievät niiltä pois rutiininomaisimmat kutsut. Luokittelu, reititys ja lomakkeiden täyttö ovat tehtäviä, joissa vapaa teksti on ollut turha välivaihe. Vercelin mittaama 5-18-kertainen nopeutuminen kertoo, kuinka raskas tämä välivaihe on ollut. Säästö syntyy sekä viiveestä että rajapintakuluista.
Ronacher arvioi, että kilpailijoita syntyy nyt nopeasti, kun mallityypin hyöty on nähty. Cuan MIT-lisensoitu julkaisu neljä päivää Jevin jälkeen tukee arviota. Seuraavaksi ratkeaa, syntyykö kapeista päätösmalleista oma tuotekategoriansa vai jäävätkö ne agenttiputkien sisäiseksi optimoinniksi.
