DeepReinforce on julkaissut Ornith-1.0:n, avoimen koodausmalliperheen agenttipohjaiseen ohjelmointiin. MarkTechPostin mukaan malliperhe kattaa neljä kokoa 9 miljardin parametrin tiheästä mallista 397 miljardin parametrin lippulaivaan. Jokainen malli julkaistaan MIT-lisenssillä Hugging Facessa. Erikoisuus on, että malli oppii rakentamaan oman telineensä sen sijaan, että teline suunniteltaisiin käsin. Malliperhe on suunnattu erityisesti terminaalipohjaisiin koodausagentteihin.
Neljä mallikokoa MIT-lisenssillä
Ornith-1.0 julkaistaan neljässä koossa: 9B tiheä, 31B tiheä, 35B MoE ja 397B MoE. MoE eli Mixture of Experts -arkkitehtuuri aktivoi vain osan parametreista kerrallaan. 35B-malli aktivoi noin kolme miljardia parametria per token, mikä pitää ajon kevyenä. Suuremmat mallit tähtäävät tarkkuuteen, pienemmät taas edullisuuteen ja nopeuteen.
Mallit on jälkikoulutettu Gemma 4- ja Qwen 3.5 -pohjille. Jakelussa on myös FP8- ja GGUF-versiot nopeampaan paikalliseen ajoon. Jokainen malli tarjoaa OpenAI-yhteensopivan rajapinnan, joten vakioidut agenttikehykset toimivat ilman koodimuutoksia.
Käyttöönotto on suoraviivaista. 9B-malli vie noin 19 gigatavua bf16-muodossa ja pyörii yhdellä 80 gigatavun näytönohjaimella. Tarjotut ajo-ohjeet kattavat vLLM:n, SGLangin ja Transformersin.
Kaikki variantit ovat päättelymalleja, jotka tuottavat erillisen päättelyketjun ennen lopullista vastausta. Ajo-ohjeet erottavat tämän jäljen omaan reasoning_content-kenttäänsä. Mallit muodostavat myös valideja työkalukutsuja, mikä on edellytys agenttisilmukoille.

Malli rakentaa oman telineensä
Useimmat koodausagentit yhdistävät mallin kiinteään, ihmisen suunnittelemaan telineeseen. Teline hoitaa muistin, työkalut, virheenkäsittelyn ja orkestroinnin mallin ympärillä. Ornith-1.0 kohtelee telinettä opittavana osana. Tämä teline ratkaisee usein yhtä paljon kuin itse malli.
Vahvistusoppimisen aikana teline kehittyy yhdessä mallin politiikan kanssa. Jokainen askel etenee kahdessa vaiheessa. Ensin malli lukee tehtävän ja edellisen telineensä ja ehdottaa parannettua versiota. Sitten se ratkaisee tehtävän tällä telineellä, ja palkkio ohjaa molempia vaiheita.
Näin malli optimoidaan kirjoittamaan orkestrointia, ei vain vastauksia. Koulutuksen myötä korkeamman palkkion telineet valikoituvat automaattisesti. Tehtäväkohtaiset strategiat syntyvät ilman käsin rakennettua telinettä.
Koulutus ajetaan asynkronisesti niin sanotulla pipeline-RL-asetelmalla. Vanhentumispaino vähentää vanhojen, politiikasta poikkeavien tokenien painoa ja pudottaa ne tietyn rajan jälkeen. Optimointi nojaa token-tason GRPO-tavoitteeseen, mikä vakauttaa oppimista. Asynkroninen koulutus nopeuttaa oppimista ilman, että vakaus kärsii.

Suojaukset palkkion huijausta vastaan
Kun malli saa kirjoittaa oman telineensä, se houkuttelee palkkion huijaamiseen. Teline voisi lukea näkyvät testitiedostot ja kovakoodata odotetut tulokset. Se voisi myös kopioida ympäristössä lojuvan valmiin ratkaisun. Tällaiset oikotiet vääristäisivät tuloksia ja tekisivät vertailusta epäluotettavaa.
DeepReinforce kuvaa kolme suojakerrosta. Ulompi luottamusraja on kiinteä, eikä malli pääse muokkaamaan ympäristöä, työkalupintaa tai testien eristystä. Malli kehittää vain sisempää politiikkatelinettään.
Deterministinen valvoja merkitsee kielletyt toimet, kuten suojattujen polkujen lukemisen tai testiskriptien muokkaamisen, ja antaa niistä nollapalkkion. Tällaiset polut jätetään myös pois palkkion laskennasta, joten huijaus ei tuota etua.
Kolmas kerros on jäädytetty LLM-tuomari, joka toimii veto-oikeudella vahvistajan päällä. Se ei ole ensisijainen palkkion lähde vaan tarkistus, joka voi hylätä epäilyttävän ratkaisun. Kerrokset yhdessä vaikeuttavat oikomista merkittävästi.

Vertailuluvut ja käyttökohteet
Lippulaiva Ornith-1.0-397B saa 77,5 pistettä Terminal-Bench 2.1:ssä ja 82,4 pistettä SWE-Bench Verifiedissä. SWE-Bench Verifiedissä se jää listalla vain Claude Opus 4.8:n (87,6) taakse. Terminal-Bench 2.1:ssä se ohittaa Claude Opus 4.7:n mutta jää Opus 4.8:n ja suuremman GLM-5.2-744B:n taakse.
DeepReinforce kehystää kärkiväitteen tarkasti. Tulos on huippuluokkaa vain samankokoisten avointen mallien joukossa, ei kaikkien mallien kesken. SWE-Bench Pro -testissä 397B yltää 62,2 pisteeseen ja monikielisessä SWE-Benchissä 78,9 pisteeseen.
Pienemmät mallit kantavat tehokkuusargumentin. 35B-malli saa 64,2 pistettä Terminal-Bench 2.1:ssä, selvästi yli Qwen 3.5-397B:n. 9B-malli yltää 43,1 pisteeseen samassa testissä ja 69,4 pisteeseen SWE-Bench Verifiedissä.
Mallit on suunnattu terminaalipohjaisiin koodausagentteihin ja repositorion laajuiseen työhön. Luontevia kohteita ovat monitiedostoiset refaktoroinnit, vikojen paikannus ja testivetoiset korjaukset. Pienin malli sopii reunalaitteisiin, kun taas suurin tähtää tarkkuuteen pitkissä tehtävissä.

Yhteenveto
Ornith-1.0 vie avoimet koodausmallit lähemmäs kärkeä ja tuo mukanaan tuoreen idean: malli oppii orkestroinnin, ei vain vastausta. Itse rakentuva teline yhdistettynä suojauksiin palkkion huijausta vastaan on huomionarvoinen tutkimussuunta. Suunta haastaa ajatuksen siitä, että teline pitää aina suunnitella käsin.
Avoin MIT-lisenssi ja OpenAI-yhteensopiva rajapinta tekevät kokeilusta helppoa. Tiimit voivat ajaa pientä mallia paikallisesti tai isännöidä suurinta omaa agenttiaan varten. Avoin julkaisu antaa tutkijoille mahdollisuuden varmistaa luvut itse.
