Microsoft julkaisi Agent Lightning 1.0:n, vahvistusoppimiskehyksen, joka kouluttaa valmiin tekoälyagentin koskematta agentin omaan koodiin. Kehys on MIT-lisensoitu ja ladattavissa GitHubista. Näkyvin tulos tulee koodausvertailusta: Qwen3.5-9B nousi SWE-bench Verifiedissä 41,8 prosentista 56,4 prosenttiin.

Ero aiempiin menetelmiin on arkkitehtuurissa. Agenttien vahvistusoppiminen on tähän asti vaatinut agentin uudelleenrakentamista koulutusta varten. Useimmille tiimeille hinta on ollut liian kova, ja kehotteiden hiominen on jäänyt ainoaksi keinoksi. Agent Lightning kiertää vaatimuksen asettumalla agentin ja mallin väliin.

Välityspalvelin agentin ja mallin väliin


Agent Lightning asettaa API-yhdyskäytävän agentin ja mallipäätepisteen väliin. Agentti tekee samat rajapintakutsut kuin ennenkin eikä havaitse eroa. Yhdyskäytävä kaappaa kutsut, tallentaa jokaisen pyynnön ja vastauksen ja välittää aineiston kouluttajalle.

Käytännössä agenttikehys jää koskemattomaksi. Työkalut, kontekstinhallinta ja ohjausvuo pysyvät paikoillaan. Juuri niihin tuotantologiikka on kirjoitettu, eikä niitä tarvitse purkaa koulutuksen takia. Sama pätee riippumatta siitä, pyöriikö agentti LangChainin, AutoGenin vai CrewAI:n päällä.

Kokonaisuus koostuu kolmesta osasta. API-yhdyskäytävä välittää mallikutsut ja varastoi ajojäljet. Rollout Controller käynnistää agentin Kubernetes-työnä tai paikallisena prosessina jokaista koulutusjaksoa varten, jolloin jokainen ajo saa eristetyn ympäristön. Kolmas osa on verl- ja vLLM-pohjainen Trainer, joka päivittää politiikkaa PPO- tai GRPO-algoritmilla.

Koko toteutus on noin 3 500 riviä Pythonia. Microsoft kertoo pitäneensä yksinkertaisuutta 1.0-version pääperiaatteena. Kevyemmäksi vaihtoehdoksi Trainer tukee myös APO-menetelmää, joka optimoi kehotteita ilman gradienttipäivityksiä.



Messinkinen liitäntärasia putkilinjassa, jossa ohitushaara palaa päälinjaan


Harnessed agentic RL erottuu simulaatiosta


Menetelmällä on oma nimensä: harnessed agentic RL eli rungon säilyttävä agenttien vahvistusoppiminen. Tavallisessa agenttien vahvistusoppimisessa koulutusmoottori omistaa vuorovaikutussilmukan. Se simuloi työkalukutsut, hallitsee tilaa ja korvaa käytännössä agentin oman rungon.

Agent Lightningissä runko säilyttää silmukan. Kouluttaja tarkkailee vain mallipyyntöjen ja -vastausten sarjoja, ei ympäristöä niiden ympärillä.

Ero ratkaisee siirtymän tuotantoon. Simuloiduissa ympäristöissä koulutetut agentit epäonnistuvat usein oikeissa ympäristöissä, koska simulaatio ei tavoita tuotannon reunatapauksia. Kun oma runko on mukana koulutussilmukassa, opetusaineisto vastaa sitä, mitä agentti oikeasti tekee.

Ratkaisu on saanut seuraajia. Agent Lightningin jälkeen julkaistut kehykset verl Uni-Agent, AReaL 2.0 ja Polar omaksuivat saman arkkitehtuurin. Se on kohtuullinen merkki siitä, että suunnittelu ratkaisi todellisen ongelman.



Tuulitunnelin koekammio, jossa savuvirrat kulkevat testikappaleen ohi


SWE-bench Verified nousi 14,6 pistettä


SWE-bench Verified mittaa, ratkaiseeko agentti oikeita GitHub-tikettejä. Tehtävät ovat aitoja bugeja ja ominaisuuspyyntöjä avoimen lähdekoodin projekteista, ja agentin korjausta verrataan tarkistettuun paikkaukseen. Keinotekoisia harjoituksia joukossa ei ole.

Agent Lightningin koulutusputki nosti Qwen3.5-9B-mallin tuloksen 41,8 prosentista 56,4 prosenttiin. Kasvua kertyi 14,6 prosenttiyksikköä vertailussa, jota moni tiimi pitää kattona eikä muuttujana.

Mittakaava on yhtä huomionarvoinen kuin itse luku. Koulutusajossa käytettiin 6 000 esimerkkiä laitteistolla, jota Microsoft kuvaa maltilliseksi. Kyse ei siis ole kokeesta, joka edellyttäisi omaa GPU-klusteria.



Korkeushypyn rima korkealla telineissään tyhjällä yleisurheilustadionilla


Rajoitukset ennen käyttöönottoa


Palkkiofunktion suunnittelu jää tiimin vastuulle. Kehys tarjoaa koulutusinfrastruktuurin, mutta ei määrittele, mikä agentin toiminnassa on hyvää. Palkkion huijaaminen on koodausagenteilla todellinen riski, ja kehys näyttää täydet ajojäljet sen jäljittämiseen.

Versio 1.0 on täysi uudelleenkirjoitus. Arkkitehtuurin kannalta se on hyvä merkki, mutta rajapinta elää todennäköisesti vielä pienissä versiopäivityksissä.

Tuki rajoittuu Linuxiin. macOS ja Windows WSL2:n ulkopuolella jäävät toistaiseksi tuen ulkopuolelle, ja Python 3.10 on vähimmäisvaatimus. Asennus itsessään on yhden komennon mittainen.

Microsoft avasi elokuun 19. päivä myös ThinkingBoxin, joka mittaa agentin luotettavuutta tarkistamalla tietokannan todelliset tilamuutokset keskustelulokien sijaan. Kahden työkalun yhdistelmä antaa mittarin sekä ennen koulutusta että sen jälkeen.



Työpöytä, jolla työntömitta, momenttiavain ja osittain purettu mekanismi


Yhteenveto


Agent Lightning poistaa suurimman käytännön esteen agenttien vahvistusoppimiselta. Kun agenttia ei tarvitse rakentaa uudelleen, koulutuksesta tulee varteenotettava vaihtoehto tiimeille, jotka ovat tähän asti hioneet vain kehotteita.

Kynnys on silti olemassa. Vakaa agentti ja selkeä palkkiosignaali ovat edellytyksiä sille, että koulutus kannattaa. Ilman niitä 14,6 pisteen hyppy jää toisen tiimin tulokseksi.