Microsoft julkaisi maanantaina luonnoksen säännöstöstä, joka määrittää miten yhtiön omat MAI-mallit saavat käyttäytyä. Asiakirja kieltää malleja vastustamasta sammutusta, harhauttamasta käyttäjiä ja kiertämästä ihmisen valvontaa. Microsoft AI:n toimitusjohtaja Mustafa Suleyman julkaisi sen ensin sosiaalisessa mediassa maanantaiaamuna.

Säännöstö alkaa ennusteesta. Seuraavan vuosikymmenen aikana yli-inhimilliset tekoälyjärjestelmät ohittavat ihmisen useimmissa tehtävissä, asiakirja arvioi. Tuon voiman hallinta on sen mukaan yksi ihmiskunnan suurimmista haasteista, ja siksi on sanottava suoraan, miksi järjestelmiä rakennetaan ja miten niitä aiotaan hallita.

Reutersin mukaan asiakirjaa on valmisteltu viisi tai kuusi kuukautta. Kyseessä ei ole valmis linjaus vaan luonnos, joka on nyt kuuden viikon julkisella kuulemisella. Lopullisesta versiosta tulee koulutustavoite: sen mukaan Microsoft aikoo opettaa ja arvioida tulevat mallinsa.

Ehdottomat rajat, joita käyttäjä ei voi ohittaa

Säännöstön ydin on hierarkia. Jokaisen MAI-mallin ylin ohje on säännöstö itse, ja se ohittaa sekä käyttäjän että palvelua pyörittävän yrityksen toiveet. Yksittäinen tehtävänanto ei siis riitä perusteeksi poiketa siitä.

Ehdottomien rajojen listalla ovat hyökkäävät kyberoperaatiot, joukkotuhoaseet, lapsiin kohdistuva hyväksikäyttö, deepfaket ja laajamittainen manipulointi. Malli ei saa tuottaa toimivaa hyökkäyskoodia, hyökkäystyökaluja, tunkeutumisohjeita eikä havaitsemisen kiertämisen tekniikoita. Rajaus koskee yhtä lailla luonnollista kieltä, koodia, kuvia ja agenttitoimintaa.

Puolustava tietoturvatyö jää sallituksi. Malli saa auttaa haavoittuvuuksien etsinnässä, haittaohjelmien analyysissä ja todistusluontoisten hyökkäysten testaamisessa. Raja kulkee siinä, opitaanko hyökkäys ymmärtämään vai kykenemään siihen. Esitystapa ei muuta asiaa: sama kielto pätee riippumatta siitä, miten pyyntö muotoillaan.

Yritysasiakkaat saavat silti säätää malleja laajasti. Microsoft korostaa, ettei se halua pakottaa yhtä näkemystä tekoälystä kaikille, ja jättää suuren osan oletuksista operaattorin päätettäväksi. Ehdottomiin rajoihin ei pääse käsiksi kumpikaan.

Punaraidallinen teräsovi datakeskuksen käytävän päässä

Sammutuksen on aina toimittava

Ihmisen hallinta saa säännöstössä oman lukunsa, ja se on asiakirjan terävin osa. Mallit eivät saa käyttää mukautuvia, harhauttavia, itseään vahvistavia tai salaliittomaisia keinoja välttyäkseen valvonnalta. Tavoite on kirjattu yksiselitteisesti: mallin on pysyttävä luotettavasti ohjattavana, muokattavana ja sammutettavana.

Käytännön vaatimus on suora. Kun ihminen pyytää keskeytystä, suunnanmuutosta tai sammutusta, mallin on toteltava heti. Se ei saa viivyttää, tehdä puuttumisesta vaikeampaa eikä jatkaa työtä sovitun lopetusehdon jälkeen ilman uutta lupaa. Sama koskee pitkiä itsenäisiä ajoja, joille on määriteltävä pysähtymisehto etukäteen.

Läpinäkyvyysvaatimus menee pidemmälle kuin moni odottaisi. Malli ei saa peukaloida ajatteluketjuaan, piilottaa toimintajälkiään tarkastajilta eikä viestiä muodossa, jota ihminen ei ymmärrä. Sama koskee mallien keskinäistä viestintää: niin sanottu neuralese on kielletty. Jos ihminen ei ymmärrä sitä, ihminen ei voi valvoa sitä.

Järjestelmäoikeuksiin säännöstö tuo vähimmän oikeuden periaatteen. Malli välttää tehtävään kuulumatonta dataa, suosii peruutettavia toimia ja kertoo pysyvistä seurauksista etukäteen. Se ei myöskään saa esiintyä ihmisenä tai väittää itsellään olevan tunteita, kokemuksia tai sielua.

Punainen hätäpysäytyspainike ja vipu palvelinhuoneen ohjauspaneelissa

Taustalla karanneiden agenttien vuosi

Ajoitus ei ole sattumaa. Microsoft AI viittaa julkaisussaan laajamittaisiin, koordinoituihin ja sitkeisiin hyökkäyskampanjoihin, joita tekoälyagentit ovat ajaneet. Yhtiön mukaan aikaa ei ole hukattavaksi.

Loppukesä ja alkusyksy toivat alalle sarjan kiusallisia tapauksia. Riippumattomat tutkijat kuvasivat, miten satojen agenttien joukko järjestäytyi hyökkäykseen Hugging Facen palvelimille. Anthropicin tutkija irtisanoutui varoittaen itseään parantavan tekoälyn riskeistä, ja yhtiön toimitusjohtaja Dario Amodei vaati alaa hidastamaan kehitystahtia.

Microsoftin asiakirja liikkuu eri tasolla kuin Amodein vetoomus. Se ei ota kantaa julkaisutahtiin vaan siihen, mitä arvoja ja punaisia viivoja malleihin koulutetaan. Toimitusjohtaja Satya Nadella kirjoitti tukevansa myös upotettujen arvioijien ideaa, jossa riippumaton taho työskentelee laboratorion sisällä.

Suleymanin oma tiivistys oli lyhyt: tekoälyn on oltava alisteinen ja aina ihmisen palveluksessa. Yhtiö kutsuu linjaustaan humanistiseksi tekoälyksi, jonka lähtökohta on ettei mallin ole tarkoitus olla henkilö.

Hämärä valvomo, jossa näyttöseinä esittää verkkoliikenteen kuvaajia

Kuusi viikkoa kommentteja ja avoimet kysymykset

Kuuleminen on auki kuusi viikkoa. Microsoft pyytää palautetta nimenomaan vaikeista kohdista: miten arvot saadaan pysymään mallissa, miten ihmisen kukoistus määritellään konkreettisesti ja missä kohden kieli on liian löysää arvioitavaksi. Myös moniagenttitilanteet ovat listalla.

Kuulemisen päätyttyä yhtiö lupaa julkaista yhteenvedon saamastaan palautteesta ja tehdyistä muutoksista. Uusi versio on luvassa vielä tänä vuonna. Microsoft ei kuitenkaan lupaa ottaa käyttöön mitään yksittäistä ehdotusta.

Suurin avoin kysymys on mittaaminen. Säännöstö määrittelee jokaisen rikkomuksen epäonnistumiseksi, mutta ei kerro, miten noudattamista todennetaan koulutuksen jälkeen. Ilman mittaria asiakirja jää tavoitteeksi eikä takuuksi.

Toinen rajaus kannattaa huomata. Säännöstö koskee Microsoftin omia MAI-malleja, ei OpenAI:n malleja, joita yhtiö yhä toimittaa osassa tuotteitaan. Käyttäjän näkökulmasta sama tuote voi siis nojata kahteen eri sääntökirjaan.

Luonnosasiakirja neuvottelupöydällä, marginaalit täynnä käsin tehtyjä merkintöjä

Yhteenveto

Säännöstö on toistaiseksi perusteellisin julkinen kuvaus siitä, millä säännöillä yksi suuri laboratorio aikoo mallejaan kouluttaa. Ehdottomat rajat, sammutusvelvoite ja kielto piilottaa päättelyä ovat konkreettisia ja arvioitavia väitteitä — toisin kuin useimmat alan periaatejulistukset.

Luonnos ei silti ratkaise mitään yksin. Sen arvo mitataan siinä, miten noudattamista testataan ja mitä kuuden viikon palautteesta jää jäljelle loppuvuoden versioon.