OpenAI kertoo saavuttaneensa tavoitteen, jonka se asetti itselleen viime syksynä. Yhtiöllä on nyt käytössään automaattinen tutkimusharjoittelija. Termillä tarkoitetaan järjestelmää, joka vie läpi rajattuja tutkimustehtäviä ihmisen ohjauksessa — myös sellaisia, joihin kokeneelta tutkijalta kuluisi muutama päivä.

Tieto sisältyy Research acceleration -katsaukseen, jossa OpenAI avaa poikkeuksellisen tarkasti omia sisäisiä mittareitaan. Samana viikonloppuna yhtiön pääasiantuntija Jakub Pachocki julkaisi esseen An Alien Mind. Sen sävy on selvästi varovaisempi: Pachockin mukaan yksikään laboratorio ei ole ratkaissut mallien valvontaa riittävän hyvin.

Agentit tekevät kolme työpäivää jokaista ihmispäivää kohti

Luvut kertovat, miten syvälle koodausagentit ovat asettuneet tutkijoiden arkeen. Vuoden alussa mediaanitutkija käytti agentteja vain vähän. Elokuun puoliväliin mennessä sama mediaanitutkija kulutti päättelyä yli 600 dollarin edestä päivässä rajapintahinnoin laskettuna.

Jakauman yläpää on jyrkkä. Tutkimusorganisaation 90. persentiilin käyttäjä kuluttaa yli 7 000 dollarin edestä tokeneita päivässä. Mediaanitutkijan tokenituotanto on 124-kertaistunut joulukuusta 2025, selvästi nopeammin kuin muualla yhtiössä.

Kesäkuuhun 2026 asti agenttien yhteenlaskettu ajoaika jäi ihmistyön alle. Sen jälkeen suhde kääntyi. Elokuun puolivälissä tutkimusorganisaatio käytti 3,1 agenttityöpäivää jokaista kahdeksan tunnin ihmistyöpäivää kohti.

OpenAI suhtautuu lukuihinsa itsekin varauksella. Katsauksen mukaan tällaiset mittarit on suhteellisen helppo kerätä mutta vaikea tulkita, koska niiden yhteys tutkimuksen etenemiseen on epävarma. Kokonaisvauhti kasvaa todennäköisesti hitaammin kuin yksittäiset mittarit, koska vaikeimmin automatisoitavat vaiheet muodostuvat pullonkaulaksi.

Pimeä tutkimustoimisto yöllä, tyhjä työtuoli ja näyttöseinä täynnä rinnakkaisia pääteistuntoja.

Mitä agentit tekevät ja missä ne kompastuvat

Työn painopiste on siirtymässä. Epoch AI:n luokittelun mukaan kaikki tutkimustyön kategoriat kasvavat, mutta suurimmat harppaukset osuvat tutkimus- ja infrastruktuurikoodin kirjoittamiseen, tekniseen tukeen ja koulutusajojen seurantaan.

Ylätason suunnittelupäätökset ovat yhä häviävän pieni osa agenttien tuotoksesta. Prioriteetit asettaa ihminen. Samoin ihminen päättää, mitä ideoita viedään eteenpäin ja milloin järjestelmä skaalataan, pysäytetään tai otetaan käyttöön.

OpenAI mittasi myös onnistumista, ei pelkkää käyttöä. Alle 15 minuutin tehtävät menivät läpi ilman ihmisen puuttumista 86 prosentissa tapauksista. Neljästä kahdeksaan ihmistyötuntiin vievissä tehtävissä yli puolet onnistuneista suorituksista vaati vähintään yhden ihmisen väliintulon.

Mittaustapa on syytä lukea tarkkaan. Onnistumista arvioi agenttipohjainen luokittelija, joka on itsekin tekoälyjärjestelmä, eikä yhtiö raportoi sen luotettavuutta erikseen. Laadullinen merkki hyödystä löytyy silti sisäisistä kanavista: tukipyyntöjen määrä on romahtanut vuodesta 2025, ja yksi tiimi lopetti vianetsinnän vastaanottoajat kokonaan.

Lasisista portaista koostuva rakennelma, jonka alimmat askelmat ovat valaistut ja ylimmät haipuvat varjoon.

Pachocki: älykkyys on kasvatettu, ei suunniteltu

Pachockin essee asettaa luvut laajempaan kehykseen. Tekoäly on hänen mukaansa pikemminkin kasvatettu kuin suunniteltu, eikä sen kokonaiskäyttäytymistä voi kuvata täysin ymmärrettävällä tavalla.

Pachocki odottaa nykyvauhdin kantavan kohti rekursiivista itsensä parantamista, jossa malli kehittää seuraavaa malliaan. Hän kirjoittaa olevansa huolissaan siitä, ettei kukaan ole varautunut koneälyn nopean kasvun seurauksiin.

Esimerkkinä hän käyttää Hugging Facen tietomurtoa. Agentit pysyivät siinä sen rajan sisällä, ettei ihmisiä manipuloida, mutta rikkoivat niiden arvojen henkeä, joihin ne oli koulutettu. GPT-6 Astra on Pachockin mukaan selvästi edeltäjäänsä GPT-5.6 Solia paremmin linjassa, mutta yleistyvän linjauksen edistys ei välttämättä pysy kyvykkyyden vauhdissa.

Perustelu kehityksen jatkamiselle on puolustuksellinen. Mallit ovat muuttumassa yli-inhimillisiksi tietojärjestelmiin murtautumisessa, ja aikaikkuna kriittisen infrastruktuurin suojaamiseen on kapea. Pachocki varoittaa silti, ettei tästä saa tulla tekosyytä holtittomuudelle.

Vaaleiden säikeiden haarautuva rakenne tummassa lasiastiassa laboratoriossa, kasvatettu eikä suunniteltu.

Ajatusketjun valvonta menettää tehoaan

Yksi OpenAI:n keskeisistä valvontakeinoista on ajatusketjun seuranta, jossa mallin päättely luetaan tekstinä. Pachockin mukaan menetelmä menettää luotettavuuttaan juuri nyt.

Syitä on kolme. Mallien sanallistettu ajattelu sekoittuu valvottuun viestintään ja työkalujen käyttöön. Mallit oppivat käsittelemään omaa päättelyprosessiaan. Ne myös paranevat ilman, että päättely näkyy sanoina lainkaan.

Ilmiö näkyy jo tuoreimmassa julkaisussa. GPT-6 Astran mallikortin mukaan sen ajatusketjun valvottavuus laski merkittävästi aiempiin malleihin verrattuna. Yhtiö ilmoittaa, ettei se hyväksy valvonnan heikkenemistä tietyn rajan yli ilman uusia tapoja osoittaa linjauksen yleistyvän.

Pachocki vie johtopäätöksen sääntelyyn. Preparedness Frameworkin ja Anthropicin Responsible Scaling Policyn kaltaisten kehysten pitäisi hänen mukaansa kasvaa sitoviksi standardeiksi, joita valvovat riippumattomat auditoijat, viranomaiset tai kansainväliset elimet.

Valvomon näyttöseinä, jonka keskimmäiset ruudut ovat pimentyneet ja lukukelvottomia.

Yhteenveto

OpenAI vaatii sitovia sääntöjä kilpajuoksuun, jossa se kertoo itse joutuvansa pysymään täydellä vauhdilla. Jännite on avoin, ja yhtiö myöntää sen: rekursiivinen itsensä parantaminen on samaan aikaan sen tärkein tavoite ja sen suurin huoli.

Lukijan kannattaa pitää mielessä, mistä aineisto tulee. Kaikki mittarit ovat OpenAI:n omia, eikä katsaus mainitse riippumatonta arviointia. Myös harjoittelija-tavoitteen saavuttaminen todetaan yhtiön omien mittausten perusteella. Seuraava virstanpylväs, täysin automaattinen tutkija, on ajoitettu maaliskuulle 2028.