OpenAI esitteli 19. elokuuta järjestelmän, joka etsii mallien väärinkäyttöä säilyttämättä asiakkaiden sisältöä. Private Safety Processing on esikatselussa valituilla rajapinta-asiakkailla. Yhtiön mukaan tehokkaimpien mallien käyttö ei enää edellytä kehotteiden luovuttamista.
Taustalla on kiristyvä kilpailu yritysasiakkaista. Moni organisaatio on joutunut valitsemaan parhaan mallin ja tiukimman tietosuojan väliltä. Osa viimeaikaisista huippumallien käyttöönotoista on edellyttänyt, että asiakas sallii palveluntarjoajan säilyttää arkaluonteista sisältöä turvavalvontaa varten. OpenAI:n virallisen blogin mukaan tätä valintaa ei jatkossa tarvitse tehdä.
Julkistus osuu herkkään kohtaan. Anthropic linjasi hiljattain, että sen tehokkaimmat mallit jäävät nollaretention ulkopuolelle. OpenAI asettuu nyt näkyvästi vastakkaiselle kannalle.
Mitä Private Safety Processing tekee
Nollaretentio eli Zero Data Retention on rajapinta-asiakkaille tarjottu järjestely. Siinä kehotteita ja mallin vastauksia ei säilytetä sen jälkeen, kun pyyntö on käsitelty. Yhtiön henkilöstö ei pääse sisältöön käsiksi.
Yritysasiakkaiden dataa ei myöskään käytetä mallien kouluttamiseen ilman erillistä suostumusta. Järjestely on ollut käytössä jo pitkään, mutta se on rajattu kelpoisuusehdot täyttäviin asiakkaisiin. Kaikki rajapinnan käyttäjät eivät siis saa sitä automaattisesti.
Ongelma on nykyisten turvajärjestelmien kapea näkökenttä. Ne arvioivat jokaisen vuorovaikutuksen erikseen. Se riittää huonosti silloin, kun malli tekee pitkiä ja monivaiheisia agenttitehtäviä. Osa vakavista riskeistä tulee näkyviin vasta useamman vuorovaikutuksen ketjussa.
Hyökkääjä voi myös jakaa pyyntönsä tarkoituksella useaan istuntoon. Yksittäinen keskustelu näyttää tällöin harmittomalta, vaikka kokonaisuus ei olisi. OpenAI mainitsee esimerkkinä haittaohjelman rakentamisen pieninä paloina.
Private Safety Processing laajentaa tarkastelun toisiinsa liittyvien istuntojen yli. Automaattinen järjestelmä etsii toistuvia kuvioita, mutta OpenAI:n työntekijät eivät näe taustalla olevaa sisältöä. Kun riski tunnistetaan, yhtiö saa vain kapean signaalin toiminnan tyypistä ja päättää sen perusteella jatkotoimista.

Kaksi tapaa ratkaista sama ongelma
Anthropic on päätynyt toisenlaiseen ratkaisuun. Yhtiö luokittelee tehokkaimmat mallinsa katetuiksi malleiksi, joiden kohdalla kehotteet ja vastaukset säilytetään 30 päivää. Listalla ovat sekä Claude Fable 5 että Claude Mythos 5.
Käytännössä nollaretentio ei siis koske Anthropicin kärkimalleja. Perustelu on sama havainto kuin OpenAI:lla: osa hyökkäyksistä paljastuu vasta useaa pyyntöä vertaamalla. Ero on siinä, kenen hallussa vertailtava aineisto on.
TechCrunchin mukaan linjaus on ärsyttänyt osaa Anthropicin asiakkaista. Organisaatiot, jotka ottivat nollaretention käyttöön juuri rajatakseen palveluntarjoajan säilytysaikaa, joutuvat nyt arvioimaan ehdot uudelleen. Muutos koskee myös aiemmin tehtyjä sopimuksia.
Molemmat yhtiöt tekevät siis saman diagnoosin mutta eri hoitopäätöksen. Anthropic kerää aineistoa, jotta pitkän aikavälin hyökkäykset erottuvat. OpenAI yrittää saada saman näkyvyyden ilman aineiston keräämistä.
OpenAI hakee tästä selvää kilpailuetua. Yhtiö korostaa, ettei asiakkaan tarvitse valita mallin kyvykkyyden ja oman tietosuojalupauksensa väliltä. Väite on markkinointia, mutta se osuu aitoon hankintakriteeriin.

Missä asiakkaan data sijaitsee
Nollaretentiokäytössä asiakkaan sisältö pysyy asiakkaan hallitsemassa infrastruktuurissa. OpenAI kehittää lisäksi vaihtoehtoa, jossa sisältö tallennetaan yhtiön omaan infrastruktuuriin mutta salataan asiakkaan hallitsemilla avaimilla.
Avainten hallinta on tässä olennaista. OpenAI:lla ei kuvauksen mukaan ole kopiota asiakkaan avaimista, joten se ei voi purkaa sisältöä. Valvonta ja pääsy on siis tarkoituksellisesti erotettu toisistaan.
Molemmissa tapauksissa automaattiset järjestelmät voivat tunnistaa väärinkäytön ja palauttaa rajatun turvasignaalin. Alkuperäiset kehotteet ja vastaukset eivät kulkeudu ihmisen luettavaksi. Signaali kertoo toiminnan tyypin, ei sen sisältöä.
Eurooppalaiselle ostajalle ero on merkittävä. Sääntelyn ja omien asiakaslupausten takia moni organisaatio ei voi antaa palveluntarjoajan säilyttää arkaluonteista aineistoa lainkaan. Terveydenhuolto, rahoitusala ja julkishallinto törmäävät rajaan säännöllisesti.
Näissä ympäristöissä säilytysaika on usein kirjattu suoraan sopimukseen tai riskiarvioon. Kolmenkymmenen päivän ikkuna voi yksinään estää käyttöönoton, vaikka malli olisi teknisesti paras vaihtoehto.

Mitä on vielä auki
Järjestelmä on esikatselussa eikä yleisesti saatavilla. OpenAI testaa sitä varhaisten asiakkaiden kanssa ja aikoo aloittaa laajemman käyttöönoton syyskuussa. Samalla on määrä julkaista tekninen kuvaus toteutuksesta.
Yhtiö ei ole vielä julkisesti osoittanut, että istuntojen välinen tunnistus yltää samaan tarkkuuteen kuin sisältöä säilyttävät menetelmät. Myöskään salauksen ja signaalien tekniset yksityiskohdat eivät ole julkisia. Lupaus on toistaiseksi arvioitava sellaisenaan.
Yksi poikkeus on kirjattu selvästi. Lapsiin kohdistuvaksi hyväksikäyttömateriaaliksi merkityt kuvat säilytetään manuaalista tarkastusta ja lakisääteistä ilmoitusta varten myös nollaretentiokäytössä. Poikkeus on ollut voimassa jo aiemmin.
Avoimeksi jää myös se, kuinka laajalle kelpoisuusehdot ulottuvat. Nollaretentio on tähän asti ollut rajattu järjestely, eikä OpenAI ole kertonut, muuttuvatko ehdot uuden valvontatavan myötä.

Yhteenveto
OpenAI siirtää tietosuojan kilpailutekijäksi. Jos Private Safety Processing toimii luvatulla tavalla, tehokkaimpien mallien käyttö ei enää edellytä sisällön luovuttamista mallintoimittajalle. Anthropicin 30 päivän säilytys asettuu tätä vasten selvästi tiukemmaksi vaatimukseksi.
Ratkaiseva hetki on syyskuu. Silloin nähdään, kuinka tarkasti pelkkiin signaaleihin nojaava valvonta löytää väärinkäytön ja mitä tekninen kuvaus kertoo salauksen toteutuksesta. Vasta se antaa asiakkaalle mahdollisuuden arvioida lupausta itsenäisesti.
Siihen asti hankintaa harkitsevan kannattaa lukea sopimusehdot mallikohtaisesti. Säilytyskäytäntö voi vaihdella saman toimittajan mallien välillä, eikä yleinen tietosuojalupaus kerro sitä.
