Mistral julkaisi Shieldstralin, kolmen miljardin parametrin turvallisuusluokittelijan, joka arvioi sekä tekstiä että kuvia. Malli tuli saataville avoimin painoin Apache 2.0 -lisenssillä. Se pyörii yhdellä 16 gigatavun näytönohjaimella.

Yhtiön oman blogin mukaan malli yltää tekstiturvallisuudessa jopa seitsemän kertaa suurempien avointen vartijamallien tasolle. Varsinainen uutinen ei silti ole mallin koko. Se on tapa, jolla Shieldstral ottaa moderointisäännöt vastaan.

Moderointi kysymyksenä, ei kiinteänä luokitteluna


Tavanomaiset vartijamallit sisältävät kiinteän luokituksen haitallisista sisällöistä. Luokat koodataan mallin painoihin jo koulutusvaiheessa. Siirtyminen uuteen käyttökohteeseen vaatii siksi uudelleenkoulutuksen. Turvallisuuden määritelmät kuitenkin vaihtelevat sovelluksesta ja toimialasta toiseen.

Shieldstral kääntää asetelman ympäri. Kehittäjä kirjoittaa säännön tavallisena kysymyksenä vasta päättelyhetkellä. Kysymys voi olla esimerkiksi se, yllyttääkö sisältö väkivaltaan suojattua ryhmää kohtaan. Mallin painoihin ei kosketa lainkaan.

Pyyntö jakautuu kolmeen osaan. Ohje määrittää arviointikontekstin ja tiukkuustason, kysymys on yksittäinen kyllä tai ei -kysymys, ja kolmantena tulee arvioitava sisältö. Sisältö voi olla kehote, mallin vastaus, näiden muodostama pari tai kuva.

Malli lukee vastauksesta vain kyllä- ja ei-vaihtoehtojen logit-arvot. Ne normalisoidaan softmaxilla jatkuvaksi turvallisuuspisteeksi. Verdikti syntyy yhdellä läpimenolla ja yhdestä tokenista. Sama muotoilu kattaa kehotteiden luokittelun, vastausten moderoinnin ja kieltäytymisen tunnistuksen.

Yhden tokenin verdikti on myös suoritusteknisesti merkittävä. Moderointi ajetaan jokaiselle pyynnölle ja vastaukselle, joten vartijamallin viive kertautuu koko palvelussa. Kevyt läpimeno pitää lisäkustannuksen pienenä silloinkin, kun liikennettä on paljon.



Lasipaneeli jakaa valonsäteen vihreään ja keltaiseen kanavaan


Pieni malli, isojen mallien tulokset


Mistral vertasi Shieldstralia avoimiin vartijamalleihin neljällä akselilla. Ne ovat tekstiturvallisuus, kieltäytymisen tunnistus, sääntöjen mukautuvuus ja multimodaalinen turvallisuus. Kaikki arviointinäytteet oli erotettu koulutusaineistosta.

Mittauksissa kolmen miljardin parametrin malli vastaa tai päihittää jopa seitsemän kertaa suuremmat avoimet vartijamallit. Multimodaalisessa moderoinnissa yhtiö ilmoittaa uuden huipputason. Kuvan ja tekstin yhdistelmät kulkevat saman rajapinnan läpi kuin pelkkä teksti.

Selitys ei löydy arkkitehtuurista vaan koulutusdatasta. Julkiset turvallisuusaineistot käyttävät keskenään ristiriitaisia luokitteluja, merkintätapoja ja tarkkuustasoja. Osa merkitsee sisällön vain turvalliseksi tai turvattomaksi, osa käyttää monitasoista luokittelua.

Mistral muunsi jokaisen aineiston samaan ohje-kysymys-dokumentti-muotoon aineistokohtaisilla käsittelijöillä. Ohjeiden ja kysymysten sanamuotoja vaihdeltiin tarkoituksella, jotta malli yleistää eri ilmaisutapoihin. Tiukkuus kalibroitiin lähteittäin: tiukaksi vastakkainasetteluun rakennetulle datalle, lievemmäksi vastausten laatuaineistolle.

Toinen ratkaistava ongelma oli erottelukyvyn opettaminen ulkoa opettelun sijaan. Kiinteillä sääntöluokilla koulutettu malli oppii tunnistamaan vain nuo ennalta määritellyt luokat. Se ei opi päättelemään, missä yksittäisen säännön raja todella kulkee. Juuri tämä estää yleistymisen uusiin sääntöihin.



Pieni metallikuutio kolmen huomattavasti suuremman lohkon vieressä


Apache 2.0 ja Open Secure AI Alliance


Shieldstralin painot ovat vapaasti ladattavissa Apache 2.0 -lisenssillä. Lisenssi sallii kaupallisen käytön ja muokkaamisen ilman erillistä sopimusta. Käytännössä moderointi voidaan ajaa kokonaan omassa ympäristössä.

Mistral julkaisi mallin Open Secure AI Alliancen perustajajäsenenä. Liittouman muihin jäseniin kuuluu NVIDIA. Julkaisun rinnalla ilmestyi tekninen raportti, joka kuvaa koulutusaineiston käsittelyn ja arviointiasetelman.

Laitevaatimus on maltillinen. Yksi 16 gigatavun näytönohjain riittää mallin ajamiseen. Se pitää moderoinnin viiveen matalana ja poistaa tarpeen lähettää arvioitavaa sisältöä ulkopuoliseen palveluun.

Avoimet painot ratkaisevat myös auditoitavuuden. Voimassa olevaa linjausta voi tarkastella suoraan, koska sääntö on luettavassa muodossa kehotteessa. Suljetun rajapinnan takana tämä ei ole mahdollista.



Avoin teräksinen holvin ovi ja hehkuvat palvelinkaapit takana


Mitä tämä muuttaa tuotekehityksessä


Sama sisältö voi olla hyväksyttävää yhdessä palvelussa ja haitallista toisessa. Kyberturvallisuuden tutkimustyökalu sietää aineistoa, jota mielenterveyspalvelu ei voi näyttää käyttäjilleen. Kiinteään luokitteluun rakennettu vartijamalli ei taivu tähän eroon ilman uutta koulutusajoa.

Kun sääntö siirtyy kehotteeseen, linjausta voi muuttaa suoraan tuotannossa. Muutos näkyy heti seuraavassa pyynnössä. Yksi tarkistuspiste voi palvella useaa tuotetta, joilla on eri säännöt ja eri yleisö.

Kuvien ja tekstin arviointi samalla mallilla yksinkertaistaa myös arkkitehtuuria. Aiemmin monikanavaista sisältöä on jouduttu ohjaamaan erillisiin luokittelijoihin, joiden tulokset on pitänyt sovittaa keinotekoisesti yhteen. Yksi tarkistuspiste poistaa tämän välivaiheen kokonaan.

Jatkuva turvallisuuspiste antaa liikkumavaraa myös prosessiin. Kynnys voidaan asettaa tuotekohtaisesti, ja rajatapaukset voidaan järjestää varmuuden mukaan ihmisen tarkistettavaksi. Binäärinen leima ei tätä mahdollista.

Käyttöönotto vaatii silti työtä. Sääntökysymysten muotoilu vaikuttaa tulokseen, ja kynnysarvot on kalibroitava omalla aineistolla. Malli siirtää päätösvallan tuotetiimille, mutta myös vastuun rajanvedosta.



Kehittäjän työpiste hämärässä, kaksi näyttöä ja työasema


Yhteenveto


Shieldstral siirtää moderointisäännöt mallin painoista kehotteeseen. Yksi kolmen miljardin parametrin tarkistuspiste sopeutuu useaan tuotteeseen ja muuttuviin linjauksiin ilman uudelleenkoulutusta. Apache 2.0 -lisenssi ja yhden näytönohjaimen vaatimus pitävät käyttöönoton kynnyksen matalana.

Julkaisu jatkaa Mistralin linjaa, jossa yhtiö on tuonut markkinoille pieniä ja avoimia erikoismalleja yleiskäyttöisten mallien rinnalle.

Avointen vartijamallien kenttä on nojannut pitkälti suuriin malleihin. Mistralin tulokset viittaavat siihen, että koko ratkaisee vähemmän kuin koulutusaineiston huolellinen yhtenäistäminen.