Kiinalainen Z.ai julkaisi GLM-5.3:n, joka on yhtiön mukaan tehokkain avoimilla painoilla saatava koodausmalli. Malli rakentuu samalle perusmallille kuin edeltäjänsä GLM-5.2. Kaikki parannukset syntyivät jälkikoulutuksesta, eivät suuremmasta pohjamallista. Z.ai:n julkaisutiedotteen mukaan kyseessä on tällä hetkellä paras avoimilla painoilla saatava vaihtoehto agenttipohjaiseen koodaukseen.

Julkaisun kiinnostavin osa ei kuitenkaan ole vertailuluku. Z.ai kertoo, että mallin kyberturvallisuuskyvyt kehittyivät nopeammin kuin yhtiö osasi odottaa. Siksi painojen julkaisu siirtyy noin kahdella viikolla eteenpäin. Kyseessä on ensimmäinen kerta GLM-sarjan historiassa, kun painoja pidätellään nimenomaan turvallisuusarvioinnin vuoksi.

Kaikki parannukset tulivat jälkikoulutuksesta


Z.ai kasvatti jälkikoulutuksen laajuutta kolmella tavalla: enemmän harjoitusympäristöjä, monipuolisempia tehtäviä ja lisää vahvistusoppimisen laskentaa. Pohjamallia ei koulutettu uudelleen. Sama perusmalli tuottaa siis eri tuloksen ilman uutta esikoulutusajoa.

Tulokset näkyvät selvimmin pitkäkestoisissa tehtävissä. Terminal-Bench 3.0 -testissä pistemäärä nousi 4,6:sta 28,3:een. DeepSWE v1.1 -vertailussa malli parani 46,2:sta 66,9:ään ja AutomationBench-testissä 26,2:sta 48,2:een.

Yhtiön oma Z.ai Code Bench -mittari kertoo saman. Suurimmalla päättelyteholla GLM-5.3 ylsi 34,5 prosenttiin, kun GLM-5.2 jäi 23,4 prosenttiin. Samalla token-kulutus laski noin 96 000:sta 75 000:een tehtävää kohden. Pienemmällä päättelyteholla malli ohitti Claude Opus 4.8:n selvästi vähemmällä laskennalla.

Kaikki luvut ovat valmistajan itsensä ilmoittamia ja ajettu Z.ai:n omassa testiympäristössä. Riippumattomat arvioijat pääsevät toistamaan tulokset vasta, kun painot julkaistaan. Se tekee elokuun lopusta julkaisun todellisen koetinkiven.



Tutkimuslaboratorion näyttöseinä, jolla nousevia vertailukäyriä ja koulutuskuvaajia


Kyberkyvykkyys kasvoi nopeammin kuin yhtiö odotti


Z.ai lisäsi jälkikoulutukseen haavoittuvuuksien etsintään tarkoitettuja tehtäviä ja ympäristöjä. Tavoite oli parantaa mallin kykyä löytää yksittäisiä ohjelmistovirheitä. Sen sijaan malli alkoi suunnitella kokonaisia hyväksikäyttöketjuja useassa vaiheessa.

CyberGym-vertailu mittaa haavoittuvuuksien löytämistä ja varmistamista lähdekoodista. Siinä GLM-5.3 sai 84,5 prosenttia, kun edeltäjä jäi 77,2 prosenttiin. Yhtiön omien lukujen mukaan tulos on niukasti edellä Anthropicin Mythos 5:tä ja OpenAI:n GPT-5.6 Solia.

Etumatka katoaa, kun siirrytään varsinaiseen hyväksikäyttöön. ExploitBench-testissä GLM-5.3 ylsi 54,4 prosenttiin eli yli kaksinkertaisti edeltäjänsä tuloksen. Mythos 5 ja GPT-5.6 Sol jäävät kuitenkin selvästi edelle 78,0 ja 76,5 prosentin pistemäärillä.

Sama kuvio toistuu ExploitGym-testissä. GLM-5.3 suoritti 105 tehtävää kahdessa tunnissa ja 130 kuudessa tunnissa. Suljetut huippumallit ylsivät samassa ajassa 181 ja 247 tehtävään. Mitä pidemmälle hyökkäysketjussa mennään, sitä suurempi ero avoimeen malliin jää.



Hämärä kyberturvallisuuden valvomo ja näytöllä haarautuva hyökkäysketjun kaavio


2 436 haavoittuvuutta oikeista ohjelmistoista


Z.ai ei jättänyt kykyä pelkkien vertailutestien varaan. Yhtiö on ajanut malleja oikeita koodikantoja vastaan yhdessä kiinalaisten tietoturvatiimien kanssa. Mukana ovat muun muassa NSFOCUS, CyberKunlun sekä Tsinghuan ja Nankain yliopistojen tutkijat.

Asiantuntijatarkistuksen ja päällekkäisyyksien poiston jälkeen mallit löysivät 2 436 haavoittuvuutta 269 projektista. Niistä 1 097 luokiteltiin kriittisiksi tai vakaviksi. Julkaisuhetkellä 53 oli julkistettu ja 2 383 oli yhä julkaisukiellossa.

Löydökset ulottuvat käyttöjärjestelmien ytimiin, selainmoottoreihin, verkkoprotokolliin ja avoimen lähdekoodin infrastruktuuriin. Moni virhe oli ollut huomaamatta vuosia. Vanhin löydös juontaa Z.ai:n mukaan vuoteen 1981.

Yhtiö kehystää työn puolustukselliseksi ja on koonnut löydökset omaan julkiseen rekisteriinsä. Sama kyky palvelee kuitenkin molempia osapuolia. Juuri se tekee painojen jakelusta hankalan päätöksen.



Vanhoja palvelinräkkejä hämärässä varastossa, yksi räkki tarkastusvalon valaisemana


Painot tulevat kahden viikon viiveellä


GLM-5.2:n painot ilmestyivät Hugging Faceen MIT-lisenssillä päivien sisällä tilausversion julkaisusta. GLM-5.3 toimii toisin. Z.ai kertoo julkaisevansa painot noin kaksi viikkoa lanseerauksen jälkeen, kun turvallisuusarviointi ja kovennus ovat valmiit.

Viive liittyy suoraan kyberkyvykkyyteen. Avoimet painot ovat peruuttamattomia: kuka tahansa voi ladata mallin, poistaa siitä turvakoulutuksen ja ajaa sitä paikallisesti ilman että palveluntarjoaja näkee mitään. Kuvio ei ole Z.ai:lle ainutlaatuinen, sillä OpenAI rakensi hiljattain erillisen kyberturvallisuuteen viritetyn mallin ja lykkäsi toisen julkaisua hyökkäyksellisten kykyjen vuoksi.

Odotusaikana malli on käytettävissä GLM Coding Plan -tilauksen ja ZCode-ympäristön kautta. Se toimii myös Claude Coden, Codexin, Clinen ja OpenCoden kaltaisissa agenteissa Anthropic- ja OpenAI-yhteensopivien rajapintojen kautta. Herkimmät kyberturvallisuustoiminnot on rajattu erillisen luotettujen käyttäjien ohjelman taakse.

Yleistä API-hinnoittelua Z.ai ei ole vielä kertonut, mikä vaikeuttaa tuotantokustannusten vertailua kilpaileviin huippumalleihin. Myös Kiinan tiedustelulainsäädäntö tuo asetelmaan oman ulottuvuutensa, sillä rajapinnan kautta ajettu koodi kulkee Z.ai:n pilvi-infrastruktuurin läpi. Painojen julkaisu poistaa tämän kysymyksen niiltä, jotka ajavat mallia omalla raudallaan.



Raskas teräksinen holvin ovi raollaan modernin konesalin käytävällä


Yhteenveto


GLM-5.3 osoittaa, että agenttikyvyt voivat kasvaa merkittävästi ilman uutta perusmallia. Pelkkä jälkikoulutuksen laajentaminen riitti nostamaan pitkäkestoiset koodaustehtävät uudelle tasolle. Sama havainto toistuu nyt useassa laboratoriossa.

Julkaisun toinen viesti on hankalampi. Kun avoin malli lähestyy suljettuja huippumalleja juuri hyökkäyksellisissä tietoturvakyvyissä, kysymys mallien jakelutavasta muuttuu yhtä tärkeäksi kuin kysymys niiden kouluttamisesta. Lähiviikkojen kysymys on, pitävätkö luvut kutinsa muiden kuin Z.ai:n testipenkissä.