Elokuun 20. päivä OpenRouteriin ilmestyi malli, jonka tekijää kukaan ei tiennyt. Ox Alpha tarjosi miljoonan tokenin kontekstin ilmaiseksi ja keräsi viikossa enemmän liikennettä kuin yksikään kilpailija. Nyt arvailu on ohi.

Z.ai vahvisti keskiviikkona, että Ox Alpha on yhtiön oma GLM-5.3-Flash. Painot ovat ladattavissa Hugging Facesta. SiliconANGLEn mukaan malli on kymmenen kertaa edullisempi ajaa kuin edeltäjänsä.

Viikon mittainen arvailu päättyi


Ox Alpha julkaistiin OpenRouterissa ja OpenCodessa nimettömänä. Malli otti vastaan tekstiä, kuvaa ja videota, ja sen konteksti-ikkuna oli miljoona tokenia. Käyttö oli täysin ilmaista noin viikon ajan.

Juuri ilmaisuus herätti epäilykset. Harva laboratorio pystyy jakamaan kärkitason mallia veloituksetta tällaisella volyymilla. Kehittäjät alkoivat etsiä vastausta tokenisaattorin sormenjäljestä.

Testit osoittivat Ox Alphan tokenisaattorin vastaavan GLM-perheen mallia lähes jokaisessa kokeessa. Z.ai vahvisti asian 26. elokuuta. Yhtiö kertoi käyttäneensä salanimeä kerätäkseen palautetta ennen virallista julkaisua.

Jakelun mittakaava teki arvoituksesta poikkeuksellisen. Z.ai ilmoitti mallin palvelukapasiteetiksi sata biljoonaa tokenia vuorokaudessa. Harva toimija pystyy antamaan sellaista tarjontaa pois ilman laskutusta.



Pimeä konesalikäytävä, jossa yksi merkitsemätön musta laitekaappi ja himmeät jäähdytysvalot


Harva aktivointi pitää hinnan alhaalla


GLM-5.3-Flash on 320 miljardin parametrin Mixture of Experts (MoE) -malli. Se aktivoi vain 18 miljardia parametria vastausta kohti. Tämä harva aktivointi on tekninen syy sille, miksi hinta voi olla näin matala.

Arkkitehtuurin suurin muutos koskee attention-mekanismia. Malli käyttää harvaa attentiota, joka käy läpi vain olennaisimmat tokenit koko syötteen sijaan. Lineaarinen attentio puolestaan hillitsee muistin kasvua: kun syöte kaksinkertaistuu, muistintarve kaksinkertaistuu nelinkertaistumisen sijaan.

Vastaus voi olla enintään 131 072 tokenia pitkä. Koulutusaineisto käsitti 30 biljoonaa tokenia. Z.ai käytti koulutuksessa mHC-menetelmää, joka vähentää gradienttien vääristymistä niiden kulkiessa mallin kerrosten läpi.

Z.ai vertasi mallia Claude Opus 4.8:aan, GPT-5.6 Terraan ja Gemini 3.7 Flashiin. GLM-5.3-Flash sai parhaat pisteet GDPval-AA v2 -testissä, joka mittaa tietotyön suorittamista. AutomationBench-vertailussa, joka arvioi tehtävien tekemistä pilvisovelluksissa, se ylsi toiseksi.



Lähikuva tiheästä piirilevystä, jossa vain pieni osa siruista hehkuu lämpimän keltaisena


Kiinalaiset sirut kantoivat huippukuorman


Z.ai:n toimitusjohtaja Jie Tang nosti julkaisun yhteydessä esiin infrastruktuurin. Hänen mukaansa Ox Alpha ajettiin koko ilmaisviikon ajan kotimaisilla kiinalaisilla tekoälysiruilla. Yhtiö rakensi oman päättelymoottorinsa SGLangin päälle.

Z.ai ei kerro, mitä siruja se käytti. Yhtiö myöntää yksiköiden olevan laskentateholtaan ja muistiltaan rajallisempia kuin Nvidian vastaavat. GLM-5.3:a hyödynnettiin pienemmän sisarmallinsa palvelinpinon optimointiin.

Tausta selittää painotuksen. Z.ai on ollut Yhdysvaltain Entity List -listalla alkuvuodesta 2025 eikä käytännössä voi ostaa amerikkalaisia kiihdyttimiä. GLM-5.1 ja GLM-5.2 koulutettiin Huawein Ascend-piireillä.

Uutta on päättelypuoli. Mallin kouluttaminen kotimaisella raudalla hallitussa ympäristössä on eri asia kuin ennakoimattoman yleisöliikenteen palveleminen viikon ajan. Jälkimmäistä on vaikea teeskennellä, koska ulkopuoliset seuraavat lukuja reaaliajassa.



Puolijohdetehtaan puhdastila, jossa käsineytetyt kädet pitelevät piikiekkoa


Mitä numerot kertovat markkinasta


Artificial Analysis -indeksissä GLM-5.3-Flash sai 57 pistettä ja sijoittui kahdeksanneksi. Tulos on sama kuin OpenAI:n GPT-5.6 Terralla. Googlen Gemini 3.7 Flash jäi pisteen taakse.

Hinta erottaa mallit toisistaan. Miljoona syötetokenia maksaa 0,15 dollaria ja miljoona vastaustokenia 0,50 dollaria. Tang kuvaa tasoa sadasosaksi kärkimallien hinnasta.

OpenRouterin luvut tukevat väitteitä. Ox Alphaa kutsuttiin 20.–26. elokuuta 340 miljoonaa kertaa, ja se käsitteli yhteensä 27,2 biljoonaa tokenia. Z.ai:n osuus viikon tokeneista nousi 24 prosenttiin, kun DeepSeek putosi 16 prosenttiin.

Kesän ajan Z.ai:n osuus oli pyörinyt kolmen ja yhdeksän prosentin välillä. Ensimmäistä kertaa seurantajaksolla yhtiö ohitti DeepSeekin. Se tapahtui samalla, kun mallia jaettiin ilmaiseksi.



Eri korkuisia läpikuultavia lasipalikoita tummalla heijastavalla pinnalla sinisessä reunavalossa


Yhteenveto


Ox Alphan paljastuminen GLM-5.3-Flashiksi sulkee viikon kestäneen arvailun, mutta kiinnostavin osa ei ole mallin nimi. Se on väite siitä, että kiinalainen laboratorio pystyi palvelemaan kärkitason mallia maailmanlaajuiselle yleisölle kotimaisilla siruilla ilman katkoja.

Painot ovat nyt Hugging Facessa, joten väitteitä voi arvioida itse. Hinnoittelu asettaa paineen niille tarjoajille, jotka veloittavat samasta suorituskyvystä kymmen- tai kaksikymmenkertaisesti.