Alibaban Qwen3.8-Max nousi torstaina Artificial Analysisin agenttivertailun kärkeen. Kärkisija ei kestänyt päivää: vertailun tekijä julkaisi samana päivänä menetelmäpäivityksen, joka pudotti mallin toiseksi.

Lopputulos on silti merkittävä. Avoimin painoin julkaistavaksi luvattu kiinalaismalli asettui käytännössä tasoihin Claude Opus 5:n kanssa riippumattomassa agenttimittauksessa. Aiemmin kärkipaikat ovat kuuluneet suljetuille malleille.

Kärkisija kesti muutaman tunnin


Artificial Analysisin agenttivertailu mittaa työkalujen käyttöä, suunnittelua, itsenäistä toimintaa ja monimutkaista ongelmanratkaisua. Se on painotettu keskiarvo agenttikyvykkyyden mittareista, ei yksittäinen testi.

Torstai-iltana lukema näytti Qwenille 55,4 pistettä ja Claude Opus 5:lle 55,3. Muutamaa tuntia myöhemmin järjestys oli kääntynyt: Opus 5 maksimipanostuksella 59,2 ja Qwen3.8-Max 58,4.

Artificial Analysisin George vahvisti muutoksen syyn keskustelupalstalla. Kyse oli ennalta suunnitellusta päivityksestä, jossa vertailun tarkastajamallit yhtenäistettiin. HLE-, AA-LCR- ja AA-Omniscience-testit siirtyivät GPT-5.6 Lunan arvioitaviksi.

Ero kärkikaksikon välillä on alle piste. Käytännössä mallit ovat mittaustarkkuuden rajoissa samalla tasolla, ja järjestys voi kääntyä seuraavan päivityksen myötä kumpaan suuntaan tahansa.

Tapaus muistuttaa siitä, kuinka herkkiä agenttivertailut ovat mittaustavalle. Tarkastajamallin vaihtaminen riitti kääntämään kärkisijan, vaikka mitattavat mallit eivät muuttuneet lainkaan. Yksittäiseen sijoituslukemaan kannattaa siksi suhtautua suuntaa antavana.



Kaksi lähes samankorkuista hehkuvaa pylvästä ja mittatulkki niiden välissä


Mitä Qwen3.8-Max on


Qwen3.8-Max julkaistiin yleiseen käyttöön 3. elokuuta. Sitä ennen malli oli ollut heinäkuun puolivälistä asti esikatselussa rajatulla käyttäjäjoukolla.

Malli on harva asiantuntijasekoitus (mixture of experts) eli MoE-arkkitehtuuri. Parametreja on yhteensä 2,4 biljoonaa, mutta yhtä kyselyä kohden aktivoituu noin 95 miljardia. Käytännössä laskentakuorma vastaa 95 miljardin parametrin mallia, vaikka verkko on kaksikymmenkertainen.

Konteksti-ikkuna yltää miljoonaan tokeniin. Malli ottaa sisään tekstiä, kuvaa ja videota ja tuottaa tekstiä. Hinta on 2 dollaria miljoonalta syötetokenilta ja 6 dollaria miljoonalta tuotetulta tokenilta.

Alibaba on rakentanut mallin päivien mittaisiin tehtäviin yksittäisten vastausten sijaan. Yhtiön mukaan malli toisti tutkimusartikkelin kaikki kuusi päätulosta, testasi sen jälkeen 18 omaa ideaansa ja ylitti artikkelin menetelmän AIME24-testissä 2,7 pisteellä.

Alibaba kertoo mallin suoriutuneen myös yli kymmenen päivän ohjelmistoprojekteista ja sirusuunnittelun iteratiivisesta optimoinnista. Väitteet ovat yhtiön omia, eikä ulkopuolisia toistoja ole. Suunta on silti selvä: markkinointi ei enää korosta keskustelua vaan itsenäistä työskentelyä.



Solmupallo, jossa vain pieni osa solmuista hehkuu aktiivisena


Vahvuudet ja selvät aukot


Alibaban julkaisema vertailutaulukko jakautuu kolmeen osaan. Agentti- ja monimediatehtävissä malli on kärjessä tai lähellä sitä.

Terminal-Bench 2.1 -testissä tulos on 86,6 pistettä, mikä ohittaa Claude Opus 4.8:n ja Claude Fable 5:n lukeman 84,6. PaperBench-testissä 93,0 on taulukon paras. OSWorld-Verified-testissä tietokoneen käytöstä irtoaa 86,1 pistettä.

Syvässä ohjelmistotyössä kuva kääntyy päinvastaiseksi. SWE-bench Pro -testissä Qwen jää lukemaan 67,7, kun Fable 5 yltää 80,0:aan. FrontierSWE-testissä ero on vielä suurempi: 73,5 vastaan 88,8. Nämä eivät ole pyöristysvirheitä.

Päättelyssä edistystä ei juuri tapahtunut. GPQA Diamond nousi edeltäjän lukemasta 92,4 vain lukemaan 92,6. Kaikki luvut ovat lisäksi Alibaban omalla testipenkillä mitattuja, eikä riippumattomia toistoja ole vielä julkaistu.

Edeltäjäänsä vastaan harppaus on sitäkin suurempi. DeepSWE 1.1 nousi lukemasta 21,6 lukemaan 56,6, FrontierSWE lukemasta 40,7 lukemaan 73,5 ja JobBench lukemasta 31,3 lukemaan 53,4. Kehitys on kohdistunut juuri sinne, missä edellinen sukupolvi oli heikoimmillaan.



Hehkuva pylväsdiagrammi, jossa osa pylväistä jää selvästi muita lyhyemmiksi


Avoimet painot ja avoin lisenssikysymys


Alibaba lupasi julkaista Qwen3.8-Maxin painot Hugging Facessa ja ModelScopessa. Samalla on tarkoitus julkaista pienempi Qwen3.8-27B.

Lisenssiehtoja ei ole kerrottu. Se on olennainen puute, sillä Qwenin avoimet mallit ovat historiallisesti käyttäneet Apache 2.0 -lisenssiä, kun taas kilpailijan Kimi K3:n lisenssiin sisältyi liikevaihto- ja attribuutioehtoja. Ennen lisenssitekstä avoimuus on lupaus eikä ominaisuus.

Käytännön mielessä 2,4 biljoonan parametrin tarkistuspiste on datakeskuksen artefakti. Sitä ei aja kukaan yhdellä koneella, vaikka lisenssi sallisi mitä. Kiinnostavampi julkaisu on 27 miljardin parametrin versio, joka mahtuu tavalliselle palvelinraudalle.

Rajapinta tukee sekä OpenAI:n Chat Completions -muotoa että Anthropicin protokollaa. Malli kytkeytyy siis suoraan Claude Codeen, Codexiin ja Qwen Codeen ilman muuta muutosta kuin osoitteen ja mallitunnisteen vaihto. Erillisellä reasoning_effort-parametrilla valitaan kolmesta tasosta nopeuden ja perusteellisuuden välillä.



Raollaan oleva holvin ovi, jonka aukon yli on yhä vedetty sinetti


Yhteenveto


Qwen3.8-Max kavensi eron kärkeen agenttitehtävissä olemattomaksi, mutta jätti selvän aukon syvään ohjelmistotyöhön. Kärkisijan menetys menetelmäpäivityksessä kertoo lähinnä siitä, kuinka tiukka kilpailu on.

Kolme asiaa ratkaisee, muuttaako julkaisu mitään käytännössä: lisenssiteksti, 27 miljardin version mittaustulokset ja ensimmäinen riippumaton toisto agenttiluvuista. Yksikään niistä ei ole vielä olemassa.