Viime viikonlopun merkittävin malliuutinen ei tullut OpenAI:lta, Anthropicilta tai Googlelta. Alibaba julkaisi perjantaina Hugging Facessa Qwen3.8-27B:n, 27 miljardin parametrin avoimen mallin, jonka painot saa ladata Apache 2.0 -lisenssillä. Kolmessa päivässä lataukset ylittivät kolme miljoonaa.
Syy kehittäjäyhteisön poikkeuksellisen voimakkaaseen reaktioon on yksinkertainen. Malli on tarpeeksi pieni pyörimään tehokkaassa pöytäkoneessa, mutta yltää riippumattomissa vertailuissa lähelle pilvipalveluna myytäviä kärkimalleja.
Pieni malli, kärkitason pisteet
Alibaban omat julkaisuluvut herättivät huomion ensimmäisenä. Yhtiö raportoi mallille 61,7 pistettä SWE-bench Pro -testissä, 90,3 pistettä LiveCodeBench v6:ssa ja 84,3 pistettä OSWorld-Verified-vertailussa. Yhtiön omassa taulukossa 27B-malli ohittaa Claude Opus 4.6 Maxin sekä SWE-bench Prossa että LiveCodeBenchissä.
Valmistajan itse ajamiin lukuihin kannattaa suhtautua varauksella. Osa arvioinneista on sisäisiä, eivätkä vertailukehykset ole kaikilta osin identtisiä. Keskustelu muuttui vasta maanantaina, kun riippumattomat tulokset alkoivat saapua.
Artificial Analysis antoi Qwen3.8-27B:lle 52 pistettä Intelligence Index -indeksissään, joka yhdistää yhdeksän arviointia koodauksesta luonnontieteisiin ja päättelyyn. Sama pistemäärä on tällä hetkellä OpenAI:n GPT-5.6 Lunalla suurimmalla päättelyasetuksella. Agenttitehtäviä mittaavassa Agentic Indexissä malli sai 51 pistettä ja ohitti Claude Opus 4.8:n.
Avoimen koodausagentin Clinen kommentti tiivisti tunnelman: paikallinen malli yltää ensimmäistä kertaa kärkimallien tasolle, eikä kukaan odottanut sitä näin pian.

Seitsemäntoista gigatavua riittää
Pisteitä olennaisempaa on se, mihin malli mahtuu. Täydellä 16-bittisellä tarkkuudella Qwen3.8-27B vaatii noin 56 gigatavua näytönohjaimen muistia ja FP8-versio noin 28 gigatavua. Neljän bitin kvantisointi puristaa mallitiedoston noin 17 gigatavuun.
Se on koko, joka mahtuu tehokkaaseen pelipöytäkoneeseen tai hyvin varusteltuun kannettavaan. Kehittäjä Simon Willison testasi noin 17 gigatavun Q4_K_M-kvantisointia M5 Max -MacBook Prolla ja Nvidian DGX Sparkilla.
Kokeissa malli kirjoitti koodia, tulkitsi kuvia ja pyöritti koodausagenttisilmukkaa Pi-kehyksen kautta. Yhdessä testissä se selvitti koodipohjasta, miten tunnistautuminen oli toteutettu. Toisessa se kirjoitti ja testasi Python-työkalun agenttilokin muuntamiseen JSONL-muodosta Markdowniksi.
Malli sisältää lisäksi natiivin kuvan- ja videonymmärryksen sekä 262 144 tokenin kontekstin. Näitä ominaisuuksia ei ole totuttu liittämään tähän kokoluokkaan.

Ylimiettiminen syö nopeuden
Laadulla on hintansa, ja se maksetaan tokeneina. Artificial Analysisin mukaan malli tuotti Intelligence Index -testauksessa 160 miljoonaa ulostulotokenia, kun vastaavien avointen mallien mediaani on 43 miljoonaa.
Syy on oletusasetuksissa: Qwen käynnistyy korkeimmalla xhigh-päättelytasolla. Willisonin pyyntö piirtää SVG-kuva polkupyörää ajavasta pelikaanista kesti 21 minuuttia ja kulutti yli 22 000 päättelytokenia. Hän suosittelee tavalliseen paikalliskäyttöön matalaa päättelyä tai sen sulkemista kokonaan.
Sijoittaja Tomasz Tunguz vertasi mallia yhdeksän tehtävän testissä DeepSeek V4 Flashiin. Päättely päällä Qwen tuotti hieman parempaa laatua hänen agenttipinossaan, mutta oli noin 30 kertaa hitaampi ja 4,5 kertaa kalliimpi. Tunguz korosti itse, ettei yhdeksän tehtävää riitä johtopäätöksiin.
Ajonaikaiset optimoinnit kaventavat eroa. Malli tukee Multi-Token Predictionia, ja Willison mittasi DGX Sparkilla noin 72 prosentin parannuksen otettuaan tekniikan käyttöön llama.cpp:ssä. Silti tavallisilla LM Studio -ajoilla vauhti jäi 15–30 tokeniin sekunnissa, selvästi alle isännöityjen mallien vasteajan.

Mitä tämä tarkoittaa yrityksille
Yritykselle olennainen kysymys ei ole, voittaako 27 miljardin parametrin malli Clauden tai GPT:n jossakin vertailussa. Kysymys on, riittääkö oman infrastruktuurin sisällä pyörivä malli tarpeeksi suureen osaan koodaus-, dokumentti- ja konenäkötehtävistä korvatakseen rajapintakutsut.
Jos vastaus on kyllä, laskelma muuttuu kolmella tavalla. Tietosuoja paranee, kun aineisto ei poistu omasta ympäristöstä. Käyttöönotto vapautuu toimittajan aikatauluista. Kustannus siirtyy tokenikohtaisesta laskutuksesta kertaluonteiseen laitehankintaan.
Apache 2.0 -lisenssi tekee tästä käytännössä mahdollista: painoja saa tarkastella, muokata ja ajaa yrityksen omien kontrollien takana. Alibaba dokumentoi yhteensopivuuden vLLM-, SGLang- ja TokenSpeed-palvelinkehysten kanssa. Hallinnoitu Qwen Cloud -versio miljoonan tokenin oletuskontekstilla on yhtiön mukaan tulossa myöhemmin.
Varauksia riittää yhä. Vertailuluvut kaipaavat lisää riippumatonta vahvistusta, oletuspäättely on tehotonta, eikä yksikään tulostaulukko todista tasavertaisuutta kärkimallien kanssa.

Yhteenveto
Qwen3.8-27B ei ole absoluuttinen kärkimalli eikä yritä olla. Sen merkitys on siinä, että kärkimallien kaltaisia kykyjä saa nyt tiedostona, joka mahtuu työaseman levylle ja jota ajetaan ilman rajapintaa.
VentureBeatin mukaan juuri tämä siirtymä, ei yksittäinen vertailupiste, selittää reaktion voimakkuuden. Yrityksissä kannattaa nyt mitata, mitkä työkuormat siirtyisivät omalle raudalle ja missä pilvimalli on edelleen ainoa järkevä vaihtoehto.
