Moonshot AI julkaisi Kimi K3:n täydet painot Hugging Facessa. Lataus tekee 2,8 biljoonan parametrin mallista suurimman vapaasti saatavilla olevan kielimallin. Yhtiö oli luvannut julkaisun heinäkuun 27. päiväksi jo mallin esittelyn yhteydessä.
Malli itsessään ei ole uusi. Kimi K3 esiteltiin Shanghain tekoälykonferenssissa 16. heinäkuuta, ja se on ollut käytettävissä rajapinnan kautta siitä lähtien. Vasta painojen julkaisu antaa organisaatioille mahdollisuuden ajaa mallia omalla raudallaan.
Julkaisu siirtää samalla avointen mallien kokoluokan ennennäkemättömälle tasolle. Aiempi suurin ladattava malli, DeepSeek V4 Pro, jäi 1,6 biljoonaan parametriin.
Mitä painojen julkaisu käytännössä muuttaa
Rajapinnan kautta käytettynä jokainen kysely kulkee Moonshotin palvelimien läpi. Painojen lataaminen katkaisee tämän riippuvuuden. Yritykset, joita sitovat tiukat vaatimukset datan sijainnista, voivat nyt arvioida mallia ilman että aineisto poistuu omasta ympäristöstä.
Saatavuus avaa myös jatkokehityksen. Organisaatiot voivat hienosäätää mallia omalla aineistollaan, karsia siitä tarpeettomia osia tai tarkastaa sen käyttäytymistä tavalla, joka ei rajapinnan takaa onnistu. Tämä erottaa avoimet painot avoimesta rajapinnasta.
Julkaisu tapahtuu muokatulla MIT-lisenssillä. Kaupallisen käytön tarkat ehdot eivät kuitenkaan olleet täysin julki painojen ilmestyessä. Tuotteen rakentamista mallin varaan harkitsevien kannattaa lukea lisenssiteksti itse eikä olettaa sen vastaavan aiempien Kimi-mallien ehtoja.
Painot mahdollistavat myös riippumattoman todentamisen. Tähän asti lähes kaikki K3:n vertailuluvut ovat perustuneet Moonshotin omiin ajoihin tai yhtiön itse toimittamiin tuloksiin. Tutkijayhteisö pääsee vasta nyt toistamaan mittaukset hallituissa olosuhteissa.

Arkkitehtuuri aktivoi murto-osan parametreista
Otsikon 2,8 biljoonaa parametria kuvaa mallin kapasiteettia, ei laskentakuormaa. Kimi K3 rakentuu harvaan Mixture-of-Experts (MoE) -arkkitehtuuriin, jossa on 896 erikoistunutta asiantuntijaverkkoa. Yksittäistä syötetokenia kohden niistä aktivoituu vain 16.
Käytännössä laskentakustannus vastaa noin 50 miljardin parametrin tiheää mallia. Ero on olennainen. Otsikkoluku kertoo, mitä malli pitää sisällään, kun taas aktiivisten parametrien määrä ratkaisee, mitä ajaminen maksaa.
Harva aktivointi selittää myös hinnoittelun. Kun laskentaa kuluu vain aktivoituneiden asiantuntijoiden verran, biljoonaluokan mallia voidaan tarjota hinnalla, joka vastaa selvästi pienempää järjestelmää. Muistin kannalta malli pysyy silti raskaana, sillä kaikki parametrit on pidettävä saatavilla.
Moonshot on kertonut lisäksi kahdesta uudesta mekanismista, Kimi Delta Attentionista ja Attention Residualsista. Yhtiön mukaan ne nopeuttavat pitkän kontekstin käsittelyä merkittävästi. Mallin konteksti-ikkuna yltää miljoonaan tokeniin.

Hallusinaatioluku puuttui julkaisumateriaalista
Riippumaton arviointiyritys Artificial Analysis sijoitti K3:n älykkyysindeksissään neljänneksi pistein 57,1. Malli jää Claude Fable 5:n ja GPT-5.6 Solin taakse mutta ohittaa Claude Opus 4.8:n. Avoimista malleista se on selvästi kärjessä.
Sama arviointi paljasti myös luvun, jota Moonshot ei nostanut esiin. Mallin hallusinaatioaste AA-Omniscience-testissä nousi noin 51 prosenttiin, kun edeltäjä Kimi K2.6 jäi 39 prosenttiin. Faktatarkkuus parani samaan aikaan 33 prosentista 46 prosenttiin.
Yhdistelmä on epätavallinen. Malli vastaa aiempaa useammin oikein, mutta erehtyy myös itsevarmemmin. Tietotyössä tämä edellyttää erillistä tarkistuskerrosta, kun taas frontend-koodauksessa, jossa K3:n riippumattomat tulokset ovat vahvimmat, merkitys jää pienemmäksi.
Vertailulukuja lukiessa kannattaa huomata myös mittaustavan vaikutus. Moonshotin koodaustulokset on koottu useilla eri agenttikehyksillä, ja kehyksen vaihtaminen voi siirtää pistemäärää kymmenillä yksiköillä samassa tehtävässä. Rinnakkain asetetut luvut eivät siksi aina mittaa aivan samaa asiaa.

Itse isännöinti vaatii konesalitason raudan
Painojen lataaminen ei tee mallista helposti ajettavaa. MXFP4-tarkkuudella tiedostot vievät noin 1,4 teratavua. Ajaminen edellyttää kymmeniä kiihdytinkortteja ja nopeaa muistia, mikä sulkee pois työasemat ja pienet palvelinsalit.
Miljoonan tokenin konteksti-ikkuna on aluksi pilvipalvelun ominaisuus. Paikallisessa ajossa raja asettuu ensimmäisenä päivänä noin 131 000 tokeniin. Ero kannattaa huomioida, jos käyttötapaus nojaa nimenomaan pitkään kontekstiin.
Nopeus on toinen rajoite. Artificial Analysisin mittauksissa K3 tuotti tekstiä selvästi verrokkejaan hitaammin, ja ensimmäistä tokenia joutui odottamaan poikkeuksellisen kauan. Interaktiivisissa sovelluksissa viive on käyttökokemuksen kannalta merkittävä tekijä.
Useimmille organisaatioille rajapinta on siksi käytännöllisempi lähtökohta. Hinnoittelu asettuu 3 dollariin miljoonalta syötetokenilta ja 15 dollariin miljoonalta tuotetulta tokenilta. Välimuistista luettu syöte maksaa 0,30 dollaria miljoonalta.

Yhteenveto
Kimi K3:n painojen julkaisu siirtää avointen mallien ylärajan uuteen kokoluokkaan. Suurin ladattava malli on nyt kiinalaisen laboratorion käsialaa, ja se yltää lähelle länsimaisten huippumallien tasoa useissa tehtävissä.
Käytännön arvo riippuu kuitenkin resursseista. Ilman konesalitason rautaa painot jäävät lähinnä tutkimusyhteisön työkaluksi. Tuotantokäytössä 51 prosentin hallusinaatioaste vaatii puolestaan oman varmistuskerroksensa.
Ero avointen ja suljettujen mallien välillä on joka tapauksessa kaventunut. Vielä vuosi sitten vastaava kokoluokka olisi ollut yksinomaan suurimpien laboratorioiden ulottuvilla, eikä painoja olisi julkaistu lainkaan.
