Tencent julkaisi Hy4 preview -mallin ja avasi sen painot Apache 2.0 -lisenssillä. Malli sisältää 770 miljardia parametria, joista yhtä tokenia kohti aktivoituu 49 miljardia. Konteksti-ikkuna ylittää miljoona tokenia.
Tencentin virallisen tiedotteen mukaan kyseessä on suurin sukupolvien välinen laadun harppaus, jonka yhtiö on omissa mittauksissaan nähnyt. Painot löytyvät Hugging Facesta, ModelScopesta, GitCodesta ja CNB:stä. Rinnalla julkaistiin FP8-kvantisoitu versio.
Arkkitehtuuri aktivoi vain murto-osan parametreista
Hy4 preview rakentuu 78 kerroksesta. Ensimmäinen kerros käyttää tavanomaista tiheää eteenpäin syöttävää verkkoa, ja loput 77 korvaavat sen asiantuntijasekoituksella. Jokaisessa näistä kerroksista on 256 reititettyä asiantuntijaa ja yksi jaettu asiantuntija. Rakenne on sama, jolla avoimet kärkimallit ovat kasvaneet viimeisen vuoden ajan.
Reititin valitsee kullekin tokenille kahdeksan reititettyä asiantuntijaa jaetun asiantuntijan lisäksi. Kaikki muut pysyvät lepotilassa. Näin malli kantaa 770 miljardin parametrin kapasiteetin, mutta laskee yhtä kyselyä kohti kuin 49 miljardin parametrin verkko. Parametrilukema on siis enemmän varastoa kuin laskentakuormaa.
Rungon päälle on rakennettu erillinen MTP-kerros spekulatiivista dekoodausta varten. Se on kooltaan 10 miljardia parametria, joista aktivoituu 0,7 miljardia. Tekniikka arvaa seuraavia tokeneita etukäteen ja vahvistaa arvaukset jälkikäteen. Tavoite on nopeampi vastaus ilman laadun menetystä.
Konteksti-ikkuna ylittää miljoona tokenia. Se riittää kokonaisen koodivaraston, pitkän tutkimusaineiston tai laajan dokumenttikokoelman pitämiseen muistissa kerralla. Tencent perustelee valintaa sillä, että pitkissä monivaiheisissa tehtävissä kontekstin pituus ratkaisee useammin kuin parametrimäärä.

Vertailutulokset asettuvat avointen mallien kärkeen
Mallikortin mittaustulokset ovat vahvoja. GPQA Diamond -testissä Hy4 preview ylsi 92,3 prosenttiin. Ohjelmistotyön puolella SWE-bench Multilingual tuotti 82,9 prosenttia ja SWE-bench Pro 65,7 prosenttia. Deep SWE jäi 64,3 prosenttiin ja SkillsBench 62,9 prosenttiin.
Harjoitusaineisto rakennettiin Tencentin omien asiantuntijoiden työn ympärille. Mukana oli ohjelmistokehittäjiä, pelisuunnittelijoita, talousanalyytikkoja ja tietoturva-asiantuntijoita. Tarkoitus oli siirtää malliin niitä tehtäviä, joita tiimit oikeasti tekevät päivittäin.
Tencent teetti myös sokkovertailun. 163 sisäistä arvioijaa pisteytti mallien vastaukset 203 ohjelmistotehtävässä tietämättä, mikä malli tuotti minkäkin vastauksen. Hy4 preview sai keskiarvon 2,99, kun GLM-5.3 jäi 2,92:een ja Kimi K3 2,94:ään.
Erot ovat kapeita. GLM-5.3:a vastaan Hy4 voitti 46,8 prosenttia tehtävistä, hävisi 40,4 prosenttia ja tasapeliin päädyttiin 12,8 prosentissa. Kärkisijaa avointen mallien joukossa ei ratkaista yhdellä sisäisellä vertailulla.

Painojen ajaminen vaatii datakeskusluokan raudan
Avoin lisenssi ei tarkoita, että malli mahtuisi työaseman muistiin. BF16-tarkkuudella tallennetut painot vievät noin 1,6 teratavua levytilaa. Tencent julkaisi rinnalla FP8-kvantisoidun version, joka keventää kuormaa. Kuluttajalaitteille sekään ei mallia tuo.
Käyttöönotto tapahtuu vLLM:n tai SGLangin kautta. Molemmille on tarjolla valmiit ajokuvat ja OpenAI-yhteensopiva rajapinta. Suositellut generointiparametrit ovat temperature 0,9 ja top_p 1,0. Ohjeet löytyvät sekä mallikortilta että erillisistä reseptidokumenteista.
Ilman omaa rautaa mallia pääsee kokeilemaan rajapinnan kautta. Tencent Cloud TokenHub ja OpenRouter tarjoavat molemmat pääsyn. Tämä on käytännössä se reitti, jota valtaosa kiinnostuneista kulkee.
Malli on kytketty myös Tencentin omiin tuotteisiin. WorkBuddy, CodeBuddy, Yuanbao ja ima käyttävät sitä suoraan. WorkBuddyssä ja CodeBuddyssä Hy4 preview on maksuton kaksi viikkoa julkaisusta, ja edeltäjä Hy3 pysyy maksuttomana syyskuun loppuun.

Tencent listaa esikatseluversion puutteet itse
Julkaisun mukana tuli poikkeuksellisen suora lista tunnetuista ongelmista. Malli käyttää monimutkaisissa tehtävissä päättelyyn enemmän aikaa kuin olisi tarpeen. Se myös varmistaa omia vastauksiaan yli tarpeen. Molemmat piirteet ovat tuttuja päättelyyn viritetyistä malleista.
Hitaus osuu juuri niihin käyttötapauksiin, joita Tencent mallille markkinoi. Talousanalyysissä ja tutkimustyössä odottaminen on osa käyttökokemusta. Kun tehtäviä ajetaan sarjassa tai agenttisilmukassa, viive kertautuu nopeasti.
Yliverifiointi vie myös tokeneita. Malli tarkistaa työnsä uudelleen silloinkin, kun vastaus oli jo valmis. Rajapintakäytössä se näkyy suoraan laskussa.
Yhtiö perustelee valintaa samalla logiikalla kuin Hy3:n kohdalla: mieluummin julkaistaan aikaisin ja kuullaan mikä rikkoutuu. Palaute ohjasi Hy3:n varsinaista versiota selvästi parempaan suuntaan. Seuraavia Hy4-sarjan malleja on luvassa lähiaikoina.

Yhteenveto
Hy4 preview siirtää avointen mallien mittakaavaa jälleen ylöspäin. 770 miljardin parametrin runko, 49 miljardin aktivointi ja yli miljoonan tokenin konteksti muodostavat yhdistelmän, joka kestää vertailun kaupallisiin kärkimalleihin. Apache 2.0 -lisenssi tekee mallista aidosti muokattavan.
Käytännön este on rauta. Suurin osa kiinnostuneista ajaa mallia rajapinnan kautta, ei omalla klusterilla. Se ei vähennä julkaisun merkitystä, mutta muistuttaa siitä, että avoin paino ja helposti saavutettava malli ovat eri asioita.
