DeepSeek julkaisi 10. syyskuuta V4.1 Flash -mallin Hugging Facessa. Kyseessä on 552 miljardin parametrin mixture-of-experts (MoE) -malli, jonka painot ovat vapaasti ladattavissa MIT-lisenssillä. Samassa repositoriossa on 51-sivuinen tekninen raportti.
Yhtiö kuvaa mallia uuden arkkitehtuuriperheen pienimmäksi jäseneksi. Se lukee syötettä kahdeksan miljardin aktiivisen parametrin voimin ja kirjoittaa vastauksen kuudellatoista miljardilla. Konteksti-ikkuna yltää miljoonaan tokeniin, ja malli ottaa kuvia vastaan natiivisti ilman erillistä esikäsittelyä.
Pieni aktiivinen osa, suuri kokonaisuus
MoE-arkkitehtuurissa malli aktivoi kerrallaan vain murto-osan parametreistaan. DeepSeekin luvut ovat tässä poikkeuksellisen matalat. Kokonaisuudesta on käytössä 8-16 miljardia parametria kerrallaan, joten laskentakustannus vastaa selvästi pienempää mallia kuin kokonaisparametrimäärä antaisi olettaa.
Vertailun vuoksi: monet avoimet MoE-mallit aktivoivat kymmeniä miljardeja parametreja jokaisella kierroksella. DeepSeek jää alle puoleen tyypillisestä tasosta. Se näkyy suoraan sekä laskutuksessa että vasteajassa.
Toinen merkittävä luku koskee välimuistia. V4.1 Flashin KV-välimuisti kuluttaa noin 890 tavua tokenia kohti. Se on noin neljännes siitä, mitä edeltäjä V4-Flash vaati samaan työhön.
Yhdistelmällä on suora vaikutus pitkiin ajoihin. Miljoonan tokenin konteksti on kallis pitää muistissa, ja välimuistin kutistuminen tekee siitä käytännössä mahdollisen. Agenttityössä konteksti kasvaa väistämättä jokaisella kierroksella, joten säästö kertyy koko ajon mitalta.
Käytännössä tämä siirtää kustannuspainopisteen laskennasta muistiin ja takaisin. Pienen aktiivisen osan mallit ovat tyypillisesti nopeita mutta muistinnälkäisiä. DeepSeek näyttää ratkaisseen molemmat puolet samalla julkaisulla.

Vertailuluvut kääntyvät molempiin suuntiin
DeepSeekin oman ilmoituksen mukaan useiden osapuolten testit asettavat V4.1 Flashin edeltäjänsä V4-Pron edelle suorituskyvyssä, kustannuksissa, nopeudessa ja kokonaisajoajassa. Agenttitehtävissä ero on selvin.
Tietopainotteisissa tehtävissä asetelma kääntyy toisin päin. Pienempi aktiivinen parametrimäärä näkyy juuri siellä, missä malli joutuu nojaamaan muistamaansa tietoon eikä päättelyketjuun. Yhtiö ei piilota tätä vaan kirjaa heikkouden julkaisumateriaaliinsa.
Käytännön valinnassa ero seuraa tehtävätyyppiä. Työnkulut, joissa malli hakee tiedon työkalulla ja päättelee sen pohjalta, hyötyvät nopeasta ja halvasta mallista. Tehtävät, joissa malli vastaa suoraan koulutusaineistonsa varassa, kärsivät pienemmästä aktiivisesta osasta. Rajanveto kulkee siinä, onko tieto kontekstissa vai mallissa.
Verrokeiksi DeepSeek nimeää GPT-5.6:n ja Kimi K3:n. Vertailut ovat yhtiön omia, joten ne kannattaa lukea markkinointina siihen asti, kunnes riippumattomat mittaukset valmistuvat. Avoimet painot tosin tekevät toistamisesta poikkeuksellisen helppoa.

Rajapinnan käyttäjille luvassa pakkovaihto
Julkaisu on samalla eläkkeellepanoilmoitus. Uudet hinnat astuivat voimaan 10. syyskuuta kello 04.00 UTC, ja hinnoittelusivulla malli kulkee nimellä deepseek-flash. Laskutus on porrastettu vuorokaudenajan mukaan: arkisin kello 01-04 ja 06-10 UTC peritään täysi hinta, muina aikoina puolet siitä.
Vanhat nimet deepseek-v4-flash ja deepseek-v4-flash-vision-exp ohjautuvat jo uuteen malliin. DeepSeek poisti molemmat julkaisupäivänään käytöstä.
Isompi muutos ajoittuu 14. syyskuuta. Silloin kello 04.00 UTC alkaen jokainen deepseek-v4-pro -nimellä tehty pyyntö saa vastauksen V4.1 Flashilta ja laskutetaan uuden mallin halvemmilla hinnoilla. Reititys pysyy voimassa siihen asti, kunnes V4.1 Pro joskus julkaistaan.
Hinnoittelusivu ei mainitse tapaa kieltäytyä vaihdosta, eikä julkaisutiedotekaan. Rajapintaa käyttäville yrityksille kyse on siis pyytämättömästä mallinvaihdosta, jonka mukana tulee pienempi lasku. Tuotannossa olevien järjestelmien kannattaa varautua siihen, että vastausten sävy ja rakenne muuttuvat ensi viikolla.

Avoimet painot avaavat kaksi polkua
Painot ovat Hugging Facessa MIT-lisenssillä, joka on sallivimpia mahdollisia ehtoja. Repositorio keräsi ensimmäisenä päivänään 734 tykkäystä.
MIT-lisenssi tarkoittaa, että mallia saa muokata, jatkokouluttaa ja myydä eteenpäin ilman vastavuoroisuusvaatimusta. Ero moniin muihin avoimiin julkaisuihin on merkittävä, sillä niissä käyttöä rajataan usein liikevaihdon tai käyttötarkoituksen perusteella. Yrityksille tämä poistaa juridisen epävarmuuden, joka on hidastanut avointen mallien käyttöönottoa.
Käyttöönotolle syntyy näin kaksi rinnakkaista reittiä. Omalla raudalla ajava lataa painot ja vastaa itse päättelystä. Hallittua palvelua haluava kutsuu rajapintaa uusilla hinnoilla ja jättää ylläpidon DeepSeekille.
Virallisista kumppaneista WorkBuddy, sen CodeBuddy mukaan lukien, ja OpenCode tukevat mallia ensimmäisestä päivästä alkaen. Julkaisua edelsi lyhyt julkinen testijakso, jossa malli kulki nimellä deepseek-v4.1-flash-expires-on-0910 ja jossa rinnakkaisia pyyntöjä sai olla korkeintaan 20 tiliä kohden.

Yhteenveto
DeepSeek V4.1 Flash on halpa ja vahva agenttimalli, jonka heikkoudet on kirjattu näkyviin. Avoimet painot, miljoonan tokenin konteksti ja neljännekseen kutistunut välimuisti tekevät siitä varteenotettavan vaihtoehdon pitkiin ajoihin.
Ajoitus tuskin on sattumaa. DeepSeekin odotetaan listautuvan Shanghain STAR-markkinalle, ja tekninen eteneminen tekee sijoittajaesityksistä vakuuttavampia. Rajapinnan nykyisille käyttäjille olennaisin kysymys on kuitenkin konkreettisempi: 14. syyskuuta jälkeen pyyntö menee uudelle mallille, halusi sitä tai ei.
