Alibaban Qwen-tiimi julkaisi Qwen-Image 2.1:n painot Hugging Faceen ja ModelScopeen lauantaina 20. syyskuuta. Kyseessä on yhdistetty malli, joka sekä luo kuvia tekstistä että muokkaa olemassa olevia kuvia. Visuaalisessa generointiosassa on vain seitsemän miljardia parametria.

Kokoluokka on julkaisun kiinnostavin väite. Qwen esittää mallin päihittävän useimmat suljetut kuvamallit murto-osalla niiden laskentatehosta. Samalla lisenssi kiristyi: aiempi Qwen-Image-linja oli Apache 2.0 -lisensoitu, uusi versio ei ole.

Julkaisu tuli käytännössä ilman ennakkoa. Mallikortti, GitHub-repositorio ja blogikirjoitus ilmestyivät samana päivänä, mutta keynote-esitystä tai vertailuembargoa ei ollut. Ainoa ennakkosignaali oli 17. syyskuuta avattu viidenkymmenen testaajan varhaiskäyttö ModelScopessa.

Painojen mukana tuli kaksi erillistä kehotteenkirjoittajaa. PE-T2I muotoilee tekstikehotteet ja PE-I2I muokkauskäskyt tarkempaan muotoon ennen kuin kuvamalli näkee ne. Molemmat ovat hienosäädettyjä Qwen3.5-VL 9B -malleja.

Seitsemän miljardin parametrin arkkitehtuuri

Mallin ydin on 32-kerroksinen Single-Stream DiT -arkkitehtuuri. Sen rinnalla toimivat Qwen3-VL 8B -tekstienkooderi ja 64-kanavainen RGBA-VAE, joka pakkaa kuvan 16-kertaisesti. Kolme komponenttia vievät yhteensä noin 33 gigatavua levytilaa.

Kuvat syntyvät flow matching -menetelmällä ja Euler-diskretoinnilla. Tekstipuolella malli käyttää tokenitason kausaalista maskia, kuvan generoinnissa lohkotason kaksisuuntaista maskia. Yhdistelmä on epätavallinen, ja se selittää osan mallin kevyestä muistijäljestä.

Qwenin mallikortin mukaan päättelyä nopeuttavat sekoitetun tarkkuuden attentio ja prefix KV -välimuistin uudelleenkäyttö. Hyöty korostuu silloin, kun malli saa useita referenssikuvia kerralla. Oletuskoko on 2048 × 2048 pikseliä 40 askeleella, ja dokumentaatio listaa seitsemän kuvasuhdetta.

Kokoluokka ratkaisee käytännön puolen. Malli mahtuu tehokkaaseen kuluttajanäytönohjaimeen, esimerkiksi RTX 3090:een. Vastaavat kuvamallit ovat tähän asti vaatineet joko palvelinluokan laitteistoa tai pilvipalvelun. Tuki oli valmiina julkaisupäivänä: Diffusers sai oman QwenImage21Pipeline-putkensa, ComfyUI omat esimerkkityönkulkunsa, ja SGLangin tukipyyntö oli hyväksytty jo kolme päivää ennen painojen julkaisua.

Kuluttajanäytönohjain tummalla studiopinnalla, jäähdytysrivat ja piirilevy sinisessä valossa

Läpinäkyvyys tulee mallista itsestään

Qwen-Image 2.1 tuottaa RGBA-kuvia natiivisti. Alfakanava syntyy mallin omassa VAE-osassa, ei erillisessä taustanpoistovaiheessa. Sama kyky kattaa läpinäkyvien tasojen muokkaamisen ja kohteen irrottamisen tavallisesta valokuvasta.

Muutos lyhentää työnkulkua tuntuvasti. Aiemmin tarra tai ikoni syntyi kolmessa vaiheessa: luo kuva, poista tausta, korjaa reunat. Nyt sama pyyntö hoituu yhdellä kehotteella, kun kehotteessa mainitaan läpinäkyvä tausta.

Hyötyjiä ovat ennen muuta tarrojen, ikonien ja kuvituselementtien tekijät. Läpinäkyvä tausta on näissä töissä vaatimus, ei lisäominaisuus. Erityisesti hiusten ja lasin kaltaisten pehmeiden reunojen jälkikorjaus jää kokonaan pois.

Tämä on ensimmäinen kerta, kun Qwenin kuvamalliperhe tukee läpinäkyvyyttä suoraan. Suunnittelijalle ja sisällöntuottajalle kyse on mitattavasta ajansäästöstä eikä pelkästä tekniikkademosta.

Kirkas lasiesine vaalealla studiotaustalla, terävät reunat ja pehmeä varjo alla

Kymmenen referenssikuvaa ja tarkempi rajaus

Malli ottaa vastaan enintään kymmenen referenssikuvaa kerralla. Käyttökohteita ovat ryhmäkuvat, virtuaaliset sovitukset ja huoneiden suunnittelu. Muokattavan alueen voi rajata ympyröimällä, maalaamalla tai erillisellä maskilla.

Qwenin mukaan malli säilyttää ihmisten ja tuotteiden tunnistettavat piirteet muokkauksen yli. Tämä on ollut avointen kuvamallien tunnettu heikkous: kasvot ja tuotemuodot muuttuvat helposti kesken editoinnin. Verkkokaupan kuvatuotannossa juuri tunnistettavuus ratkaisee, onko työkalusta käyttöön.

Yksi varhaiskäyttäjä raportoi kuitenkin rajoista. Hänen testissään monen referenssin johdonmukaisuus alkoi rakoilla noin kolmannesta kuvasta eteenpäin, ja sivulle sijoitettu poninhäntä siirtyi profiilikulmassa keskelle. Sama testaaja mittasi kuvan syntyvän 10-15 sekunnissa ja muokkauksen 18-23 sekunnissa. Kyse on yhden testaajan havainnoista, ei vertaisarvioidusta mittauksesta.

Kymmenen valokuvavedosta ruudukossa valopöydällä, yksi merkitty punaisella ympyrällä

Lisenssi vaihtui Apachesta tutkimuskäyttöön

Painot julkaistiin Qwen Research License Agreement -ehdoilla. Lisenssi myöntää oikeudet nimenomaisesti vain ei-kaupalliseen käyttöön, ja kaupallinen käyttö edellyttää erillistä sopimusta Alibaban kanssa.

Ero on olennainen yrityksille. Apache 2.0 sallii tuotteistamisen ilman neuvotteluja, tutkimuslisenssi ei. Kaupallisen lisenssin ehtoja tai hintaa ei ole julkaistu, eikä tietoa mahdollisesta sallivammasta versiosta ole annettu.

Linjaus asettuu kiinnostavaan valoon, kun sen rinnalle nostaa Qwen-Image 3.0:n. Se julkaistiin aiemmin tänä vuonna suljettuna pilvipalveluna ilman painoja lainkaan. Alibaba tekee siis kahta vastakkaista vetoa samaan aikaan, eikä kumpikaan niistä ole täysin avoin.

Myös vertailuluvut kannattaa lukea varauksella. Qwenin omassa Qwen-Image-Bench-vertailussa malli saa kokonaispisteet 60,28, mikä sijoittaa sen Nano Banana 2.0:n (59,82) ja GPT Image 1.5:n (59,65) edelle. Vertailun rakensi kuitenkin Qwen itse, eikä riippumattomia tuloksia ole vielä julkaistu. Laatuväitteet nojaavat toistaiseksi valmistajan omaan aineistoon.

Pino tulostettuja sopimussivuja tummalla työpöydällä, vieressä täytekynä ja lukulasit

Yhteenveto

Qwen-Image 2.1 pakkaa kuvien luonnin, muokkauksen, läpinäkyvyyden ja monen referenssin yhdistelyn yhteen seitsemän miljardin parametrin malliin. Paikallinen ajo onnistuu kuluttajaraudalla, ja tuki keskeisissä ajokehyksissä oli valmiina heti.

Tutkijalle ja harrastajalle paketti on poikkeuksellisen kattava ja poikkeuksellisen halpa ajaa. Yritykselle ratkaisevaa on lisenssiteksti, ei parametrimäärä. Se kannattaa lukea ennen kuin mallin varaan rakentaa mitään.