Saksalainen Black Forest Labs julkaisi FLUX 3:n, joka on yhtiön ensimmäinen multimodaalinen perusmalli. Malli oppii kuvista, videosta ja äänestä samanaikaisesti saman arkkitehtuurin sisällä. Aiemmin yhtiö tunnettiin pelkistä kuvamalleista. Nyt se laajentaa osaamisensa liikkuvaan kuvaan ja ääneen.

Julkaisu on merkittävä, koska se kokoaa kolme mediatyyppiä yhteen malliin. Black Forest Labsin mukaan yksittäinen aistikanava ei riitä kuvaamaan maailmaa kokonaan. Kuva kertoo tilan rakenteesta, video ajan kulusta ja ääni tapahtumien syy-seuraussuhteista. FLUX 3 pyrkii yhdistämään nämä yhdeksi esitykseksi todellisuudesta.

Yksi malli kolmelle aistille


FLUX 3 rakentuu Self-Flow-menetelmän varaan. Se kohdistaa sisällön generoinnin ja ymmärtämisen samaan arkkitehtuuriin. Multimodaalinen transformeri käyttää omia enkoodereita ja dekoodereita jokaiselle mediatyypille.

Idea on, että eri aistikanavat rajoittavat toisiaan. Äänen on vastattava iskua, liikkeen on noudatettava massaa ja tulevan on seurattava menneestä. Kun malli oppii kaikki yhtä aikaa, se saa enemmän tietoa kuin erillisistä malleista.

Black Forest Labs kutsuu tavoitetta todellisen maailman visuaaliseksi älyksi. Sillä yhtiö tarkoittaa järjestelmiä, jotka havaitsevat, ennustavat ja toimivat sekä fyysisessä että digitaalisessa ympäristössä. FLUX 3 on yhtiön mukaan ensimmäinen malli, joka on rakennettu kokonaan tälle periaatteelle.

Yhtiön mukaan yhtenäinen oppiminen tuottaa paremman tuloksen kuin aiemmin vakiona käytetty flow-matching-menetelmä. Ero näkyy sekä generoinnin laadussa että robotiikan tehtävissä. Näin FLUX 3 asettuu osaksi laajempaa maailmanmallien tutkimusaaltoa, jossa tavoitteena on koneellinen käsitys fysiikasta.



Kolme läpinäkyvää lasipaneelia kuvaavat kuvaa, liikettä ja ääntä yhtenä pintana.


Video äänen kanssa jopa 20 sekuntia


Näkyvin uudistus on video. FLUX 3 luo yhdellä generoinnilla jopa 20 sekunnin klippejä, joissa on natiivi ääni. Se on ensimmäinen kerta, kun yhtiön malli tuottaa videota lainkaan.

Malli tukee monia työnkulkuja. Tekstistä videoksi, kuvasta videoksi ja videosta videoksi onnistuvat kaikki. Lisäksi malli osaa ketjuttaa yksittäisiä klippejä pidemmiksi, monikohtauksisiksi jaksoiksi ja tuottaa monikielistä dialogia. Yhtiö korostaa mallin osaavan kasvojen ilmeet ja äänen sovittamisen fyysisiin tapahtumiin.

Omat vertailut ovat lupaavia mutta alustavia. 10 sekunnin ja 720p:n klipeillä FLUX 3 voitti Luma Ray 3.2:n 93 prosentissa vertailuista ja Runway Gen-4.5:n 77 prosentissa. Kärkimalleja vastaan ero kapeni: Seedance 2.0 ja Gemini Omni Flash jäivät tasoihin 52 prosentin osuudella. Riippumattomia testejä ei vielä ole.

Videolla on myös rajansa. Klipit ovat toistaiseksi lyhyitä, ja yhtiö myöntää tulosten olevan keskeneräisiä. Silti 20 sekunnin pituus ja natiivi ääni yhdellä generoinnilla erottavat FLUX 3:n monista kilpailijoista, jotka tuottavat kuvan ja äänen erikseen.



Filminauha kaartuu ilmassa, jokainen ruutu hehkuu ja reunassa kulkee ääniaalto.


FLUX-mimic vie mallin robotiikkaan


FLUX 3 ei rajoitu ruudulle. Yhtiö kertoo, että malli osaa ennustaa toimintaa maailmankuvansa pohjalta. Arkkitehtuuriin kuuluu erillinen toimintakomponentti, jota voi laajentaa uusiin käyttökohteisiin.

Black Forest Labs kehitti Mimic Robotics -yhtiön kanssa FLUX-mimic-mallin. Se on video- ja toimintamalli robotiikkaan, ja sitä testataan jo tuotantotehtävissä autonvalmistaja Audilla. Yhtiö näkee tässä sillan sisällöntuotannon ja fyysisen tekoälyn välillä.

Sama malli, joka luo mainosvideon, voi siis periaatteessa ohjata robottikäden liikettä. Juuri tämä yhdistelmä erottaa FLUX 3:n perinteisistä kuva- ja videomalleista. Se on yhtiön mukaan askel kohti yhtä perustaa, joka kattaa havainnon, toiminnan ja kielen.

Robotiikkapuoli on kuitenkin vasta varhaisessa vaiheessa. Toimintaennuste tarjotaan aluksi vain valituille kumppaneille. Audi-yhteistyö on silti konkreettinen esimerkki siitä, että sama malli voi periaatteessa siirtyä näytöltä tehtaan lattialle.



Robottikäsi kurottaa kohti hehkuvaa hologrammikuutiota puhtaassa työpajassa.


Saatavuus ja avoimet painot


FLUX 3 on nyt saatavilla varhaisessa Early Access -vaiheessa. Videopuoli on jo auki hakemuksesta, ja kuvamalli FLUX 3 Image seuraa lähiviikkoina. Kuvamallin luvataan parantavan monimutkaisia kehotteita ja tekstin renderöintiä useilla kielillä.

Avoimuudesta yhtiö on niukkasanaisempi. Mallia ei julkaistu ladattavin painoin, eikä lisenssistä, parametrimäärästä tai laitteistovaatimuksista ole vielä tietoa. Black Forest Labs on kuitenkin luvannut avoimen version nimeltä FLUX 3 Dev myöhemmin tänä vuonna.

Avoimet painot ovat olleet FLUX-perheen suosion ydin. Siksi niiden viivästyminen on kehittäjille pettymys. Toisaalta FLUX 3 Dev kattaisi kuvan lisäksi videon, äänen ja toiminnan, mikä olisi selvästi aiempaa laajempi julkaisu.

Vaiheittainen julkaisu muistuttaa muiden kärkilaboratorioiden viimeaikaista linjaa. Mallit avataan ensin rajatulle joukolle ja laajennetaan käyttöä myöhemmin. Kehittäjien kannattaa siis seurata, milloin FLUX 3 Image ja lopulta avoin FLUX 3 Dev tulevat laajemmin saataville.



Puoliksi avattu metallinen holvin ovi paljastaa kerroksellista läpikuultavaa dataa.


Yhteenveto


FLUX 3 laajentaa Black Forest Labsin kuvamalleista multimodaaliseksi perustaksi. Video äänellä, monikielinen dialogi ja robotiikan toimintakomponentti kokoontuvat saman arkkitehtuurin alle. Alustavat vertailut ovat vahvoja, mutta riippumaton arviointi puuttuu vielä.

Ratkaisevaa on, pitävätkö lupaukset yhtenäisestä visuaalisesta älystä. Jos FLUX 3 Dev saapuu avoimin painoin, se voi nostaa riman avoimille multimodaalimalleille. Toistaiseksi malli on lupaava mutta keskeneräinen.