World Labs esitteli Atlaksen 2. syyskuuta. Kyseessä on maailmamalli, joka tuottaa, rekonstruoi ja simuloi kolmiulotteisia kohtauksia muutamasta valokuvasta. Yhtiön mukaan se päihittää omilla alueillaan niihin erikoistuneet mallit.

Yhtiön perusti vuonna 2024 Fei-Fei Li, ImageNetin luoja ja Google Cloudin tekoälyjohtaja vuosina 2017–2018. World Labs on alusta asti tavoitellut spatiaalista älyä: kykyä ymmärtää kolmiulotteista tilaa samaan tapaan kuin ihminen. Atlas on ensimmäinen malli, joka tekee sen mittakaavassa.

Yksi malli kolmeen tehtävään


Atlas ei tuota litteitä kuvia tai irrallisia videopätkiä. Malli hahmottaa, miltä kohtaus näyttää mistä tahansa kulmasta ja miten se muuttuu ajassa. Sama malli hoitaa kolme tehtävää, jotka on aiemmin jaettu erillisille järjestelmille.

Ensimmäinen on kameraohjattu tuottaminen, toinen tilan rekonstruointi valokuvista ja kolmas kohtauksen simulointi. World Labsin mukaan Atlas voittaa kussakin tehtävässä siihen erikoistuneet mallit. Toteutuessaan väite tekisi monesta erikoismallista tarpeettoman.

Malli käsittelee syvyystietoa RGB-datan rinnalla. Siksi tulos voidaan viedä ulos oikeana kolmiulotteisena datana eikä pelkkinä kuvina. Tuetut muodot ovat pistepilvi ja 3D Gaussian splat, sama esitystapa jota yhtiön Marble-tuote jo käyttää.

Videota Atlas tuottaa enintään minuutin verran 1440p-tarkkuudella. Yhtiön mukaan mallin suorituskyky paranee laskentatehon kasvaessa, ja se odottaa trendin jatkuvan myös skaalattaessa.



Sama olohuone valokuvana, rautalankamallina ja pistepilvenä samassa tilassa


Kamera on syöte, ei kehote


Kameraohjatussa tuottamisessa Atlas ottaa vastaan yhden tai useamman kuvan. Sen jälkeen se tuottaa uusia näkymiä vapaasti valituista kamerapaikoista ja -kulmista.

Olennainen ero moniin videomalleihin on syötteen muoto. Kameran liike annetaan suorana geometrisena syötteenä, ei tekstikehotteena. Käyttäjä ei siis kuvaile liikettä sanoilla vaan määrittelee radan.

Ero on käytännöllinen. Kun kameran liike on parametri, sama kohtaus voidaan kuvata uudelleen eri radalla ilman että kohtaus itse muuttuu. Tekstikehotteella ohjattu videomalli tuottaa joka kerta hieman eri maailman, jolloin otosten yhdistäminen on työlästä.

World Labs kuvasi eroa niin, että käyttäjä ohjaa jokaisen oton itse sen sijaan että vetäisi hedelmäpelin vipua. Kyse on rajasta hallitun tuottamisen ja sattumanvaraisen tuloksen välillä.

Käytännössä tämä tekee mallista käyttökelpoisen esituotannossa ja visualisoinnissa, joissa kuvakulma on määritelty etukäteen. Tekstistä kuvaksi -tuottaminen ei ole mallin painopiste, vaikka se osaa myös seurata monimutkaisia kehotteita, piirtää tekstiä ja tehdä 360 asteen panoraamoja.



Elokuvakamera liikeohjatussa robottivarressa, liikerata piirtyy hehkuvana kaarena


Rekonstruktio muutamasta valokuvasta


Tilan rekonstruoinnissa Atlas rakentaa oikean kohtauksen uudelleen yhdestä tai muutamasta kymmenestä kuvasta. Erikoislaitteita tai skannereita ei tarvita.

Kuvien määrä ratkaisee, kuinka paljon mallin täytyy keksiä itse. Yhdellä kuvalla Atlas joutuu päättelemään suurimman osan tilasta. Kymmenillä kuvilla se pääsee lähelle mittaustarkkuutta, koska näkymät rajaavat toisiaan.

Yhtiön mukaan jo kahdella tai kolmella kuvalla tulos on uskollinen alkuperäiselle ja päihittää erikoistuneet 3D-mallit. Malli pystyy käsittelemään myös yli sadan kuvan syötteitä.

Yhdessä demossa Atlas kokosi Stanfordin pääpihan asteittain kahdesta 25:een maantasokuvaan ja tuotti sen jälkeen ilmakuvia korkealta kampuksen yläpuolelta. Yhtään ilmakuvaa ei ollut syötteessä.

Simulaattorina Atlas mallintaa tilaa ja aikaa yhdessä. Muutamalla kameralla kuvatusta materiaalista se tuottaa bullet time -vaikutelman, joka pysäyttää kohtauksen ja avaa siihen muuten mahdottomia katselukulmia. Demomateriaali oli kuvattu kännyköillä ja toimintakameroilla, ei ammattikalustolla.



Yliopiston sisäpiha kuvattuna ylhäältä, osin hehkuvana pistepilvenä


Robotiikka saa harjoitusdataa simulaatiosta


Robotiikassa Atlas toimii real-to-sim-työkaluna. Malli rekonstruoi huoneen ja tuottaa sen kuva- ja syvyysdatan, jonka simuloidun robotin anturit näkisivät reitin varrella.

Robottien harjoitusdatan pullonkaula on ollut monipuolisuus. Oikeassa maailmassa jokainen variaatio vaatii uuden kuvauskerran, mikä rajaa aineiston koon pieneksi ja kalliiksi.

Muutamasta valokuvasta voi simuloida tarttumis- ja liiketehtäviä ja varioida niitä vaihtamalla esineitä, sijainteja, valaistusta tai taustoja. Tavoitteena on tuottaa monipuolista harjoitusdataa ilman että jokainen tilanne pitää kuvata oikeasti.

World Labs esitteli lähestymistavan elokuussa 2026 erillisenä real-to-sim-to-real-moottorina. Se luo yhdestä oikeasta tehtävästä tuhansia variantteja ja kouluttaa ohjausmallit kokonaan simulaatiossa.

Yhtiön mukaan mallit ajoivat viidellä robottialustalla tunnin kukin ilman ihmisen puuttumista. Teknologia tuli heinäkuisesta SceniX-yrityskaupasta. Atlas itse on toistaiseksi saatavilla vain valituille kumppaneille varhaisen käytön ohjelmassa.



Robottitarttuja kurottaa esineitä kohti laboratoriopöydällä simuloidussa ympäristössä


Yhteenveto


Atlas yhdistää kolme erillistä tutkimuslinjaa yhdeksi malliksi: kuvien tuottamisen, tilan rekonstruoinnin ja fysikaalisen simuloinnin. Se on askel pois litteästä kuvasta kohti tilaa, jota voi katsoa mistä kulmasta tahansa.

Suurin käytännön merkitys on todennäköisesti robotiikassa, jossa harjoitusdatan kerääminen oikeasta maailmasta on hidasta ja kallista. Atlas ajaa jatkossa myös Marblen uusia versioita.

Malli on toistaiseksi vain kumppanien käytössä, joten riippumattomia arvioita sen tarkkuudesta ei vielä ole. Väite erikoismallien päihittämisestä odottaa ulkopuolista vahvistusta.