Ang pagbuo ng isang 3D scene ay dating nangangailangan ng mga sandaang maingat na kinuha na larawan, mahal na kagamitan, at isang malaking timpla ng pagtitiis. Ang World Labs, ang kompanya ng spatial intelligence na itinatag ni Fei-Fei Li, isang eksperto sa AI mula sa Stanford, ay nag-compress na ng proseso na ito sa dalawa o tatlong snapshot lamang.
Ang bagong modelo ng kumpanya, na tinatawag na Atlas, ay isang pretrained na multimodal na autoregressive diffusion transformer. Sa mas simpleng salita: ito ay isang AI system na naiintindihan ang teksto, imahe, video, at 3D data nang sabay-sabay, at makagagamit ng pag-unawa na ito upang punan ang lahat ng hindi nakadetekta ng camera. Ang resulta ay buong 3D scene reconstruction, novel view synthesis, at camera-controlled video generation, lahat mula sa maliit na input.
Ano ang tunay na ginagawa ng Atlas
Ang Atlas ay gumagana bilang ano ang tinatawag ng World Labs na “omni world model” para sa spatial intelligence. Ibigay ang isa hanggang anim na reference images, at maaari itong lumikha ng hanggang isang minuto ng video sa resolusyon na 1440p habang pinapanatili ang eksaktong kontrol ng camera sa mga path na iyong tukoy.
Ang kakayahang mag-reconstruct sa 3D ay kung saan naging totoong nakakapanumbalik ang mga bagay. Karaniwang nangangailangan ng 100 hanggang 300+ larawan na kinuha mula sa maingat na plano ng mga anggulo upang bumuo ng isang gamit na 3D model ang tradisyonal na mga photogrammetry pipeline. Binabawasan ng Atlas ang kinakailangang ito sa tanging dalawa o tatlong input na larawan, at nagpapalabas ng eksplisitong 3D representations tulad ng point clouds at Gaussian splats na may kahanga-hangang katumpakan, ayon sa kompanya.
Sa mga benchmark ng 3D reconstruction na may kaunting pananaw, kabilang ang DTU at ETH3D, ang Atlas ay nakapag-post ng mean absolute-relative pointmap error na 25.3. Ang kanyang pinakamalapit na open-source na kalaban ay nakakuha ng 28.7.
Ang mga co-founders ng World Labs ay naglalarawan ng bagong pagbibilang ng pananaw bilang “isang AI-complete primitive para sa spatial intelligence.” Pagsasalin: ang kakayahang isipin kung paano nakikita ang isang eksena mula sa mga anggulo na hindi mo pa natanggap ay isang pangunahing kakayahan, na nagbubukas sa lahat mula sa pag-navigate ng robotics hanggang sa mga pipeline ng visual effects.
Ang desisyon ng tao
Sa mga pagsubok sa konsumidor na nagtataya ng kalidad ng pagkontrol ng kamera, pinili ng mga tagapagtaya ang Atlas kaysa sa mga kompetitibong modelo sa pagitan ng 75% at 94% ng oras.
Suporta rin ni Atlas ang dinamikong mga simulasyon ng espasyo-time, kabilang ang mga epekto ng bullet-time. Isipin ang ikonikong pag-ikot ng kamera sa slow-motion mula sa The Matrix, ngunit nililikha ng AI kaysa sa isang komplikadong rig ng mga sinasynchronize na camera.
Ang modelo ay nag-aangkop ng lahat ng ito sa loob ng isang pinagsamang spatial na konteksto. Sa halip na magtutulungan ng mga hiwalay na kasangkapan para sa video generation, 3D reconstruction, at novel view synthesis, pinagsasama ng Atlas ang mga punsiyon na ito sa isang solong sistema.
Mula sa laboratorio hanggang sa limitadong paglalabas
Ang World Labs ay nagtatayo patungo sa sandaling ito mula noong pagkakatatag ng kumpanya noong 2024. Ang startup ay nakakuha ng malaking atensyon mula sa unang araw, pangunahin dahil sa reputasyon ni Li bilang isa sa mga arkitekto ng modernong computer vision. Ang kanyang ImageNet dataset at kaugnay na mga hamon ay naglalaro ng sentral na papel sa pagpapabilis ng deep learning revolution higit sa isang dekada ang nakalipas.
Ipinahayag ni Atlas noong Setyembre 1, 2026, at kasalukuyang pumasok sa phase ng early access para sa ilang mga kasosyo. Hindi pa inilabas ni World Labs ang weights o code ng model nang pampubliko, at pinapanatili ang teknolohiya sa likod ng kontroladong pag-access para sa kasalukuyan.

