Merekonstruksi adegan 3D dahulunya memerlukan ratusan gambar yang diambil dengan teliti, peralatan mahal, dan kesabaran yang besar. World Labs, syarikat kecerdasan ruang yang diasaskan oleh pakar AI Stanford Fei-Fei Li, baru-baru ini memampatkan alur kerja itu kepada dua atau tiga gambar snap.
Model baharu syarikat, bernama Atlas, ialah transformer difusi autoregresif multimodal yang telah dilatih sebelumnya. Dalam istilah yang lebih mudah: ia adalah sistem AI yang memahami teks, gambar, video, dan data 3D secara serentak, dan boleh menggunakan pemahaman itu untuk mengisi semua perkara yang tidak ditangkap oleh kamera. Hasilnya ialah rekonstruksi adegan 3D penuh, sintesis pandangan baharu, dan penghasilan video yang dikendalikan kamera, semua daripada input minimum.
Apa yang sebenarnya dilakukan Atlas
Atlas beroperasi sebagai apa yang World Labs sebut sebagai "model omni dunia" untuk kecerdasan spasial. Berikan antara satu hingga enam gambar rujukan, dan ia boleh menghasilkan sehingga satu minit video pada resolusi 1440p sambil mengekalkan kawalan kamera yang tepat sepanjang laluan yang anda tentukan.
Kemampuan rekonstruksi 3D adalah di mana segalanya menjadi benar-benar mengesankan. Pipa fotogrametri tradisional biasanya memerlukan antara 100 hingga 300+ gambar yang diambil dari sudut-sudut yang dirancang dengan teliti untuk membina model 3D yang boleh digunakan. Atlas mengurangkan keperluan ini kepada hanya dua atau tiga gambar masukan, menghasilkan representasi 3D eksplisit seperti awan titik dan Gaussian splats dengan ketepatan yang digambarkan oleh syarikat tersebut sebagai luar biasa.
Pada ujian rekonstruksi 3D pandangan jarang, termasuk DTU dan ETH3D, Atlas mencatat ralat purata mutlak-relatif peta titik sebanyak 25.3. Pesaing sumber terbuka terdekatnya mendapat skor 28.7.
Pendiri bersama World Labs menggambarkan ramalan pandangan baru sebagai "primitif lengkap AI untuk kecerdasan spasial." Terjemahan: kemampuan untuk membayangkan bagaimana pemandangan kelihatan dari sudut yang tidak pernah difoto adalah kemampuan asas yang membuka jalan kepada segala perkara, mulai dari navigasi robotik hingga saluran kesan visual.
Putusan manusia
Dalam ujian pengguna yang menilai kualiti kawalan kamera, penilai manusia lebih suka Atlas berbanding model pesaing antara 75% hingga 94% masa.
Atlas juga menyokong simulasi ruang-masa dinamik, termasuk kesan bullet-time. Bayangkan gerakan kamera berputar perlahan ikonik dari The Matrix, tetapi dihasilkan oleh AI bukannya rig kamera bersinkron yang rumit.
Model ini mengendalikan semua ini dalam konteks ruang yang terpadu. Alih-alih menyatukan alat-alat terpisah untuk penghasilan video, rekonstruksi 3D, dan sintesis pandangan baru, Atlas menggabungkan fungsi-fungsi ini ke dalam satu sistem tunggal.
Dari makmal ke pelancaran terhad
World Labs telah membina jalan menuju momen ini sejak penubuhan syarikat pada tahun 2024. Permulaan ini menarik perhatian yang ketara sejak awal, sebahagian besarnya disebabkan reputasi Li sebagai salah seorang arkitek penglihatan komputer moden. Set data ImageNet dan cabaran berkaitan memainkan peranan utama dalam memicu revolusi pembelajaran mendalam lebih daripada satu dekad yang lalu.
Atlas diumumkan pada 1 September 2026, dan kini memasuki fasa akses awal untuk pasangan terpilih. World Labs belum melepaskan timbangan atau kod model secara awam, mengekalkan teknologi di sebalik dinding akses terkawal buat masa ini.

