重建三維場景過去需要數百張精心拍攝的照片、昂貴的設備以及大量的耐心。由史丹佛AI權威李飛飛共同創立的空間智能公司World Labs,現已將此工作流程壓縮至僅需兩到三張快照。
該公司推出的新模型名為 Atlas,是一種預訓練的多模態自迴歸擴散變換器。簡單來說:這是一個能同時理解文字、圖像、影片和 3D 資料的 AI 系統,並能利用這種理解來補全攝影機未捕捉到的內容。結果是僅需最少輸入,即可實現完整的 3D 場景重建、新視角合成,以及由攝影機控制的影片生成。
Atlas 究竟做什麼
Atlas 作為 World Labs 所稱的「全維度世界模型」,用於空間智能。只需提供 1 至 6 張參考圖像,它即可生成長達一分鐘、解析度達 1440p 的影片,並精準沿著您指定的路徑控制鏡頭。
3D 重建功能才是真正令人印象深刻的部分。傳統的攝影測量流程通常需要從精心規劃的角度拍攝 100 到 300 張以上的圖像,才能建立可用的 3D 模型。而 Atlas 將這一需求縮減至僅需兩到三張輸入圖像,即可生成點雲和高斯濺射等明確的 3D 表示,其精細度被公司描述為驚人。
在稀疏視圖 3D 重建基準測試(包括 DTU 和 ETH3D)中,Atlas 的平均絕對相對點圖誤差為 25.3,其最接近的開源競爭對手得分為 28.7。
World Labs 的共同創辦人將新的視角預測稱為「空間智能的 AI 完整基本元件」。翻譯:想像從未拍攝過的角度所見場景的能力,是一項基礎能力,能開啟從機器人導航到視覺效果工作流程的各種應用。
人類的判決
在評估攝影機控制品質的消費者測試中,人類評審員有 75% 至 94% 的時間更偏好 Atlas 而非競爭產品。
Atlas 也支援動態時空模擬,包括子彈時間效果。想像《駭客任務》中標誌性的慢動作旋轉鏡頭,但這是由 AI 生成,而非依賴複雜的同步攝影機陣列。
該模型在一個統一的空間情境中處理所有這些功能。與其分別拼接用於影片生成、3D 重建和新視角合成的獨立工具,Atlas 將這些功能整合到單一系統中。
從實驗室到限量發佈
World Labs 自 2024 年公司成立以來,便一直為這一時刻做準備。該初創公司從一開始就吸引了大量關注,這主要歸功於 Li 在現代電腦視覺領域作為架構師之一的聲譽。她的 ImageNet 數據集及相關挑戰在十多年前推動了深度學習革命的發展。
Atlas 於 2026 年 9 月 1 日公布,目前正進入為特定合作夥伴提供的早期訪問階段。World Labs 尚未公開發布該模型的權重或代碼,目前將此技術置於受控存取的牆後。

