World Labs 的 Atlas 模型可從 2–3 張照片重建 3D 場景

iconCryptoBriefing
分享
AI summary icon精華摘要
真實資產(RWA)新聞出爐,World Labs 推出 Atlas 模型,僅需 2–3 張照片即可重建 3D 場景。該模型支援完整的 3D 場景生成、新視角合成及鏡頭控制影片。Atlas 在稀疏視角 3D 基準測試中領先,現已開放給合作夥伴早期使用。隨著技術逐漸受關注,未來可能上線新代幣。

重建三維場景過去需要數百張精心拍攝的照片、昂貴的設備以及大量的耐心。由史丹佛AI權威李飛飛共同創立的空間智能公司World Labs,現已將此工作流程壓縮至僅需兩到三張快照。

該公司推出的新模型名為 Atlas,是一種預訓練的多模態自迴歸擴散變換器。簡單來說:這是一個能同時理解文字、圖像、影片和 3D 資料的 AI 系統,並能利用這種理解來補全攝影機未捕捉到的內容。結果是僅需最少輸入,即可實現完整的 3D 場景重建、新視角合成,以及由攝影機控制的影片生成。

Atlas 究竟做什麼

Atlas 作為 World Labs 所稱的「全維度世界模型」,用於空間智能。只需提供 1 至 6 張參考圖像,它即可生成長達一分鐘、解析度達 1440p 的影片,並精準沿著您指定的路徑控制鏡頭。

3D 重建功能才是真正令人印象深刻的部分。傳統的攝影測量流程通常需要從精心規劃的角度拍攝 100 到 300 張以上的圖像,才能建立可用的 3D 模型。而 Atlas 將這一需求縮減至僅需兩到三張輸入圖像,即可生成點雲和高斯濺射等明確的 3D 表示,其精細度被公司描述為驚人。

廣告

在稀疏視圖 3D 重建基準測試(包括 DTU 和 ETH3D)中,Atlas 的平均絕對相對點圖誤差為 25.3,其最接近的開源競爭對手得分為 28.7。

World Labs 的共同創辦人將新的視角預測稱為「空間智能的 AI 完整基本元件」。翻譯:想像從未拍攝過的角度所見場景的能力,是一項基礎能力,能開啟從機器人導航到視覺效果工作流程的各種應用。

人類的判決

在評估攝影機控制品質的消費者測試中,人類評審員有 75% 至 94% 的時間更偏好 Atlas 而非競爭產品。

Atlas 也支援動態時空模擬,包括子彈時間效果。想像《駭客任務》中標誌性的慢動作旋轉鏡頭,但這是由 AI 生成,而非依賴複雜的同步攝影機陣列。

該模型在一個統一的空間情境中處理所有這些功能。與其分別拼接用於影片生成、3D 重建和新視角合成的獨立工具,Atlas 將這些功能整合到單一系統中。

從實驗室到限量發佈

World Labs 自 2024 年公司成立以來,便一直為這一時刻做準備。該初創公司從一開始就吸引了大量關注,這主要歸功於 Li 在現代電腦視覺領域作為架構師之一的聲譽。她的 ImageNet 數據集及相關挑戰在十多年前推動了深度學習革命的發展。

Atlas 於 2026 年 9 月 1 日公布,目前正進入為特定合作夥伴提供的早期訪問階段。World Labs 尚未公開發布該模型的權重或代碼,目前將此技術置於受控存取的牆後。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露