3Dシーンの再構築は、かつて丁寧に撮影された数百枚の写真と高価な機器、そして多くの忍耐を必要としていました。スタンフォードAIの権威であるFei-Fei Liが共同設立した空間知能企業World Labsは、このワークフローをわずか2〜3枚のスナップショットに圧縮しました。
同社の新モデル「Atlas」は、事前学習されたマルチモーダル自己回帰扩散変換器です。言い換えると、これはテキスト、画像、動画、3Dデータを同時に理解し、カメラが捉えられなかった部分を補完できるAIシステムです。その結果、最小限の入力だけで、完全な3Dシーンの再構築、新規ビューの合成、カメラ制御による動画生成が可能になります。
アトラスが実際に行うこと
Atlasは、World Labsが「オムニワールドモデル」と呼ぶ空間知能のためのモデルとして動作します。1〜6枚の参照画像を入力すると、指定した正確な経路に沿ってカメラ制御を維持しながら、1440p解像度で最大1分間の動画を生成できます。
3D再構成機能が、本当に印象的な部分です。従来のフォトグラメトリーパイプラインでは、使用可能な3Dモデルを構築するために、通常100〜300枚以上の精心に計画された角度から撮影された画像が必要です。Atlasは、この要件を2〜3枚の入力画像まで削減し、同社が「驚異的な忠実度」と説明する点群やガウシアンスプラットといった明示的な3D表現を生成します。
DTUやETH3Dを含むスパースビュー3D再構成ベンチマークにおいて、Atlasは平均絶対相対点マップ誤差25.3を記録しました。最も近いオープンソース競合製品は28.7を記録しました。
World Labsの共同創設者は、新しいビュー予測を「空間知能のためのAI完全なプリミティブ」と位置づけている。つまり、これまで撮影したことのない角度からシーンを想像する能力は、ロボットのナビゲーションからビジュアルエフェクトのパイプラインに至るまで、あらゆる可能性を解き放つ基盤的な能力である。
人の判断
消費者テストにおいてカメラ制御の品質を評価したところ、人間の評価者は75%から94%の頻度でAtlasを競合モデルよりも好みました。
Atlasは、バレットタイム効果を含む動的空間時間シミュレーションもサポートしています。『マトリックス』で有名な、複数の同期したカメラを使用したスローモーション回転カメラの動きを、高度なカメラ装置ではなくAIで生成することを考えてみてください。
このモデルは、動画生成、3D再構成、新規ビュー合成のための別々のツールを組み合わせるのではなく、統一された空間的文脈内でこれらすべてを処理します。Atlasはこれらの機能を単一のシステムに統合しています。
ラボから限定リリースへ
World Labsは、2024年の設立以来、この瞬間を目指して構築を進めてきました。このスタートアップは、当初から注目を集めました。その主な理由は、Liが現代のコンピュータビジョンの設計者たちの一人であるという評判によるものです。彼女のImageNetデータセットと関連するチャレンジは、10年以上前にディープラーニング革命を促進する中心的な役割を果たしました。
Atlasは2026年9月1日に発表され、現在、特定のパートナー向けにエアリー・アクセス段階に入っています。World Labsは、モデルの重みやコードを一般に公開しておらず、現在のところ技術は制限されたアクセスの枠内に保たれています。

