Реконструкция 3D-сцены раньше требовала сотен тщательно сделанных фотографий, дорогостоящего оборудования и большого терпения. World Labs — компания по пространственному интеллекту, сооснованная известным специалистом по ИИ из Стэнфорда Фей-Фей Ли — сократила этот процесс до двух-трех снимков.
Новая модель компании под названием Atlas — это предварительно обученный мультимодальный авторегрессивный диффузионный трансформер. Проще говоря: это ИИ-система, которая одновременно понимает текст, изображения, видео и 3D-данные и может использовать это понимание для восстановления всего, что камера не зафиксировала. Результатом является полная реконструкция 3D-сцены, синтез новых ракурсов и генерация видео с управлением через камеру — всё на основе минимального ввода.
Что на самом деле делает Atlas
Atlas работает как то, что World Labs называет «омни-моделью» для пространственного интеллекта. Подайте ей от одной до шести опорных изображений, и она сможет сгенерировать до одной минуты видео в разрешении 1440p, сохраняя точный контроль над камерой по точно заданным вами траекториям.
Возможность трехмерного восстановления — это то, что действительно впечатляет. Традиционные конвейеры фотограмметрии обычно требуют от 100 до 300 и более изображений, снятых с тщательно спланированных углов, чтобы создать пригодную для использования 3D-модель. Atlas сводит это требование к всего двум или трем входным изображениям, создавая явные 3D-представления, такие как облака точек и гауссовы сплайты, с высокой точностью, которую компания описывает как замечательную.
На тестах 3D-реконструкции с ограниченным обзором, включая DTU и ETH3D, Atlas показал среднюю абсолютную относительную ошибку точечной карты 25,3. Его ближайший открытый конкурент набрал 28,7.
Сооснователи World Labs описывают новое предсказание вида как «AI-полный примитив для пространственного интеллекта». Перевод: способность вообразить, как выглядит сцена с углов, которые вы никогда не фотографировали, — это фундаментальная способность, которая открывает возможности от навигации роботов до конвейеров визуальных эффектов.
Человеческое решение
В потребительских тестах, оценивающих качество управления камерой, человеческие оценщики предпочли Atlas конкурирующим моделям от 75% до 94% времени.
Atlas также поддерживает динамические пространственно-временные симуляции, включая эффекты «пулевого времени». Представьте себе знаменитый медленный поворот камеры из «Матрицы», но созданный с помощью ИИ, а не сложной установкой синхронизированных камер.
Модель обрабатывает всё это в едином пространственном контексте. Вместо объединения отдельных инструментов для генерации видео, 3D-реконструкции и синтеза новых видов Atlas объединяет эти функции в единую систему.
От лаборатории к ограниченной версии
World Labs строила этот момент с момента основания компании в 2024 году. С самого начала стартап привлек значительное внимание, в основном благодаря репутации Ли как одного из архитекторов современного компьютерного зрения. Ее набор данных ImageNet и связанные с ним конкурсы сыграли ключевую роль в запуске революции глубокого обучения более десяти лет назад.
Atlas был анонсирован 1 сентября 2026 года и сейчас вступает в фазу раннего доступа для избранных партнеров. World Labs еще не опубликовала веса модели или код, сохраняя технологию за стеной контролируемого доступа.

