Реконструкція 3D-сцени раніше вимагала сотень уважно зроблених фотографій, дорогого обладнання та великої кількості терпіння. World Labs, компанія зі просторовою інтелігенцією, заснована спільно з відомим фахівцем з Штанського ІІ Fei-Fei Li, зменшила цей процес до двох або трьох знімків.
Нова модель компанії під назвою Atlas — це передньо навчаний багатомодальний автoreгресивний дифузійний трансформер. Простіше кажучи: це ІС, яка розуміє текст, зображення, відео та 3D-дані одночасно і може використовувати це розуміння, щоб заповнити все, чого не зафіксувала камера. Результатом є повна реконструкція 3D-сцени, синтез нових кутів огляду та генерація відеоконтролюваного відео на основі мінімального вводу.
Що насправді робить Atlas
Atlas працює як «омні-світова модель», яку World Labs називає для просторової інтелігентності. Надайте їй від одного до шести опорних зображень, і вона зможе згенерувати відео тривалістю до хвилини з роздільною здатністю 1440p, зберігаючи точний контроль над камерою вздовж точно вказаних вами траєкторій.
Функція 3D-реконструкції — це те, що справді вражає. Традиційні конвеєри фотограмметрії зазвичай вимагають від 100 до 300+ зображень, зроблених з уважно спланованих кутів, щоб створити придатну 3D-модель. Atlas зменшує цю вимогу до лише двох або трьох вхідних зображень, створюючи явні 3D-репрезентації, такі як хмари точок і гауссові сплайти, зі згідно з описом компанії винятковою точністю.
На тестах 3D-реконструкції з обмеженим оглядом, включаючи DTU та ETH3D, Atlas показав середню абсолютну відносну помилку точкової карти 25,3. Його найближчий відкритий конкурент набрав 28,7.
Засновники World Labs описують нову прогнозування перспективи як «AI-повний примітив для просторової інтелігентності». Переклад: здатність уявити, як виглядає сцена з кутів, які ви ніколи не фотографували, є фундаментальною здатністю, яка відкриває шлях до такого, як навігація роботів та візуальні ефекти.
Людський вирок
У споживчих тестах, що оцінювали якість керування камерою, люди вибирали Atlas замість конкуруючих моделей від 75% до 94% часу.
Atlas також підтримує динамічні просторово-часові симуляції, включаючи ефекти «кулькового часу». Уявіть собі іконічний повільний рух камери з обертанням з фільму «Матриця», але згенерований за допомогою ШІ, а не складною системою синхронізованих камер.
Модель обробляє все це в єдиному просторовому контексті. Замість поєднання окремих інструментів для генерації відео, 3D-реконструкції та синтезу нових кутів огляду, Atlas об’єднує ці функції в єдиній системі.
Від лабораторії до обмеженого релізу
World Labs будувала цей момент з моменту заснування компанії у 2024 році. Стартап привернув значну увагу з самого початку, головним чином завдяки репутації Лі як одного з архітекторів сучасного комп’ютерного зору. Її набір даних ImageNet та пов’язані виклики відіграли ключову роль у запуску революції глибокого навчання понад десять років тому.
Atlas було оголошено 1 вересня 2026 року, і зараз він перебуває на етапі раннього доступу для обраних партнерів. World Labs ще не опублікував ваги моделі чи код, зберігаючи технологію за межами контролюваного доступу.

