Reconstruir una escena 3D solía requerir cientos de fotografías cuidadosamente capturadas, equipo costoso y una buena dosis de paciencia. World Labs, la empresa de inteligencia espacial cofundada por la reconocida experta en IA de Stanford Fei-Fei Li, acaba de reducir este proceso a dos o tres instantáneas.
El nuevo modelo de la empresa, llamado Atlas, es un transformador de difusión autoregresivo multimodal preentrenado. En términos más sencillos: es un sistema de IA que entiende texto, imágenes, video y datos 3D al mismo tiempo, y puede utilizar esa comprensión para completar todo lo que una cámara no capturó. El resultado es la reconstrucción completa de escenas 3D, la síntesis de vistas nuevas y la generación de video controlada por cámara, todo a partir de una entrada mínima.
Lo que realmente hace Atlas
Atlas opera como lo que World Labs denomina un "modelo omniworld" para la inteligencia espacial. Proporcione entre una y seis imágenes de referencia, y podrá generar hasta un minuto de video en resolución 1440p, manteniendo un control preciso de la cámara a lo largo de trayectorias exactas que usted especifique.
La capacidad de reconstrucción 3D es donde las cosas se vuelven verdaderamente impresionantes. Los flujos de trabajo tradicionales de fotogrametría suelen requerir entre 100 y 300+ imágenes tomadas desde ángulos cuidadosamente planificados para crear un modelo 3D utilizable. Atlas reduce esta necesidad a tan solo dos o tres imágenes de entrada, produciendo representaciones 3D explícitas como nubes de puntos y splats gaussianos con una fidelidad que la empresa describe como notable.
En los conjuntos de prueba de reconstrucción 3D de vista escasa, incluyendo DTU y ETH3D, Atlas obtuvo un error medio absoluto-relativo del mapa de puntos de 25.3. Su competidor de código abierto más cercano obtuvo 28.7.
Los cofundadores de World Labs describen la predicción de nuevas vistas como “una primitiva completa de IA para la inteligencia espacial”. Traducción: la capacidad de imaginar cómo se ve una escena desde ángulos que nunca se han fotografiado es una capacidad fundamental que habilita todo, desde la navegación robótica hasta las pipelines de efectos visuales.
El veredicto humano
En pruebas de consumidores que evaluaron la calidad del control de la cámara, los evaluadores humanos prefirieron Atlas sobre los modelos competidores entre el 75 % y el 94 % del tiempo.
Atlas también admite simulaciones dinámicas de espacio-tiempo, incluyendo efectos de tiempo bala. Piensa en el icónico movimiento de cámara en cámara lenta y rotatoria de The Matrix, pero generado por IA en lugar de un complejo sistema de cámaras sincronizadas.
El modelo maneja todo esto dentro de un contexto espacial unificado. En lugar de combinar herramientas separadas para generación de video, reconstrucción 3D y síntesis de vistas nuevas, Atlas integra estas funciones en un solo sistema.
De laboratorio a lanzamiento limitado
World Labs ha estado construyendo hacia este momento desde su fundación en 2024. La startup atrajo atención significativa desde el principio, en gran parte debido a la reputación de Li como una de las arquitectas de la visión por computadora moderna. Su conjunto de datos ImageNet y los desafíos asociados jugaron un papel central en catalizar la revolución del aprendizaje profundo hace más de una década.
Atlas fue anunciado el 1 de septiembre de 2026 y actualmente está entrando en una fase de acceso anticipado para socios seleccionados. World Labs no ha liberado públicamente los pesos ni el código del modelo, manteniendo la tecnología detrás de un muro de acceso controlado por ahora.

