Reconstruir uma cena 3D costumava exigir centenas de fotografias cuidadosamente capturadas, equipamento caro e uma boa dose de paciência. A World Labs, empresa de inteligência espacial co-fundada pela renomada especialista em IA de Stanford Fei-Fei Li, acabou de reduzir esse fluxo de trabalho para duas ou três fotos.
O novo modelo da empresa, chamado Atlas, é um transformer difusivo autoregressivo multimodal pré-treinado. Em termos mais simples: é um sistema de IA que entende texto, imagens, vídeos e dados 3D ao mesmo tempo e pode usar essa compreensão para preencher tudo que a câmera não capturou. O resultado é a reconstrução completa da cena 3D, síntese de novas visualizações e geração de vídeo controlada por câmera, tudo a partir de entradas mínimas.
O que o Atlas realmente faz
O Atlas opera como o que a World Labs chama de “modelo omni world” para inteligência espacial. Forneça entre uma e seis imagens de referência, e ele pode gerar até um minuto de vídeo em resolução 1440p, mantendo controle preciso da câmera ao longo de trajetórias exatas que você especificar.
A capacidade de reconstrução 3D é onde as coisas se tornam verdadeiramente impressionantes. Pipelines tradicionais de fotogrametria geralmente exigem de 100 a 300+ imagens tiradas de ângulos cuidadosamente planejados para criar um modelo 3D utilizável. O Atlas reduz essa exigência para apenas duas ou três imagens de entrada, produzindo representações 3D explícitas, como nuvens de pontos e splats gaussianos, com fidelidade descrita pela empresa como notável.
Nos benchmarks de reconstrução 3D com visão esparsa, incluindo DTU e ETH3D, o Atlas obteve um erro médio absoluto-relativo do pointmap de 25,3. Seu concorrente de código aberto mais próximo obteve 28,7.
Os co-fundadores da World Labs descrevem a previsão de novas visões como “uma primitiva AI-completa para inteligência espacial.” Tradução: a capacidade de imaginar como uma cena se parece sob ângulos que você nunca fotografou é uma habilidade fundamental, que desbloqueia tudo, desde navegação robótica até pipelines de efeitos visuais.
O veredito humano
Em testes de consumidores avaliando a qualidade do controle da câmera, avaliadores humanos preferiram o Atlas em vez dos modelos concorrentes entre 75% e 94% das vezes.
O Atlas também suporta simulações dinâmicas de espaço-tempo, incluindo efeitos de bullet-time. Pense no movimento icônico de câmera em câmera lenta giratória de The Matrix, mas gerado por IA, em vez de um equipamento elaborado de câmeras sincronizadas.
O modelo lida com tudo isso dentro de um contexto espacial unificado. Em vez de combinar ferramentas separadas para geração de vídeo, reconstrução 3D e síntese de visões novas, o Atlas consolida essas funções em um único sistema.
Do laboratório para lançamento limitado
A World Labs vem construindo para este momento desde a fundação da empresa em 2024. A startup atraiu atenção significativa desde o início, em grande parte devido à reputação de Li como uma das arquitetas da visão computacional moderna. Seu conjunto de dados ImageNet e os desafios associados desempenharam papel central na catalisar a revolução do deep learning há mais de uma década.
O Atlas foi anunciado em 1º de setembro de 2026 e atualmente está entrando em uma fase de acesso antecipado para parceiros selecionados. A World Labs ainda não liberou publicamente os pesos ou o código do modelo, mantendo a tecnologia atrás de um muro de acesso controlado por enquanto.

