ByteDance está desarrollando sistemas de IA capaces de generar video en tiempo real con conciencia espacial. La empresa matriz de TikTok ha convertido los modelos mundiales, que abarcan video interactivo en tiempo real y generación consciente de 3D, en una prioridad principal de IA para 2026.
Los bloques técnicos de construcción
El equipo de investigación Seed de ByteDance ha estado lanzando actualizaciones a un ritmo constante. Seedance 2.0 se lanzó en febrero de 2026 con un enfoque en la generación multimodal precisa desde el punto de vista físico. Luego llegó Seedance 2.5 el 31 de julio, que llevó aún más lejos los límites con clips de audio-video de 30 segundos en un solo paso, controles espaciales mejorados y un sistema de referencia de modelado en arcilla para la planificación de movimiento 3D.
Un artículo de arXiv publicado alrededor del 24 de agosto presentó el entrenamiento adversario autoregresivo posterior, o AAPT. El modelo descrito en el artículo puede generar video a 24 cuadros por segundo con baja latencia, produciendo salidas coherentes de un minuto de duración.
Antes de Seedance 2.5, ByteDance ya había lanzado Helios, un modelo de peso abierto que alcanzó aproximadamente 19.5 fps para videos de un minuto ejecutados en una sola GPU. Helios se lanzó en marzo de 2026.
Los controles interactivos también forman parte del paquete. Los sistemas aceptan entradas de postura y cámara, permitiendo aplicaciones como la generación de humanos virtuales donde los usuarios pueden dirigir la salida en lugar de simplemente indicarla.
Modelos mundiales y el benchmark Genie 3
En junio de 2026, ByteDance elevó formalmente los modelos mundiales a un enfoque de IA de primer nivel. El objetivo declarado es igualar a Genie 3 de Google, una referencia para la simulación interactiva del mundo.
ByteDance está invirtiendo una cantidad significativa de dinero en este esfuerzo. Los presupuestos para datos de entrenamiento de modelos mundiales han alcanzado cifras de ocho dígitos en RMB.
El laboratorio Multimedia de la empresa está comercializando simultáneamente pipelines de video espacial 4D y 6DoF (seis grados de libertad) para contenido volumétrico. Estos sistemas gestionan experiencias espaciales en vivo y bajo demanda, con avances en la implementación registrados desde finales de 2025 hasta 2026.
