ByteDance développe des systèmes d'IA capables de générer des vidéos en temps réel avec une conscience spatiale. L'entreprise mère de TikTok a fait des modèles mondiaux, qui englobent la vidéo interactive en temps réel et la génération consciente de la 3D, une priorité majeure de l'IA pour 2026.
Les blocs de construction techniques
L'équipe de recherche Seed de ByteDance a accumulé des mises à jour à un rythme régulier. Seedance 2.0 a été lancée en février 2026 avec un accent sur la génération multimodale précise sur le plan physique. Ensuite, Seedance 2.5 est arrivée le 31 juillet, poussant davantage les limites avec des clips audio-visuels uniques de 30 secondes, des contrôles spatiaux améliorés et un système de référence en argile pour la planification du mouvement 3D.
Un article arXiv publié vers le 24 août a introduit l'entraînement adversarial autoregressif post-entraînement, ou AAPT. Le modèle décrit dans l'article peut générer des vidéos à 24 images par seconde avec une faible latence, produisant des sorties cohérentes d'une minute.
Avant Seedance 2.5, ByteDance avait déjà publié Helios, un modèle à poids ouvert atteignant environ 19,5 images par seconde pour des vidéos d'une minute fonctionnant sur une seule GPU. Helios a été lancé en mars 2026.
Les contrôles interactifs font également partie du lot. Les systèmes acceptent les entrées de pose et de caméra, permettant des applications telles que la génération d'humains virtuels où les utilisateurs peuvent diriger la sortie plutôt que de simplement la demander.
Modèles mondiaux et le benchmark Genie 3
En juin 2026, ByteDance a officiellement élevé les modèles mondiaux au rang de priorité majeure en matière d'IA. L'objectif déclaré est de correspondre à Genie 3 de Google, une référence pour la simulation interactive du monde.
ByteDance investit sérieusement dans cet effort. Les budgets de données d'entraînement pour les modèles mondiaux ont atteint des chiffres à huit chiffres en RMB.
Le laboratoire Multimédia de l'entreprise commercialise simultanément des pipelines vidéo spatiale 4D et 6DoF (six degrés de liberté) pour le contenu volumétrique. Ces systèmes prennent en charge des expériences spatiales en direct et à la demande, avec un déploiement progressif noté à partir de la fin 2025 jusqu'en 2026.
