ByteDance разрабатывает ИИ-системы, способные генерировать видео в реальном времени с пространственным осознанием. Материнская компания TikTok сделала мировые модели, включающие интерактивное видео в реальном времени и генерацию с учетом 3D, приоритетной задачей ИИ на 2026 год.
Технические строительные блоки
Исследовательская команда Seed компании ByteDance регулярно выпускает обновления. Seedance 2.0 был выпущен в феврале 2026 года с акцентом на физически точную мультимодальную генерацию. Затем 31 июля появился Seedance 2.5, который еще больше расширил возможности благодаря аудио-видео клипам продолжительностью 30 секунд с однопроходной обработкой, улучшенными пространственными контролами и системой ссылок на глиняную визуализацию для планирования 3D-движения.
Статья на arXiv, опубликованная примерно 24 августа, представила авторегрессивное противостоящее пост-обучение (AAPT). Модель, описанная в статье, может генерировать видео со скоростью 24 кадра в секунду с низкой задержкой, создавая согласованные выходные данные продолжительностью в минуту.
До Seedance 2.5 ByteDance уже выпустила Helios — модель с открытыми весами, которая показывала примерно 19,5 кадров в секунду для видео продолжительностью в минуту на одном GPU. Helios была выпущена в марте 2026 года.
Интерактивные элементы управления также входят в комплект. Системы принимают данные о позе и камере, что позволяет создавать приложения, такие как генерация виртуальных людей, где пользователи могут управлять результатом, а не просто задавать запрос.
Модели мира и бенчмарк Genie 3
В июне 2026 года ByteDance официально повысила мировые модели до уровня приоритетного направления ИИ. Заявленная цель — соответствовать Genie 3 от Google, эталону для интерактивного моделирования миров.
ByteDance вкладывает серьезные средства в эти усилия. Бюджеты на обучающие данные для мировых моделей достигли восьмизначных сумм в китайских юанях.
Мультимедийная лаборатория компании одновременно коммерциализирует пространственные видеопотоки 4D и 6DoF (шесть степеней свободы) для объемного контента. Эти системы обрабатывают как живые, так и по запросу пространственные опыты, с прогрессом внедрения, отмеченным с конца 2025 года по 2026 год.
