字節跳動正在開發能夠以空間感知實時生成影片的 AI 系統。作為 TikTok 的母公司,字節跳動已將涵蓋實時互動影片與 3D 感知生成的「世界模型」列為 2026 年的首要 AI 重點。
技術基礎模組
字節跳動的 Seed 研究團隊一直穩定地推出新版本。Seedance 2.0 於 2026 年 2 月推出,專注於物理準確的多模態生成。隨後於 7 月 31 日推出 Seedance 2.5,進一步突破極限,支援 30 秒單次通過的音視頻片段、增強的空間控制,以及用於 3D 動作規劃的黏土渲染參考系統。
一篇於八月二十四日左右發表於 arXiv 的論文介紹了自迴歸對抗後訓練(AAPT)。該論文所描述的模型能以每秒 24 幀的速率生成影片,並具有低延遲,可產生分鐘長度的連貫輸出。
在 Seedance 2.5 之前,字節跳動已發布了 Helios,這是一個開源權重模型,在單一 GPU 上運行一分鐘影片時可達約 19.5 fps。Helios 於 2026 年 3 月推出。
互動式控制也是套件的一部分。系統接受姿勢和攝影機輸入,支援如虛擬人物生成等應用,讓用戶能夠引導輸出,而不僅僅是提示它。
世界模型與 Genie 3 基準
在 2026 年 6 月,字節跳動正式將世界模型提升為頂級 AI 重點。其明確目標是達到 Google 的 Genie 3 水準,這是一項互動式世界模擬的基準。
字節跳動正在為此投入大量資金。全球模型的訓練數據預算已達到八位數人民幣。
該公司的多媒體實驗室正同時商業化用於體積內容的 4D 和 6DoF(六自由度)空間視頻流程。這些系統支援即時與點播的空間體驗,部署進度將從 2025 年底持續至 2026 年。
