據報導,字節跳動正準備預訓練一個擁有約 10 兆參數的 AI 模型,這一規模將遠超所有已知的中國 AI 系統,並使該公司與最先進的西方實驗室直接競爭。此項工作將需要約 30,000 個 GPU,以及估計 3 至 6 個月的連續預訓練。
為了讓 10 兆參數更具體,這比月之暗面 AI 的 Kimi K3(2.8 兆參數)還要大三倍以上,而 Kimi K3 目前是中國產出的最大模型之一。參數本質上是 AI 模型在訓練過程中用來學習數據模式的調整鈕。
字節跳動實際上正在建設什麼
所提及的模型採用專家混合(MoE)架構。與對每個查詢都啟用所有參數不同,MoE 模型會將每個輸入路由至一組專門的「專家」子網絡。這使得它們在推理時的運行效率遠高於相同總規模的密集模型。
據報導,由約 2,000 名員工組成的字節跳動 Seed AI 團隊正主導此項工作。該團隊此前有擴展訓練經驗,曾使用約 12,000 塊 GPU 訓練參數高達 1750 億的模型。字節跳動已發表關於其 MegaScale 基礎設施的研究,該基礎設施專為管理超過 10,000 塊 GPU 的分散式訓練系統而設計。
預訓練階段僅是第一步。初始運行後,該模型將在任何可能的公開發布前進行微調。據報導,字節跳動創始人張一鳴已指示 Seed AI 團隊專注於真正的技術突破,而非依賴於對西方 AI 系統的知識蒸餾。
為什麼字節跳動認為自己能成功實現這一點
字節跳動擁有幾項結構性優勢,使這不僅僅是一個面子工程。該公司運營著 TikTok,全球用戶超過 10 億,以及中國最廣泛使用的 AI 助手之一 Doubao。這一龐大的消費者基礎產生了海量的互動數據,可用於指導訓練和微調決策。
當然,房間裡的象是美國對先進 AI 芯片的出口限制。華盛頓已逐步加強對高階 Nvidia GPU 及其他加速器銷售給中國實體的管控。字節跳動尚未公開詳細說明其此次訓練計劃將使用哪些具體的 GPU 型號,但該公司能夠調集 30,000 個這樣的晶片,表明其已找到繞過限制的可行途徑。
這重塑了競爭格局
字節跳動並非唯一擁有宏大目標的中國AI實驗室。阿里巴巴的Qwen團隊、百度,以及DeepSeek和Moonshot AI等初創公司,都一直在推進模型規模的邊界。但一個10兆參數的模型,將遠遠超越它們任何一家公開宣佈或部署的規模。
該目標也將字節跳動納入與西方前沿實驗室的對話中。據報導,字節跳動旨在追趕的 Anthropic 最新系統,代表了目前公知 AI 能力的頂峰。
3 至 6 個月的預訓練窗口意味著結果或並發症可能在 2026 年底前開始出現。
