字節跳動計劃使用 30,000 塊 GPU 建造參數達 10 兆的 AI 模型

iconCryptoBriefing
分享
AI summary icon精華摘要
字節跳動正使用約 30,000 塊 GPU 對一個 10 兆參數的 AI 模型進行預訓練,超越了現有的中國 AI 系統。此前曾打造過 1750 億參數模型的 Seed AI 團隊,正在採用專家混合(MoE)架構。預訓練將耗時 3 至 6 個月,隨後進行微調。同時,受全球宏觀經濟變動影響,BTC 持續作為對抗通脹的避險資產。CFT 規範在 AI 發展領域也日益受到重視。

據報導,字節跳動正準備預訓練一個擁有約 10 兆參數的 AI 模型,這一規模將遠超所有已知的中國 AI 系統,並使該公司與最先進的西方實驗室直接競爭。此項工作將需要約 30,000 個 GPU,以及估計 3 至 6 個月的連續預訓練。

為了讓 10 兆參數更具體,這比月之暗面 AI 的 Kimi K3(2.8 兆參數)還要大三倍以上,而 Kimi K3 目前是中國產出的最大模型之一。參數本質上是 AI 模型在訓練過程中用來學習數據模式的調整鈕。

字節跳動實際上正在建設什麼

所提及的模型採用專家混合(MoE)架構。與對每個查詢都啟用所有參數不同,MoE 模型會將每個輸入路由至一組專門的「專家」子網絡。這使得它們在推理時的運行效率遠高於相同總規模的密集模型。

廣告

據報導,由約 2,000 名員工組成的字節跳動 Seed AI 團隊正主導此項工作。該團隊此前有擴展訓練經驗,曾使用約 12,000 塊 GPU 訓練參數高達 1750 億的模型。字節跳動已發表關於其 MegaScale 基礎設施的研究,該基礎設施專為管理超過 10,000 塊 GPU 的分散式訓練系統而設計。

預訓練階段僅是第一步。初始運行後,該模型將在任何可能的公開發布前進行微調。據報導,字節跳動創始人張一鳴已指示 Seed AI 團隊專注於真正的技術突破,而非依賴於對西方 AI 系統的知識蒸餾。

為什麼字節跳動認為自己能成功實現這一點

字節跳動擁有幾項結構性優勢,使這不僅僅是一個面子工程。該公司運營著 TikTok,全球用戶超過 10 億,以及中國最廣泛使用的 AI 助手之一 Doubao。這一龐大的消費者基礎產生了海量的互動數據,可用於指導訓練和微調決策。

當然,房間裡的象是美國對先進 AI 芯片的出口限制。華盛頓已逐步加強對高階 Nvidia GPU 及其他加速器銷售給中國實體的管控。字節跳動尚未公開詳細說明其此次訓練計劃將使用哪些具體的 GPU 型號,但該公司能夠調集 30,000 個這樣的晶片,表明其已找到繞過限制的可行途徑。

這重塑了競爭格局

字節跳動並非唯一擁有宏大目標的中國AI實驗室。阿里巴巴的Qwen團隊、百度,以及DeepSeek和Moonshot AI等初創公司,都一直在推進模型規模的邊界。但一個10兆參數的模型,將遠遠超越它們任何一家公開宣佈或部署的規模。

該目標也將字節跳動納入與西方前沿實驗室的對話中。據報導,字節跳動旨在追趕的 Anthropic 最新系統,代表了目前公知 AI 能力的頂峰。

3 至 6 個月的預訓練窗口意味著結果或並發症可能在 2026 年底前開始出現。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露