GPT-6 Astra 公開披露使用超過 10 萬張 Grace Blackwell GPU 訓練,這意味著前沿模型競爭已經進入超大規模集群時代。文章作者、來源:ME News

簡而言之:
- GPT-6 Astra 公開披露使用超過 10 萬張 Grace Blackwell GPU 訓練,這意味著前沿模型競爭已經進入超大規模集群時代。
- 中國頭部模型公司並非沒有大規模算力,但公開資訊顯示,在先進GPU代際和一次性集中部署規模上仍存在明顯差距。
- 字節、Kimi、DeepSeek 等公司的算力佈局正在擴大,但目前更多集中於 Hopper 架構或國產替代方案,與 Blackwell 級集群仍有距離。
- AI 競爭的關鍵已從「有沒有 GPU」轉向「能否獲得最新一代 GPU,並將數萬乃至十萬級晶片高效組織起來」。
- 即使 Blackwell 已非英偉達最新架構,Rubin 進一步降低訓練成本的趨勢,也意味著領先差距可能繼續向基礎設施能力集中。
背後有 10 萬張 Blackwell,大模型競爭進入算力基礎設施時代
黃仁勳披露 GPT-6 Astra 的訓練規模時,外界關注的並不只是「10萬張 GPU」這個數字本身,而是這個數字背後代表的一種新的 AI 競爭範式。
過去幾年,大模型競爭經常被理解為算法、數據和工程能力的競爭。模型架構創新、訓練方法優化、推理效率提升,確實決定了AI產品最終的能力。但進入2026年以後,一個越來越明顯的趨勢正在形成:當模型規模持續擴大,基礎設施能力本身已經成為決定技術上限的重要因素。
根據黃仁勳公開披露,GPT-6 Astra 訓練使用了約 10 萬張以上 Grace Blackwell GPU,並通過 NVLink72 組成高速互聯集群。他同時表示,下一批將有 40 萬張 GPU 上線,但沒有披露具體型號和歸屬。
無論後續部署細節如何,這一資訊釋放出的信號非常明確:最先進模型的訓練,正從過去數十萬億參數、數千張 GPU 的競爭,轉向數萬甚至十萬級先進 GPU 集群之間的競爭。
這裡的關鍵並不只是數量。
如果僅僅比較 GPU 數量,中國企業並非完全沒有大規模算力資源。真正的差距在於,能否獲得最新一代高性能 GPU,以及能否讓這些 GPU 在同一個訓練任務中形成高效協同。
對於大模型而言,單張GPU的峰值性能只是基礎。訓練一個大型模型,需要大量GPU之間持續交換參數和數據。如果互聯效率不足,即使擁有大量晶片,也可能無法形成有效算力。
因此,AI 基礎設施的競爭,本質上已從「買多少卡」升級為「建設怎樣的計算系統」。
中國頭部模型公司的算力佈局,與 Blackwell 時代存在代際差距
目前公開資訊顯示,中國頭部模型公司的算力規模正在快速提升,但與 GPT-6 Astra 所代表的 Blackwell 級訓練集群相比,仍存在明顯差距。
字節跳動是國內公開算力布局中較接近國際頂尖水平的公司之一。今年,字節透過馬來西亞接入了約 3.6 萬張 B200 GPU。這批晶片屬於英偉達 Blackwell 架構,與 Astra 使用的 GB200 屬於同一代產品。
但需要注意的是,這批 B200 部署在海外。字節公開介紹中國境內 AI 基礎設施時,主要使用的仍是 Hopper 架構的中國特供版 H20,以及此前獲得的 H800 等晶片。
這體現的並非僅僅是數量上的差距,而是供應鏈與部署環境的差距。
Blackwell 相較 Hopper,在計算能力、顯存、互聯能力等方面進行了升級。尤其是 GB200,它並非單純的一張 GPU,而是將 Grace CPU 和 Blackwell GPU 結合,透過 NVL72 系統將 72 張 GPU 連接到同一個高速互聯域。
對於訓練大型模型而言,這種系統級設計的重要性日益提升。因為模型規模越大,GPU 之間通信所佔的比例越高,晶片之間能否高效協同,會直接影響訓練效率。
Kimi 背後的月之暗面也被曝出透過阿里獲得約 2 萬張 Hopper GPU。彭博社援引消息稱具體型號為 H200,但阿里否認了 H200 這一型號說法。
如果以 H200 計算,它仍屬於上一代 Hopper 架構,而 B200 已進入 Blackwell 時代。兩者之間並非簡單的新舊替代關係,而是代表了不同階段的 AI 基礎設施能力。
DeepSeek 的情況更加特殊。
DeepSeek 於 2025 年初憑藉高效能模型引發全球關注,其技術路線證明演算法優化與工程效率可部分降低算力需求。但從公開資訊來看,公司並未披露 V4 完整訓練硬體配置。
流出的梁文鋒投資者交流會轉寫稿顯示,公司5月約有2萬張H等效算力,其中大部分剛剛到貨,未來採購「基本都是英偉達」。華為提供給DeepSeek的950產能約為1.6萬張。梁文鋒稱,這批國產卡約相當於4000張Nvidia B系列,只夠當前一代模型訓練。
這些資訊反映出一個現實:即使中國企業已擁有數量可觀的 AI 算力,但距離一次訓練任務集中使用 10 萬張同代先進 GPU,仍然存在規模差距。
中國AI算力真正的短板,不是沒有晶片,而是缺少先進叢集能力
討論中國 AI 算力時,容易陷入兩個極端。
一種觀點認為,中國完全缺乏先進的 AI 芯片,因此無法參與競爭;另一種觀點認為,只要國產芯片數量增加,就可以快速追平英偉達。
實際上,情況更複雜。
AI 訓練能力由多個環節共同決定,包括晶片性能、先進製程、顯存容量、高速互聯、伺服器設計、資料中心供電、軟體生態以及大規模調度能力。
GPU 只是其中最核心的一環,但不是全部。
NVIDIA 長期建立的優勢,不僅來自 GPU 硬體,更來自 CUDA 生態、網路互聯技術、伺服器方案,以及與雲計算廠商形成的完整體系。
在 Blackwell 時代,這種體系的優勢進一步被放大。
當一次模型訓練需要 10 萬張 GPU 時,問題已不再是採購幾萬塊晶片這麼簡單,而是如何建設一個能夠穩定運行的大型計算工廠。
這也是為何在公開資料中,中國公司尚未披露使用 10 萬張同代先進 GPU 完成一次模型訓練案例的重要原因。
中國企業正通過多種方式提升能力,包括增加海外算力部署、擴大國產晶片適配規模、優化模型架構、提高訓練效率。這些路徑都有價值,但短期內很難完全替代最先進 GPU 集群帶來的基礎能力優勢。
過去幾年,中國 AI 行業證明了一個事實:算法創新可以顯著縮小部分差距。
DeepSeek 等公司的出現說明,優秀的工程團隊可以通過模型結構優化、訓練策略調整和資源利用效率提升,在有限算力條件下取得突破。
但另一個事實同樣存在:當全球競爭進入下一代基礎模型階段,算力規模的重要性仍然會上升。
效率優化可以降低成本,但很難完全改變先進硬體和超大規模叢集帶來的能力邊界。
After Blackwell, the Rubin era may further widen the infrastructure gap
更值得關注的是,Blackwell 並不是英偉達當前技術路線的終點。
英偉達下一代 Vera Rubin 架構已進入量產階段。按照英偉達公開估算,在訓練大型 MoE 模型時,Rubin 所需的 GPU 數量可降低至 Blackwell 的四分之一左右。
這意味著未來 AI 競爭可能會出現一個新的循環。
領先企業擁有最新架構,因此能以更少的晶片完成更大規模的訓練;更低的訓練成本又推動企業進行更多實驗,進一步提升模型能力。
而落後企業如果只能獲得上一代硬體,就可能面臨兩個問題:一方面訓練效率低,另一方面難以參與最大規模模型競爭。
當然,這並不意味著中國AI企業沒有機會。
AI 歷史已多次證明,技術競爭並非完全由單一硬體決定。模型創新、應用場景、商業化能力和工程效率,都可能創造新的突破。
但如果從基礎設施角度觀察,GPT-6 Astra 使用 10 萬張 Blackwell GPU 這一事件,確實揭示了一個正在發生的變化:全球 AI 競爭的核心戰場,正在從模型層面進一步向算力基礎設施層面移動。
在未來幾年,決定 AI 公司競爭力的,不只是能否訓練一個優秀模型,而是能否建立持續訓練下一代模型的能力。
對於中國AI產業而言,真正需要追趕的,並不是某一個模型或者某一次發布,而是從晶片獲取、數據中心建設、集群調度到軟體生態的一整套體系能力。
10 萬張 Blackwell 的意義,不在於它創造了一個令人震撼的數字,而在於它提醒市場:人工智慧正進入工業化階段,而工業化競爭最終比拼的是基礎設施。
參考來源:
- NVIDIA official public information on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
- Huang Renxun 公開演講及媒體採訪資訊。
- Bloomberg 關於 Kimi 算力採購及 H200 的相關報導。
- ByteDance 公開披露的 AI 基礎設施及海外算力部署資訊。
- DeepSeek 公開資訊及梁文鋒投資者交流會相關轉寫資料。
- 阿里雲關於 AI 基礎設施及大模型算力合作的公開資訊。
