GPT-6 Astraは、10万枚以上のGrace Blackwell GPUを使用してトレーニングされたことが公表され、これは最先端モデルの競争が超大規模クラスタ時代に入ったことを意味します。記事執筆者、出典:ME News

要約:
- GPT-6 Astraは、10万枚以上のGrace Blackwell GPUを使用してトレーニングされたことが公表され、これは最先端モデルの競争が超大規模クラスタ時代に入ったことを意味します。
- 中国のトップモデル企業は大規模な計算能力を持っていないわけではないが、公開情報によると、先進的なGPUの世代と一括導入規模において明確な差が存在する。
- バイトダンス、Kimi、DeepSeekなどの企業の計算能力の展開は拡大しているが、現在は主にHopperアーキテクチャまたは国内代替案に集中しており、Blackwell級クラスターとはまだ差がある。
- AI競争の鍵は、「GPUがあるかどうか」から、「最新世代のGPUを入手し、数万乃至十万級のチップを効率的に組織できるかどうか」に移っている。
- BlackwellがNVIDIAの最新アーキテクチャでないとしても、Rubinがトレーニングコストをさらに削減する傾向は、リード差がインフラストラクチャ能力にさらに集中する可能性を示している。
10万枚のBlackwellの背後で、大規模モデルの競争は計算インフラ時代に入りました
黄仁勲がGPT-6 Astraのトレーニング規模を明らかにした際、外界が注目したのは「10万枚のGPU」という数字そのものではなく、その背後にある新たなAI競争のパラダイムである。
過去数年間、大規模モデルの競争は、アルゴリズム、データ、エンジニアリング能力の競争と理解されてきた。モデルアーキテクチャの革新、トレーニング手法の最適化、推論効率の向上は、確かにAI製品の最終的な能力を決定づけてきた。しかし、2026年以降、はっきりと見えてきたトレンドがある。モデル規模が継続的に拡大する中で、インフラストラクチャの能力自体が、技術の上限を決定する重要な要因となっている。
黄仁勲の公表によると、GPT-6 Astraのトレーニングには10万枚以上のGrace Blackwell GPUが使用され、NVLink72を介して高速接続されたクラスタを構成しています。また、次回のリリースでは40万枚のGPUが追加される予定ですが、具体的なモデルや所有者は明かされていません。
今後の展開の詳細がどうなるかにかかわらず、この情報は明確なシグナルを発信しています:最先端モデルのトレーニングは、過去の数十万兆パラメータや数千枚のGPUによる競争から、数万〜十数万枚の最先端GPUクラスタ間の競争へと移行しつつあります。
ここでの鍵は数量だけではありません。
GPUの数だけを比較すれば、中国企業も大規模な計算リソースを完全に持っていないわけではない。真の差は、最新世代の高性能GPUを入手できるかどうか、そしてこれらのGPUを同じトレーニングタスク内で高効率で協調させられるかどうかにある。
大規模モデルにとって、単一GPUのピーク性能は基礎に過ぎません。大規模モデルを訓練するには、多数のGPU間で継続的にパラメータやデータを交換する必要があります。インターコネクトの効率が不足している場合、たとえ多数のチップを所有していても、有効な計算能力を構築できません。
したがって、AIインフラストラクチャにおける競争は、本質的に「どのくらいのカードを購入するか」から「どのような計算システムを構築するか」へと昇華しています。
中国トップモデル企業の計算能力の配置は、Blackwell時代と世代差がある
現在の公開情報によると、中国のトップモデル企業の計算能力規模は急速に向上していますが、GPT-6 Astraが代表するBlackwell級のトレーニングクラスターと比較すると、依然として明確な差があります。
バイトダンスは、国内で公開されている算力展開において、国際的なトップレベルに最も近い企業の一つである。今年、バイトダンスはマレーシアを通じて約36,000枚のB200 GPUを導入した。これらのチップはNVIDIAのBlackwellアーキテクチャに属し、Astraが使用するGB200と同一世代の製品である。
ただし、このB200は海外に展開されていることに注意が必要である。バイトダンスが中国国内のAIインフラを公に紹介する際には、主に中国専用版のH20や、これまでに取得したH800などのチップが使用されている。
これには単なる数量の差ではなく、サプライチェーンと展開環境の差が示されています。
Blackwellは、Hopperと比較して、計算能力、メモリ、インターコネクト能力などにおいてアップグレードされています。特にGB200は、単なるGPUではなく、Grace CPUとBlackwell GPUを統合し、NVL72システムを用いて72枚のGPUを同じ高速インターコネクトドメインに接続しています。
大規模モデルのトレーニングにおいて、このようなシステムレベルの設計の重要性が高まっています。モデルの規模が大きくなるほど、GPU間の通信が占める割合が増加し、チップ間の効率的な協調がトレーニング効率に直接影響します。
Kimiの背後にある月の暗面は、アリババを通じて約2万枚のHopper GPUを取得したことが明らかになった。ブルームバーグは、具体的なモデルがH200であると報じたが、アリババはH200というモデルに関する主張を否定している。
H200で計算した場合、それは依然として前世代のHopperアーキテクチャに属し、B200はすでにBlackwell時代に入っています。両者は単なる新旧の置き換えではなく、異なる段階のAIインフラストラクチャ能力を表しています。
DeepSeekの状況はさらに特殊である。
DeepSeekは2025年初、高効率モデルにより世界的な注目を集め、その技術路線はアルゴリズム最適化とエンジニアリング効率が計算リソース需要を一部軽減できることを実証した。しかし、公開情報によると、同社はV4の完全なトレーニングハードウェア構成を明らかにしていない。
流出した梁文鋒による投資家交流会の書き起こしによると、同社は5月に約2万枚のH相当の算力を保有しており、その大部分は剛剛到着した。今後の調達は「基本的にNVIDIA」とのことである。华为がDeepSeekに提供した950の生産能力は約1万6千枚である。梁文鋒は、この国産カードはNVIDIA Bシリーズ約4000枚に相当し、現在のモデルのトレーニングに必要な分だけであると述べた。
これらの情報は、中国企業がすでに相当量のAI計算能力を保有している一方で、1回のトレーニングタスクで10万枚の同一世代の高性能GPUを集中して使用するという規模にはまだ差があることを示している。
中国のAI計算能力の本当の課題は、チップがないことではなく、先進的なクラスタリング能力の欠如である。
中国のAI計算能力について議論する際、二つの極端な立場に陥りやすい。
ある見方では、中国は先進的なAIチップが完全に欠如しているため、競争に参加できないとされる。一方で、別の見方では、国産チップの数が増加すれば、NVIDIAに急速に追いつけるとされる。
実際には、状況はより複雑です。
AIの訓練能力は、チップ性能、先進プロセス、ビデオメモリ容量、高速インターコネクト、サーバー設計、データセンターの電力供給、ソフトウェアエコシステム、および大規模スケジューリング能力といった複数の要素によって決まります。
GPUは最も核心的な部分の一つですが、すべてではありません。
NVIDIAが長年にわたり築いてきた優位性は、GPUハードウェアだけでなく、CUDAエコシステム、ネットワーク接続技術、サーバーソリューション、およびクラウドプロバイダーと構築した完全なエコシステムにも基づいている。
ブラックウェル時代には、このシステムの利点がさらに拡大されました。
10万枚のGPUを必要とするモデルのトレーニングが発生したとき、問題は数万枚のチップを購入することではなく、安定して動作する大規模な計算工場を構築することである。
これが、公開資料において中国の企業が10万枚の同世代先進GPUを用いて1回のモデル訓練を実施した事例をまだ明らかにしていない主な理由である。
中国企業は、海外の計算能力の展開拡大、国産チップの対応規模拡大、モデルアーキテクチャの最適化、トレーニング効率の向上など、さまざまな方法で能力を向上させています。これらの道筋にはすべて価値がありますが、短期的には、最先端のGPUクラスタがもたらす基盤的な能力優位性を完全に置き換えるのは難しいです。
過去数年間、中国のAI業界は、アルゴリズムの革新が一部の格差を大幅に縮小できることを証明した。
DeepSeekなどの企業の登場は、優れたエンジニアリングチームが、モデル構造の最適化、トレーニング戦略の調整、リソース利用効率の向上を通じて、限られた計算リソースの条件下でブレークスルーを達成できることを示している。
しかし、もう一つの事実も存在します:グローバルな競争が次世代のベースモデル段階に進むにつれ、計算能力の規模の重要性は依然として高まります。
効率の最適化はコストを削減できますが、最先端のハードウェアと超大規模クラスタがもたらす能力の限界を完全に変えるのは難しいです。
Blackwellの後、Rubin時代はインフラの格差をさらに広げる可能性がある
さらに注目すべきは、BlackwellがNVIDIAの現在の技術路線の最終形ではないということです。
NVIDIAの次世代Vera Rubinアーキテクチャは量産段階に入りました。NVIDIAの公表した推定によると、大規模MoEモデルのトレーニングにおいて、Rubinが必要とするGPUの数はBlackwellの約4分の1に削減されます。
これは、今後のAI競争に新たな循環が生まれることを意味します。
リーディング企業は最新のアーキテクチャを備えており、より少ないチップで大規模なトレーニングを実現できる。低いトレーニングコストにより、企業はより多くの実験を実施し、モデルの能力をさらに向上させることができる。
一方で、最新のハードウェアではなく前世代のハードウェアしか利用できない企業は、トレーニング効率が低くなるという問題に直面する可能性があります。また、最大規模のモデルへの参入も困難になります。
もちろん、これは中国のAI企業に機会がないことを意味するわけではありません。
AIの歴史は、技術競争が単一のハードウェアによって完全に決まらないことを繰り返し示してきました。モデルの革新、アプリケーションシーン、商業化能力、エンジニアリングの効率性が、新たなブレークスルーを生み出す可能性があります。
しかし、インフラの観点から見ると、GPT-6 Astraが10万枚のBlackwell GPUを使用するという出来事は、グローバルなAI競争の中心がモデル層からさらに計算インフラ層へと移行していることを示している。
今後数年間、AI企業の競争力を左右するのは、優れたモデルを訓練できるかどうかではなく、次世代モデルを継続的に訓練できる能力である。
中国AI産業にとって、真正に追いつくべきは、ある1つのモデルや1回のリリースではなく、チップの調達からデータセンターの構築、クラスタのスケジューリング、ソフトウェアエコシステムに至るまでの全体的なシステム能力である。
10万枚のBlackwellの意義は、それが驚異的な数字を生み出したことにあるのではなく、市場に提醒する点にある:人工知能は産業化段階に入り、産業競争の最終的な勝負はインフラにかかっているということを。
参照元:
- NVIDIAのBlackwell、GB200 NVL72、Vera RubinアーキテクチャおよびAIインフラストラクチャに関する公式情報。
- 黄仁勋公开演讲及媒体采访信息。
- BloombergによるKimiの算力調達およびH200に関する報道。
- バイトダンスが公開したAIインフラおよび海外の計算リソース展開情報。
- DeepSeekの公開情報および梁文鋒投資家交流会の関連トランスクリプト資料。
- 阿里雲によるAIインフラおよび大規模モデルの計算能力に関する公開情報。
