とても凄い。
先ほど、NVIDIAは史上初として、次世代フラッグシップラック「Vera Rubin NVL72」のオンチップ実測データを発表しました。
また、今回の実測では直接引き寄せられました DeepSeek -V4-Proで、最も本物の「エージェントコーディング」タスクを実行!
驚異的な結果:現在の主力機種GB300 NVL72と比較すると、Vera Rubinのメガワットあたりのスループットは最大30倍に向上し、トークンコストは最大35倍低下しました!

誰かが叫んだ、「私は投資家をだますためのPPTさえ、こんな風に書けない!」
またネットユーザーの神コメント:「以前はH200が1枚3万ドルと高すぎると思っていたが、今振り返ると、H200はエントリーモデルにも満たないようだ。」

让我们来仔细盘一盘。
H200からGB300まで、リアルなAgentワークロードのスループットが最大30倍向上し、コストは約2倍になりました。
GB300からVera Rubinまで、スループットが最大30倍に増加し、ラック全体の価格はほぼ2倍に跳ね上がりました。
老黄のモールの法則によると、この2年間でNVIDIAの最大の技術的進歩はGPUそのものではなく、価格を4倍にした代わりに、速度を900倍に向上させたことだ!

今回は、NVIDIAが誰もが反直感的だと感じる真実を発表しました。LLM時代は終わり、エージェント時代が到来し、これまでのAIベンチマークはすべて無効になりました!

一方、エージェント専用のVera CPUは、マスクのSpaceXAIによって夜間にもかかわらず設置され、宇宙へ直接搭載される準備が進められている。
今日、NVIDIA Groq 3 LPXも本格的な量産を開始しました。
Gemma 4 31Bが上にて動作し、速度は圧倒的で、毎秒3400トークンを達成。兆パラメータモデルのスループットが35倍に急増。


これらの新記録により、エージェントエコシステムのビジネス構図は、今夜から書き換えられます!
なぜNVIDIAはVera Rubinをリリースしなければならないのか?
OpenRouterの最新データが答えを示しています:現実世界では、エージェントAIタスクに消費されるトークン数は、通常のチャット会話の15倍です!
たとえば、エージェントが投資判断のために企業を調査する場合、エージェントとサブエージェントは継続的に推論を重ね、蓄積されたトークンが次の入力となります。この際、長文コンテキストの処理がエージェントAIの最大の制約要因となります。

エージェント間の相互作用回数が増えるほどスループットが大きくなる——エージェント数が10倍に増加し、ツール呼び出しが2倍に増加したことで、計算リソースとアルゴリズムの矛盾が新たな需要を生み出した。

チャットをエージェントとみなすな、旧基準はすべて廃止!
このとき、従来のAIベンチマーク(8K/1Kシーケンスなどの固定長テスト)は完全に無効になる。
NVIDIA公式が明言:性能測定は進化しなければならない!単一の推論リクエストを測定するだけでは不十分であり、完全なAgentワークフローを捉える必要がある。
そのため、彼らはSemiAnalysisのAgentXベンチマークを使用しました。
このテストは、固定された質問と回答ではなく、文脈の成長、ツールの呼び出し、サブエージェントの生成を含む実際の「コード作成セッション」の再生です。

これが、H200が新しいAgentの戦場で力不足である理由であり、ベラ・ルービンが王となる必然性である。
Vera Rubin NVL72 × DeepSeek-V4-Pro:
計算力の怪物が登場
Vera Rubin NVL72の力を証明するために、NVIDIAはオープンソースの王者—— DeepSeek -V4-Pro(1.6T)でオンチップ実測を実施。
データが公開され、結果は驚異的だった——
AgentXワークロード下で、Vera Rubin NVL72のメガワットあたりのスループットは、GB300 NVL72と比較して最大30倍向上しました!

ここで比較しているのは古いH200ではなく、注目の主力GB300です。
GB300は同じく DeepSeek V4-Proのテスト中、1メガワットのスループットはH200と比較して15倍向上しました。
しかしベラ・ルービンはGB300の肩の上にさらに30倍高く立ち、パレート曲線全体をさらに引き上げた!
これは何を意味しますか?
電力供給に制約される「AI工場」にとって、これは物理法則の境界を直接的に拡張する。
同じ電力予算で、Vera Rubinは30倍のエージェント作業をこなせます。
メガワット級、さらにはギガワット級のデータセンターにとって、これはまるで算力資産が30倍に増えたかのようである。
さらに、NVIDIA DSX MaxLPS技術により、GPU、ラック、ワークロードレベルで電力管理が可能になり、同じメガワット予算内で最大40%多くのGPUを構成でき、AIファクトリーのメガワットあたりのスループットがさらに向上します!

トークンコストが35倍に急落!エージェント業界の「帳簿」が完全に書き換えられる
1メガワットのスループットあたり、生成されるトークンのコストに直接影響します。パフォーマンスの急上昇は、ビジネスモデルに核爆発的な影響をもたらします。
NVIDIAは、Vera Rubin NVL72が100万トークンあたりのコストを、GB300 NVL72と比較して最大35倍削減したと発表しました。

推論コストが35倍急落したとき、24時間365日稼働するデジタル従業員が現実となり、ToC向けスーパーアプリが大爆発を遂げる。
老黄这一刀,直接切开了Agent应用的时代大门。

究極の協同設計:老黄はどのように実現したのか?
あなたは疑問に思うかもしれません:なぜ30倍速くなるのでしょうか?単一チップのプロセスによるものでしょうか?
明らかに違います。
Vera Rubin NVL72の驚異的なパフォーマンス向上は、「極限の協調設計」によるものです。

例えば、分離型サービス、分散型KVキャッシュ、KV認識ルーティング、MegaMoEなど。

また、NVFP4 クアンタイズは、モデルの重みを直接4ビット精度に圧縮し、出力品質を犠牲にすることなくメモリ使用量を大幅に削減し、スループットを飛躍的に向上させます。
そして、第6世代NVLinkと大規模MoEモデルは、既存のイーサネットよりも10倍高速で、遅延が3分の1のネットワークを提供し、 DeepSeek MoEアーキテクチャに基づくこの大規模モデルは、72個のGPU間で異なる「エキスパート」サブネットワークをスムーズに呼び出します。
これはもはやGPUを売っているのではなく、黄氏が提供しているのは一式の「AI発電所」である。

NVIDIA Groq 3 LPX の全面量産開始:
秒間3400トークン、コードAgentが大変化!
Hot Chips 2026 で、NVIDIAはもう一つの衝撃的な発表を行った:Groq 3 LPX の量産が本格開始!

Groq 3 LPXは、Vera Rubin NVL72データセンタープラットフォームの専用拡張です。
これはこのシステム向けに「オーダーメイド」で開発され、低遅延推論加速を主な特徴としています。
このブラックテクノロジーは、昨年12月に NVIDIA がスタートアップ企業 Groq から200億ドルを投じて購入したものである。

AIエージェントはデコード遅延の問題に直面しますが、Groq LPXは、大規模なコンテキスト処理とトークン生成を完全に分離することで、この課題を解決します。
NVIDIAの解決策は、Rubin GPUに大規模なコンテキスト処理を任せ、極めて高速なToken生成タスクをGroq 3 LPXに委ねることである。
一方が「読み」を担当し、もう一方が「書き」を担当し、それぞれが最も得意なことを行う。

完全なラックレベルのデプロイでは、最大256個のLP30アクセラレーターが超高帯域幅インターフェースを介してGPUと連携し、エンタープライズ規模の推論エンジンを構築します。

これにより、Groq 3 LPXは記録的な出力速度を直接達成しました。
Artificial Analysisのベンチマークで、Groq 3 LPXは10万トークンの超長コンテキストウィンドウでGemma 4 31Bを実行し、出力速度が驚異の3,400トークン/秒に達しました!
これにより、遅延に非常に敏感なワークロードで、競合製品と比較して応答速度が4倍速くなりました。

数時間かかっていた複数ステップのエージェントタスクが、今では数分で完了できます!

Groq 3 LPXは5000トークンの生成にかかる時間が50秒から1.5秒に短縮され、34倍の差があります。

また、コーディングタスクでは、Groq 3 LPXの最大出力速度は6981 token/sです。

黄仁勲は、LPXを通じて超高速トークン生成を推進することで、AIのスループットと応答性において「また一つ大きな飛躍」を実現したと明言した。

NebiusはNebius Token Factoryにこのチップをデプロイし、エージェントのループの各ステップで即時応答の極致体験を実現しました。

その直後に、Groq自身も続きます。

初のエージェント専用CPUが発表されました、
マスクが夜中に「宇宙へ打ち上げ」!
今回の公式発表の中で、最も野心的な一手はVera CPUである。
エージェントのために、NVIDIAは専用のCPUを設計した。
VeraというCPUは、エージェントを十分に満たすために专门に設計されています。
88個の自社開発されたOlympusコア、高帯域幅のLPDDR5Xメモリを搭載し、帯域幅は最大1.2TB/sに達します。

大規模モデル時代には、新しいCPUが必要な理由は?
ホットチップス現場で、NVIDIAのVera CPU担当役員は、「Agentic AIは史上最も複雑な計算タスクである」と明言した。

一度のタスクで、エージェントは数百のステップを実行する必要があります:ツールを呼び出し、Pythonコードを実行し、コンテキストを参照し、膨大なデータを処理します。
これらの配達スケジューリングのタスクはすべてCPUが直接処理している。そのため、NVIDIAはAgent用に専用のCPUを新たに開発しなければならない。
この点に注目し、マスクのSpaceXAIは连夜、NVIDIA Vera CPUの本格的な規模展開を発表しました!
今年5月、NVIDIAは最初のVeraサンプルをA社、OpenAI、SpaceXAIに静かに送り、先に試用させた。
わずか3か月後、SpaceXAIは全面展開に迫不及待となった。
さらに驚異的なのは、SpaceXAIがVera Rubinプラットフォームに基づいて、Grokを駆動するためのギガワット級のコンピューティングファクトリーを構築していることです。
さらに、この計算能力は直接宇宙に送られる予定です。
マスクは、「両社が協力して、2028年に大規模に展開されるよう最適化されたVera Rubin NVL72を設計した」と述べた。

SpaceXAIの第1世代「Starmind」AI人工衛星は、Vera Rubin NVL72ラック級システムを採用する予定です。

1枚のGPUから、全体のAgent工場へ
同じ日、2つのチップであるVera CPUとGroq 3 LPXが本格量産を開始しました。
これはナビダに大きな意味を持ちます。

大規模モデルの時代において、NVIDIAはGPUでトレーニングと推論を制覇した。
エージェント時代には、その領域はCPU、推論アクセラレーター、NVLinkなどにまで拡大しています。
老黄が売っているのは、もはやGPU一枚だけではない。
彼が売ろうとしているのは、継続的にトークンを生産できるAI工場である。
老黄这一次,是要为整个「Agent时代」重新铺设地基。
参考資料:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
本文は微信公衆アカウント「新智元」より、著者:ASI启示録
