NVIDIA、Vera Rubin NVL72を発表し、DeepSeekのスループットを30倍に向上

icon MarsBit
共有
AI summary icon概要
NVIDIAは、Vera Rubin NVL72のテスト結果をオンチェーンで発表し、DeepSeek-V4-Proのスループットが30倍向上しました。GB300 NVL72と比較してトークンコストは35倍低下しました。このプラットフォームにはVera CPUとGroq 3 LPXが含まれており、現在SpaceXAIが使用しています。パフォーマンスの向上から、より広範なAI導入が見込まれ、新たなトークン上場が続く可能性があります。

とても凄い。

先ほど、NVIDIAは史上初として、次世代フラッグシップラック「Vera Rubin NVL72」のオンチップ実測データを発表しました。

また、今回の実測では直接引き寄せられました DeepSeek -V4-Proで、最も本物の「エージェントコーディング」タスクを実行!

驚異的な結果:現在の主力機種GB300 NVL72と比較すると、Vera Rubinのメガワットあたりのスループットは最大30倍に向上し、トークンコストは最大35倍低下しました!

エージェント

誰かが叫んだ、「私は投資家をだますためのPPTさえ、こんな風に書けない!」

またネットユーザーの神コメント:「以前はH200が1枚3万ドルと高すぎると思っていたが、今振り返ると、H200はエントリーモデルにも満たないようだ。」

エージェント

让我们来仔细盘一盘。

H200からGB300まで、リアルなAgentワークロードのスループットが最大30倍向上し、コストは約2倍になりました。

GB300からVera Rubinまで、スループットが最大30倍に増加し、ラック全体の価格はほぼ2倍に跳ね上がりました。

老黄のモールの法則によると、この2年間でNVIDIAの最大の技術的進歩はGPUそのものではなく、価格を4倍にした代わりに、速度を900倍に向上させたことだ!

エージェント

今回は、NVIDIAが誰もが反直感的だと感じる真実を発表しました。LLM時代は終わり、エージェント時代が到来し、これまでのAIベンチマークはすべて無効になりました!

エージェント

一方、エージェント専用のVera CPUは、マスクのSpaceXAIによって夜間にもかかわらず設置され、宇宙へ直接搭載される準備が進められている。

今日、NVIDIA Groq 3 LPXも本格的な量産を開始しました。

Gemma 4 31Bが上にて動作し、速度は圧倒的で、毎秒3400トークンを達成。兆パラメータモデルのスループットが35倍に急増。

エージェント

エージェント

これらの新記録により、エージェントエコシステムのビジネス構図は、今夜から書き換えられます!

なぜNVIDIAはVera Rubinをリリースしなければならないのか?

OpenRouterの最新データが答えを示しています:現実世界では、エージェントAIタスクに消費されるトークン数は、通常のチャット会話の15倍です!

たとえば、エージェントが投資判断のために企業を調査する場合、エージェントとサブエージェントは継続的に推論を重ね、蓄積されたトークンが次の入力となります。この際、長文コンテキストの処理がエージェントAIの最大の制約要因となります。

エージェント

エージェント間の相互作用回数が増えるほどスループットが大きくなる——エージェント数が10倍に増加し、ツール呼び出しが2倍に増加したことで、計算リソースとアルゴリズムの矛盾が新たな需要を生み出した。

エージェント

チャットをエージェントとみなすな、旧基準はすべて廃止!

このとき、従来のAIベンチマーク(8K/1Kシーケンスなどの固定長テスト)は完全に無効になる。

NVIDIA公式が明言:性能測定は進化しなければならない!単一の推論リクエストを測定するだけでは不十分であり、完全なAgentワークフローを捉える必要がある。

そのため、彼らはSemiAnalysisのAgentXベンチマークを使用しました。

このテストは、固定された質問と回答ではなく、文脈の成長、ツールの呼び出し、サブエージェントの生成を含む実際の「コード作成セッション」の再生です。

エージェント

これが、H200が新しいAgentの戦場で力不足である理由であり、ベラ・ルービンが王となる必然性である。

Vera Rubin NVL72 × DeepSeek-V4-Pro:

計算力の怪物が登場

Vera Rubin NVL72の力を証明するために、NVIDIAはオープンソースの王者—— DeepSeek -V4-Pro(1.6T)でオンチップ実測を実施。

データが公開され、結果は驚異的だった——

AgentXワークロード下で、Vera Rubin NVL72のメガワットあたりのスループットは、GB300 NVL72と比較して最大30倍向上しました!

エージェント

ここで比較しているのは古いH200ではなく、注目の主力GB300です。

GB300は同じく DeepSeek V4-Proのテスト中、1メガワットのスループットはH200と比較して15倍向上しました。

しかしベラ・ルービンはGB300の肩の上にさらに30倍高く立ち、パレート曲線全体をさらに引き上げた!

これは何を意味しますか?

電力供給に制約される「AI工場」にとって、これは物理法則の境界を直接的に拡張する。

同じ電力予算で、Vera Rubinは30倍のエージェント作業をこなせます。

メガワット級、さらにはギガワット級のデータセンターにとって、これはまるで算力資産が30倍に増えたかのようである。

さらに、NVIDIA DSX MaxLPS技術により、GPU、ラック、ワークロードレベルで電力管理が可能になり、同じメガワット予算内で最大40%多くのGPUを構成でき、AIファクトリーのメガワットあたりのスループットがさらに向上します!

エージェント

トークンコストが35倍に急落!エージェント業界の「帳簿」が完全に書き換えられる

1メガワットのスループットあたり、生成されるトークンのコストに直接影響します。パフォーマンスの急上昇は、ビジネスモデルに核爆発的な影響をもたらします。

NVIDIAは、Vera Rubin NVL72が100万トークンあたりのコストを、GB300 NVL72と比較して最大35倍削減したと発表しました。

エージェント

推論コストが35倍急落したとき、24時間365日稼働するデジタル従業員が現実となり、ToC向けスーパーアプリが大爆発を遂げる。

老黄这一刀,直接切开了Agent应用的时代大门。

エージェント

究極の協同設計:老黄はどのように実現したのか?

あなたは疑問に思うかもしれません:なぜ30倍速くなるのでしょうか?単一チップのプロセスによるものでしょうか?

明らかに違います。

Vera Rubin NVL72の驚異的なパフォーマンス向上は、「極限の協調設計」によるものです。

エージェント

例えば、分離型サービス、分散型KVキャッシュ、KV認識ルーティング、MegaMoEなど。

エージェント

また、NVFP4 クアンタイズは、モデルの重みを直接4ビット精度に圧縮し、出力品質を犠牲にすることなくメモリ使用量を大幅に削減し、スループットを飛躍的に向上させます。

そして、第6世代NVLinkと大規模MoEモデルは、既存のイーサネットよりも10倍高速で、遅延が3分の1のネットワークを提供し、 DeepSeek MoEアーキテクチャに基づくこの大規模モデルは、72個のGPU間で異なる「エキスパート」サブネットワークをスムーズに呼び出します。

これはもはやGPUを売っているのではなく、黄氏が提供しているのは一式の「AI発電所」である。

エージェント

NVIDIA Groq 3 LPX の全面量産開始:

秒間3400トークン、コードAgentが大変化!

Hot Chips 2026 で、NVIDIAはもう一つの衝撃的な発表を行った:Groq 3 LPX の量産が本格開始!

エージェント

Groq 3 LPXは、Vera Rubin NVL72データセンタープラットフォームの専用拡張です。

これはこのシステム向けに「オーダーメイド」で開発され、低遅延推論加速を主な特徴としています。

このブラックテクノロジーは、昨年12月に NVIDIA がスタートアップ企業 Groq から200億ドルを投じて購入したものである。

エージェント

AIエージェントはデコード遅延の問題に直面しますが、Groq LPXは、大規模なコンテキスト処理とトークン生成を完全に分離することで、この課題を解決します。

NVIDIAの解決策は、Rubin GPUに大規模なコンテキスト処理を任せ、極めて高速なToken生成タスクをGroq 3 LPXに委ねることである。

一方が「読み」を担当し、もう一方が「書き」を担当し、それぞれが最も得意なことを行う。

エージェント

完全なラックレベルのデプロイでは、最大256個のLP30アクセラレーターが超高帯域幅インターフェースを介してGPUと連携し、エンタープライズ規模の推論エンジンを構築します。

エージェント

これにより、Groq 3 LPXは記録的な出力速度を直接達成しました。

Artificial Analysisのベンチマークで、Groq 3 LPXは10万トークンの超長コンテキストウィンドウでGemma 4 31Bを実行し、出力速度が驚異の3,400トークン/秒に達しました!

これにより、遅延に非常に敏感なワークロードで、競合製品と比較して応答速度が4倍速くなりました。

エージェント

数時間かかっていた複数ステップのエージェントタスクが、今では数分で完了できます!

エージェント

Groq 3 LPXは5000トークンの生成にかかる時間が50秒から1.5秒に短縮され、34倍の差があります。

エージェント

また、コーディングタスクでは、Groq 3 LPXの最大出力速度は6981 token/sです。

エージェント

黄仁勲は、LPXを通じて超高速トークン生成を推進することで、AIのスループットと応答性において「また一つ大きな飛躍」を実現したと明言した。

エージェント

NebiusはNebius Token Factoryにこのチップをデプロイし、エージェントのループの各ステップで即時応答の極致体験を実現しました。

エージェント

その直後に、Groq自身も続きます。

エージェント

初のエージェント専用CPUが発表されました、

マスクが夜中に「宇宙へ打ち上げ」!

今回の公式発表の中で、最も野心的な一手はVera CPUである。

エージェントのために、NVIDIAは専用のCPUを設計した。

VeraというCPUは、エージェントを十分に満たすために专门に設計されています。

88個の自社開発されたOlympusコア、高帯域幅のLPDDR5Xメモリを搭載し、帯域幅は最大1.2TB/sに達します。

エージェント

大規模モデル時代には、新しいCPUが必要な理由は?

ホットチップス現場で、NVIDIAのVera CPU担当役員は、「Agentic AIは史上最も複雑な計算タスクである」と明言した。

エージェント

一度のタスクで、エージェントは数百のステップを実行する必要があります:ツールを呼び出し、Pythonコードを実行し、コンテキストを参照し、膨大なデータを処理します。

これらの配達スケジューリングのタスクはすべてCPUが直接処理している。そのため、NVIDIAはAgent用に専用のCPUを新たに開発しなければならない。

この点に注目し、マスクのSpaceXAIは连夜、NVIDIA Vera CPUの本格的な規模展開を発表しました!

今年5月、NVIDIAは最初のVeraサンプルをA社、OpenAI、SpaceXAIに静かに送り、先に試用させた。

わずか3か月後、SpaceXAIは全面展開に迫不及待となった。

さらに驚異的なのは、SpaceXAIがVera Rubinプラットフォームに基づいて、Grokを駆動するためのギガワット級のコンピューティングファクトリーを構築していることです。

さらに、この計算能力は直接宇宙に送られる予定です。

マスクは、「両社が協力して、2028年に大規模に展開されるよう最適化されたVera Rubin NVL72を設計した」と述べた。

エージェント

SpaceXAIの第1世代「Starmind」AI人工衛星は、Vera Rubin NVL72ラック級システムを採用する予定です。

エージェント

1枚のGPUから、全体のAgent工場へ

同じ日、2つのチップであるVera CPUとGroq 3 LPXが本格量産を開始しました。

これはナビダに大きな意味を持ちます。

エージェント

大規模モデルの時代において、NVIDIAはGPUでトレーニングと推論を制覇した。

エージェント時代には、その領域はCPU、推論アクセラレーター、NVLinkなどにまで拡大しています。

老黄が売っているのは、もはやGPU一枚だけではない。

彼が売ろうとしているのは、継続的にトークンを生産できるAI工場である。

老黄这一次,是要为整个「Agent时代」重新铺设地基。

参考資料:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

本文は微信公衆アカウント「新智元」より、著者:ASI启示録

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。