太炸裂了。
就在剛剛,英偉達史上首次公布了下一代旗艦級機櫃 Vera Rubin NVL72 的首次片上實測數據。
而且,這次實測直接拉來了 DeepSeek -V4-Pro,執行最真實的「智能體編碼」任務!
結果令人吃驚:與當前的主力機皇 GB300 NVL72 相比,Vera Rubin 的每兆瓦吞吐量最高飙升了 30 倍、Token 成本最高暴降了 35 倍!

有人驚呼:「我連騙投資人的 PPT 都不敢這麼寫!」
還有網友神評:「以前嫌 H200 三萬美元一張貴,現在回頭一看,H200 居然連丐版都算不上了。」

讓我們來仔細盤一盤。
從 H200 到 GB300,真實 Agent 工作負載的吞吐量提升了最高 30 倍,成本大致翻倍。
從 GB300 到 Vera Rubin,吞吐量再次飙升最高 30 倍,整機架價格大致再翻倍。
根據老黃的摩爾定律,這兩年英偉達最大的技術突破並不是GPU本身,而是將價格提高了4倍,卻換來了整整900倍的速度提升!

這次,英偉達向所有人宣布了一個反直覺的真相:LLM 時代結束,Agent 時代降臨,以往的 AI 跑分基準,全部作廢!

同時,專為智能體打造的 Vera CPU 已被馬斯克的 SpaceXAI 昨夜安裝,甚至準備直接送上太空。
同在今天,NVIDIA Groq 3 LPX 也全面量產。
Gemma 4 31B 在上面運行,速度簡直絕了,直接達到每秒 3400 個 Token。萬億參數模型吞吐量,狂飆 35 倍。


These new records will rewrite the commercial landscape of the Agent ecosystem starting tonight!
為什麼英偉達必須推出 Vera Rubin?
OpenRouter 的最新數據給出了答案:在真實世界中,一個 Agent AI 任務消耗的 Token 數量,是普通聊天對話的 15 倍!
例如,若讓一個 Agent 為投資決策研究一家公司,在此過程中,智能體與子智能體會不斷推理,累積的 Token 將成為下一步的輸入,長上下文處理便成為限制智能體 AI 的關鍵要素。

智能體互動次數越多,吞吐量越大——智能體數量增加10倍,工具調用增加2倍,算力與算法的矛盾催生了新的需求。

Don't treat chat as an agent—the old benchmarks are completely obsolete!
At this point, traditional AI benchmarks (such as fixed-length 8K/1K sequence tests) become completely invalid.
NVIDIA 官方明確指出:性能測量必須進化!不能再僅測量單一的推理請求,必須捕捉完整的 Agent 工作流程。
為此,他們使用了 SemiAnalysis 旗下的 AgentX 基準測試。
這個測試不再是一成不變的問答,而是重播真實的、具有上下文增長、工具調用和子智能體生成的「代碼編寫會話」。

這就是為什麼 H200 在新的 Agent 戰場上顯得力不從心,Vera Rubin 必將稱王。
Vera Rubin NVL72 × DeepSeek-V4-Pro:
算力怪物來了
為證明 Vera Rubin NVL72 的實力,英偉達直接使用開源王者—— DeepSeek -V4-Pro (1.6T) 進行片上實測。
數據一出,結果驚人——
在 AgentX 工作負載下,Vera Rubin NVL72 的每兆瓦吞吐量,比 GB300 NVL72 最高提升了整整 30 倍!

請注意,這裡對比的不是舊款的 H200,而是熱門的主力 GB300。
GB300 在同樣的 DeepSeek 在 V4-Pro 測試中,每兆瓦吞吐量已比 H200 提升了 15 倍。
然而維拉·魯賓卻在 GB300 的肩膀上,再拔高了 30 倍,在整個帕累托曲線上進一步提升!
這意味著什麼?
For AI factories constrained by power supply, this directly expands the boundaries of physical laws.
在同樣的電力預算下,Vera Rubin 能完成 30 倍的智能體工作量。
對於兆瓦級甚至吉瓦級的數據中心來說,這相當於憑空變出了 30 倍的算力資產。
此外,NVIDIA DSX MaxLPS 技術可在 GPU、機架和工作負載層面進行電源管理,讓您在相同的兆瓦預算內多配置高達 40% 的 GPU,進一步提升 AI 工廠的每兆瓦吞吐量!

Token 成本暴降 35 倍!Agent 行業的「賬本」徹底重寫
每兆瓦的吞吐量,直接影響的是每個生成 token 的成本。性能的飙升,帶來的最直接後果就是商業模式的核爆。
英偉達宣布,Vera Rubin NVL72 生產每百萬 Token 的成本,比 GB300 NVL72 最高降低了 35 倍!

當推理成本驟降35倍時,24小時不間斷的數字員工將成為現實,ToC端超級應用將迎來大爆發。
Old Huang’s move has directly opened the door to the era of Agent applications.

Extreme Coordinated Design: How Did Huang Do It?
你可能會問:憑什麼能提速 30 倍?靠的是單顆晶片的工藝嗎?
Clearly not.
Vera Rubin NVL72 的驚人性能提升,靠的是「極致協同設計」。

例如分離式服務、分佈式 KV 緩存、KV 感知路由、MegaMoE 等等。

此外,NVFP4 量化直接將模型權重壓縮至 4 位精度,在不犧牲輸出質量的情況下,大幅縮減記憶體佔用,讓吞吐量原地飛升。
而第六代 NVLink 與大模型 MoE,提供了比現成以太網快 10 倍、延遲低 3 倍的互聯網絡,讓像 DeepSeek 這種基於 MoE 架構的大模型,可以在 72 個 GPU 之間行雲流水地調用不同的「專家」子網絡。
這早已不是在賣顯卡,老黃賣的是一整套「AI 發電廠」。

英偉達 Groq 3 LPX 全面量產:
3400 個代幣/秒,代碼 Agent 天翻地覆!
在本次 Hot Chips 2026 大會上,英偉達還拋出一個震撼消息:Groq 3 LPX 開始全面量產!

Groq 3 LPX 是 Vera Rubin NVL72 數據中心平台的專屬擴展。
它為此系統「量身定制」,主打低延遲推理加速。
這項黑科技,是去年12月英偉達豪擲200億美元從初創公司 Groq 手中買下的。

AI 智能體會遇到解碼延遲的問題,為了終結這一痛點,Groq 3 LPX 巧妙地將龐大的上下文處理與 Token 生成徹底分離。
NVIDIA 的解決方案是,讓 Rubin GPU 處理大規模上下文,並將極速生成 Token 的任務交給 Groq 3 LPX。
一個負責「讀」,一個負責「寫」,各自專注於自己最擅長的領域。

在一個完整的機架級部署中,最多可達 256 個 LP30 加速器可透過超高頻寬互連與 GPU 協同運作,構建出企業級規模的推理引擎。

As a result, Groq 3 LPX directly achieved a record-breaking output speed.
在 Artificial Analysis 的基準測試中,Groq 3 LPX 在 10 萬 Token 超長上下文視窗下運行 Gemma 4 31B,輸出速度達到驚人的 3,400 Token/秒!
This makes it four times faster in response than competitors for workloads with extremely low latency requirements.

過去幾個小時才能完成的多步智能體任務,現在幾分鐘內就能完成!

Groq 3 LPX 在生成 5000 Token 時,耗時從 50 秒降至 1.5 秒,差距達 34 倍。

而且在編碼任務中,Groq 3 LPX 的最大輸出速度為 6981 token/s。

黃仁勳直言,透過 LPX 推進超高速 Token 生成,在 AI 吞吐量和響應能力上實現了「又一次巨大飛躍」。

Nebius 已在 Nebius Token Factory 中部署該晶片,讓智能體迴圈的每一步都能獲得即時響應的極致體驗。

緊隨其後的,還有 Groq 自己。

首款 Agent 專屬 CPU 發布,
馬斯克連夜「打上太空」!
在這次官方宣佈中,最具野心的一步棋,就是 Vera CPU。
為了 Agent,英偉達專門製造了一顆 CPU。
Vera 這顆 CPU,就是專門餵飽智能體的,
它配備了 88 個自研的 Olympus 核心、高頻寬的 LPDDR5X 記憶體,頻寬直接達至 1.2 TB/s。

為什麼大模型時代需要全新的 CPU?
Hot Chips 現場,英偉達 Vera CPU 高管直言,「Agentic AI 是史上最複雜的計算任務」。

一次任務,Agent 後台需執行上百個步驟:調用工具、執行 Python 代碼、翻閱上下文、處理海量數據....
這些跑腿調度的任務,全都壓在 CPU 身上硬扛。因此,英偉達必須為 Agent 單獨造一顆 CPU。
正是看中了這一點,馬斯克的 SpaceXAI 連夜宣布,正式規模化部署英偉達 Vera CPU!
早在今年5月,英偉達就把第一批Vera樣片,悄悄送到了A社、OpenAI、SpaceX AI先「試水」。
僅僅3個月後,SpaceXAI 就迫不及待地將其轉入全面部署。
更瘋狂的是,SpaceXAI 正在基於 Vera Rubin 平台建設吉瓦級算力工廠,用來驅動 Grok。
不仅如此,這套算力還將被直接送入太空。
馬斯克表示,「兩家強強聯手,設計了一款優化版的 Vera Rubin NVL72,將在 2028 年大規模部署」。

SpaceXAI 的第一代「Starmind」AI 衛星,就計劃採用 Vera Rubin NVL72 機架級系統。

從一塊 GPU,到整座 Agent 工廠
On the same day, two major chips, Vera CPU and Groq 3 LPX, enter full-scale production.
This is significant for NVIDIA.

在大模型時代,英偉達憑藉 GPU 掌握了訓練與推理。
Agent 時代,它的版圖已經延伸到 CPU、推理加速器、NVLink 等等。
老黃賣的,早已不只是一塊 GPU。
他要出售的,是一座可以不斷生產 Token 的 AI 工廠。
老黃這次,是要為整個「Agent 時代」重新鋪一遍地基。
參考資料:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
本文來自微信公眾號「新智元」,作者:ASI啟示錄
