NVIDIA 重啟 Rubin CPX AI 推理預填充加速器項目,預計於 2027 年推出

iconMetaEra
分享
AI summary icon精華摘要
NVIDIA 已發布項目公告,重啟其 Rubin CPX AI 推理預填充加速器,預計於 2027 年推出。該 Rubin CPX 源自 MetaEra,專為長上下文預填充階段設計,配備 168GB HBM4、接近 Rubin 的性能,以及 2300W 功耗。它將於 2027 年第一季採用模組化 MGX ETL 機架設計出貨,支援 64 至 256 顆 GPU。系統在機匣內使用 NVLink,機匣間使用乙太網路,在成本與速度之間取得平衡。Rubin CPX 將與標準 Rubin GPU 以 1:1 搭配,負責預填充與 KV Cache,其餘 GPU 則處理解碼。此更新屬於 AI + 加密貨幣新聞,展現 NVIDIA 對專用 AI 基礎設施的關注。
NVIDIA 已重新啟動 AI 推理預填充加速 GPU 項目「Rubin CPX」,計劃於 2027 年第一季度開始生產。該產品專為長上下文預填充場景設計,配備 168GB HBM4 顯存,運算能力接近標準 Rubin GPU,單卡功耗高達 2300 瓦。產品採用獨立 MGX ETL 機架設計,支援 64 至 256 張 GPU 的靈活部署配置。互聯架構採用分層設計,單托盤內部使用 NVLink,托盤間採用以太網,在性能與成本間取得平衡。Rubin CPX 將作為預填充加速器與標準 Rubin GPU 配合使用,按 1:1 比例分工協作,CPX 負責預填充和 KV Cache 生成,Rubin GPU 負責解碼,專為長上下文推理場景優化。

文章作者、來源:华尔街见闻

英偉達悄然重啟一項一度被市場認為已放棄的晶片項目,目標直指 AI 推理成本較高的預填充(Prefill)環節。

英偉達已重新啟動 AI 推理預填充加速 GPU 項目「Rubin CPX」,並對產品設計進行大幅調整。按照目前規劃,新版 Rubin CPX 預計於 2027 年第一季度開始生產。

此次項目重啟釋放出一個明確信號:英偉達正在加碼解決 AI 推理階段的預填充性能與成本瓶頸。隨著大模型上下文長度持續增加,預填充階段需要處理大量輸入資訊並生成 KV Cache,其效率直接影響 AI 推理的整體成本和部署經濟性。

郭明錤稱,目前超過 50% 的 AI 推理工作負載來自輸入上下文處理及 KV Cache 建構。

晶片規格大幅調整,算力接近標準 Rubin

在算力和功耗方面,新版 CPX 的性能已接近標準 Rubin GPU,單卡最高功耗同樣達到 2300 瓦。內存方面,新版 CPX 改用 168GB HBM4 顯存,較此前方案的 128GB GDDR7 明顯升級,但仍低於標準 Rubin GPU 的 288GB HBM4。

根據郭明錤的說法,8卡CPX計算托盤的HBM4容量合計約1.34TB,足以覆蓋大多數長上下文預填充工作負載及對應的KV Cache需求。這意味著,Rubin CPX並非單純追求更高的通用算力,而是針對長上下文場景對顯存容量和預填充效率進行了重新設計。

從共享機架轉向獨立部署,配置更加靈活

Rack architecture is also a key focus of this adjustment.

在先前的方案中,CPX 計劃與 Rubin GPU 共享機架;新版則改為採用獨立的 MGX ETL 機架,從而允許客戶根據實際需求單獨擴展 CPX 算力。

具體來看,客戶可選擇部署 64、128、192 或 256 張 CPX GPU。每 64 張 CPX GPU 構成一個機架模組,包含 8 個計算托盤,每個托盤搭載 8 張 CPX GPU,並配備一個交換機托盤。

模組化設計意味著客戶無需按固定的大規模 Rubin 機架進行採購,可根據預填充負載的實際需求靈活增加 CPX 算力。

分層互聯設計,降低預填充部署成本

在互聯架構上,Rubin CPX 採用分層設計,在性能與成本之間進行取捨。

在單個計算托盤內,8 張 CPX GPU 透過 NVLink 進行 Scale-up 擴展。每張 CPX GPU 的 NVLink 帶寬為 1 至 1.5 TB/s,低於標準 Rubin GPU 的 3.6 TB/s。

在托盤之間以及機架模組內部的 Scale-out 層面,CPX 採用 Spectrum-6 乙太網全銅 L1 鏈路;跨機架模組連接時,則通過各模組的 Spectrum-6 交換機,經 OSFP 光纖鏈路完成互聯。

Compared to solutions that rely entirely on high-bandwidth GPU interconnects, this hierarchical architecture places greater emphasis on cost optimization for pre-filling scenarios.

與 Rubin GPU 協同,瞄準長上下文推理

Rubin CPX 並非獨立運行的通用 GPU,而是作為預填充加速器與 Vera Rubin NVL72 配合使用。

根據郭明錤的說法,英偉達建議將 CPX 與 Rubin GPU 以 1:1 的比例部署:CPX 負責預填充階段的計算並生成 KV Cache,隨後透過以太網 RDMA 將 KV Cache 傳輸至 Rubin GPU,由後者完成後續解碼。

從產品定位來看,Rubin CPX 的核心並非取代標準 Rubin GPU,而是將 AI 推理流程進一步拆分,讓不同 GPU 分別承擔預填充和解碼任務。

郭明錤將其定位為「長上下文預填充的最佳性價比方案」。隨著 AI 模型上下文窗口不斷擴大,預填充階段的計算量和 KV Cache 規模持續增長,英偉達此次重啟 CPX 項目,或正是試圖通過專用硬體和異構部署方式,進一步降低長上下文推理的成本。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露