NVIDIA 已重新啟動 AI 推理預填充加速 GPU 項目「Rubin CPX」,計劃於 2027 年第一季度開始生產。該產品專為長上下文預填充場景設計,配備 168GB HBM4 顯存,運算能力接近標準 Rubin GPU,單卡功耗高達 2300 瓦。產品採用獨立 MGX ETL 機架設計,支援 64 至 256 張 GPU 的靈活部署配置。互聯架構採用分層設計,單托盤內部使用 NVLink,托盤間採用以太網,在性能與成本間取得平衡。Rubin CPX 將作為預填充加速器與標準 Rubin GPU 配合使用,按 1:1 比例分工協作,CPX 負責預填充和 KV Cache 生成,Rubin GPU 負責解碼,專為長上下文推理場景優化。文章作者、來源:华尔街见闻
英偉達悄然重啟一項一度被市場認為已放棄的晶片項目,目標直指 AI 推理成本較高的預填充(Prefill)環節。
英偉達已重新啟動 AI 推理預填充加速 GPU 項目「Rubin CPX」,並對產品設計進行大幅調整。按照目前規劃,新版 Rubin CPX 預計於 2027 年第一季度開始生產。
此次項目重啟釋放出一個明確信號:英偉達正在加碼解決 AI 推理階段的預填充性能與成本瓶頸。隨著大模型上下文長度持續增加,預填充階段需要處理大量輸入資訊並生成 KV Cache,其效率直接影響 AI 推理的整體成本和部署經濟性。
郭明錤稱,目前超過 50% 的 AI 推理工作負載來自輸入上下文處理及 KV Cache 建構。
晶片規格大幅調整,算力接近標準 Rubin
在算力和功耗方面,新版 CPX 的性能已接近標準 Rubin GPU,單卡最高功耗同樣達到 2300 瓦。內存方面,新版 CPX 改用 168GB HBM4 顯存,較此前方案的 128GB GDDR7 明顯升級,但仍低於標準 Rubin GPU 的 288GB HBM4。
根據郭明錤的說法,8卡CPX計算托盤的HBM4容量合計約1.34TB,足以覆蓋大多數長上下文預填充工作負載及對應的KV Cache需求。這意味著,Rubin CPX並非單純追求更高的通用算力,而是針對長上下文場景對顯存容量和預填充效率進行了重新設計。
從共享機架轉向獨立部署,配置更加靈活
Rack architecture is also a key focus of this adjustment.
在先前的方案中,CPX 計劃與 Rubin GPU 共享機架;新版則改為採用獨立的 MGX ETL 機架,從而允許客戶根據實際需求單獨擴展 CPX 算力。
具體來看,客戶可選擇部署 64、128、192 或 256 張 CPX GPU。每 64 張 CPX GPU 構成一個機架模組,包含 8 個計算托盤,每個托盤搭載 8 張 CPX GPU,並配備一個交換機托盤。
模組化設計意味著客戶無需按固定的大規模 Rubin 機架進行採購,可根據預填充負載的實際需求靈活增加 CPX 算力。
分層互聯設計,降低預填充部署成本
在互聯架構上,Rubin CPX 採用分層設計,在性能與成本之間進行取捨。
在單個計算托盤內,8 張 CPX GPU 透過 NVLink 進行 Scale-up 擴展。每張 CPX GPU 的 NVLink 帶寬為 1 至 1.5 TB/s,低於標準 Rubin GPU 的 3.6 TB/s。
在托盤之間以及機架模組內部的 Scale-out 層面,CPX 採用 Spectrum-6 乙太網全銅 L1 鏈路;跨機架模組連接時,則通過各模組的 Spectrum-6 交換機,經 OSFP 光纖鏈路完成互聯。
Compared to solutions that rely entirely on high-bandwidth GPU interconnects, this hierarchical architecture places greater emphasis on cost optimization for pre-filling scenarios.
與 Rubin GPU 協同,瞄準長上下文推理
Rubin CPX 並非獨立運行的通用 GPU,而是作為預填充加速器與 Vera Rubin NVL72 配合使用。
根據郭明錤的說法,英偉達建議將 CPX 與 Rubin GPU 以 1:1 的比例部署:CPX 負責預填充階段的計算並生成 KV Cache,隨後透過以太網 RDMA 將 KV Cache 傳輸至 Rubin GPU,由後者完成後續解碼。
從產品定位來看,Rubin CPX 的核心並非取代標準 Rubin GPU,而是將 AI 推理流程進一步拆分,讓不同 GPU 分別承擔預填充和解碼任務。
郭明錤將其定位為「長上下文預填充的最佳性價比方案」。隨著 AI 模型上下文窗口不斷擴大,預填充階段的計算量和 KV Cache 規模持續增長,英偉達此次重啟 CPX 項目,或正是試圖通過專用硬體和異構部署方式,進一步降低長上下文推理的成本。
