根據 SemiAnalysis 最新報告,Rubin Ultra 的 HBM 已降至 192GB,在對記憶體敏感的 Agentic 推理、長上下文、MoE 大模型場景下,192GB 會比 288GB 更受限制,意味著其實際有效效能在部分場景下將接近甚至低於 Vera Rubin 標準版。 升級版 Ultra Rubin 的效能甚至不如標準版 Vera Rubin,同一模型可能需要調用更多 GPU 才能完成部署,進而增加晶片間通訊、模型切分與資料搬移的開銷,降低單卡有效利用率,並推高單位 Token 的生成成本。換句話說,雖然 GPU 產量增加了,但如果每項任務需要使用更多 GPU,系統層面的算力成本未必會同步下降,升級版的邏輯也就說不通了。 是不是就不用推 Ultra 版了,2027 年下半年繼續賣 Vera Rubin 版,等 2028 年直接推出下一代 Feynman 架構得了?🤔

