AI 基礎設施有一個不為人知的秘密:世界上一些最昂貴的硬體,有驚人多的時間處於完全閒置狀態。作為現代 AI 訓練和推論主力的 GPU,經常因等待儲存系統傳輸資料而閒置。DDN 與 Nvidia 現正合作解決此問題,讓 GPU 能直接啟動資料存取,無需中介。
該合作以 DDN 的 Infinia 數據智能平台為核心,該平台與 Nvidia 的 Storage-Next 計劃整合,以實現 GPU 啟動的數據操作。用英文來說:GPU 不再需要禮貌地等待 CPU 提取和傳遞數據,現在可以自行存取所需數據。
這項技術實際上是做什麼的
結果是延遲降低、CPU 開銷最小化,以及 GPU 利用率顯著提升。對於運行大規模 AI 工廠的組織而言,數千張 GPU 協同運作,即使利用率的微小提升也能帶來顯著的成本節省。
DDN 的首席技術官 Sven Oehme 以經濟角度闡述了此項合作,指出「大規模 AI 的經濟效益」有所提升。Nvidia 儲存技術副總裁 Jason Hardy 強調,計算與資料基礎設施之間的無縫整合是關鍵優勢。
這項技術符合英偉達 2026 年整體平台策略,包括英偉達 Rubin 平台和 BlueField-4 DPUs。
一個歷時十年的合作夥伴關係
自2016年起,DDN 與 Nvidia 便開始合作,當時 DDN 成為首家使其平台通過 Nvidia GPUDirect Storage 技術認證的儲存供應商。
GPUDirect Storage 允許資料直接在儲存裝置與 GPU 記憶體之間傳輸,無需經過系統記憶體中轉。此次與 Infinia 的新合作進一步延伸此概念,使 GPU 能主動發起這些資料傳輸,而非被動接收。
DDN 計劃在 Flash Memory Summit 上展示這些功能,預計將分享性能基準和運營可用性的詳細資訊。
這對 AI 基礎設施市場為何重要
隨著模型規模增大和訓練資料集擴展,運算能力與資料傳輸之間的差距日益擴大。大型 AI 訓練作業可能涉及分散在多個儲存系統中的 PB 級資料。每次資料存取的微秒級延遲,都會在數千個 GPU 和數百萬次訓練迭代中累積放大。
DDN 與 Nvidia 不僅僅是讓儲存變得更快,而是重新思考了資料在系統中的流動方式。讓 GPU 直接掌控資料操作,代表了 AI 基礎架構運作方式的根本性轉變。
