AIインフラの隠された真実:世界で最も高価なハードウェアの一部は、驚くほど長い時間、まったく何もせずに待機しています。現代のAIトレーニングと推論の中心であるGPUは、ストレージシステムからデータが到着するのを待つ間に頻繁にアイドル状態になります。DDNとNvidiaは、GPUがストレージからのデータアクセスを直接開始できるようにすることで、中間者を排除し、この問題を解決するために協力しています。
このパートナーシップは、DDNのInfiniaデータインテリジェンスプラットフォームを核とし、NvidiaのStorage-Nextイニシアチブと統合することで、GPUがデータ操作を開始できるようにします。英語版:GPUがCPUにデータを取得・配信してもらうのを静かに待つのではなく、GPUが自ら必要なデータを取得できるようになります。
その技術が実際に何をするのか
結果として、遅延が削減され、CPUオーバーヘッドが最小限に抑えられ、GPUの利用効率が大幅に向上します。数千台のGPUが連動して動作する大規模なAIファクトリーを運営する組織にとって、利用効率のわずかな改善でも、顕著なコスト削減につながります。
DDNのCTOであるスベン・オエメは、この協業を経済的な観点から説明し、「スケールにおけるAIの経済性」の向上を指摘しました。Nvidiaのストレージ技術担当バイスプレジデントであるジェイソン・ハーディは、コンピューティングとデータインフラストラクチャ間のシームレスな統合を主要な利点として強調しました。
この技術は、Nvidia RubinプラットフォームとBlueField-4 DPUsを含むNvidiaの2026年全体のプラットフォーム戦略に適合します。
10年にわたる提携
DDNは2016年からNvidiaと協力しており、そのときDDNはNvidiaのGPUDirect Storage技術と認証された最初のストレージベンダーとなりました。
GPUDirect Storageは、システムメモリを経由せずにストレージとGPUメモリの間でデータを直接移動できるようにしていました。今回のInfiniaとの新規コラボレーションでは、GPUが受動的にデータを受け取るのではなく、積極的にそのデータ転送を開始できるようになります。
DDNは、Flash Memory Summitでこれらの機能をデモンストレーションする予定であり、同社はパフォーマンスベンチマークと運用可用性に関する詳細を共有すると見られています。
これがAIインフラ市場にとって重要な理由
モデルがより大型化し、トレーニングデータセットが拡大するにつれて、計算能力とデータ提供の間のギャップは広がっています。大規模なAIトレーニングでは、分散ストレージシステムにまたがるペタバイト単位のデータが関与します。データアクセスの1マイクロ秒の遅延も、数千のGPUと数百万のトレーニングイテレーションにわたって累積します。
DDNとNVIDIAは、単にストレージを速くするのではなく、データがシステム全体をどのように流れているかを再考しています。GPUにデータ操作に対する直接的な制御権を与えることは、AIインフラの動作方式における根本的な変化を意味します。
