NvidiaがAIデータセンター内のトラフィック渋滞に対応するために開発したのは、Spectrum-X Ethernetです。これは、ハードウェア加速型アダプティブルーティング、ターゲット渋滞制御、およびNICベースのプレーン負荷分散を組み合わせたネットワーキングアーキテクチャで、大規模なGPUネットワークにわたってデータを効率的に移動させます。
主張されるパフォーマンスの向上は有意義です。Nvidiaによると、Spectrum-Xは従来のEthernetソリューションと比較して最大1.6倍のネットワークスループットを提供します。ジョブ完了メトリクスは設定によって1.3倍から1.6倍改善します。
フェイルオーバー速度では、数値が際立っています。従来のイーサネットベースのシステムは、ネットワークプレーンが障害発生時に約1.08秒で復旧しますが、Spectrum-Xはこれを約2.68ミリ秒に短縮し、99%以上削減しています。NVIDIAはまた、Spectrum-Xが8プレーン構成で1つのプレーンがダウンしても約90%の帯域幅持続性を維持することを実証しました。
スケールインと第五の柱
2026年8月のHot Chipsカンファレンスで、Nvidiaは「Scale-In」と呼ぶ機能を導入し、これをAIネットワーキングの第5の柱と位置づけました。Scale-Inは、BlueField-4データ処理ユニットとDOCAソフトウェアを用いて、南北トラフィックを処理し、セキュリティ、ストレージ、可観測性のワークロードを担うことにより、ホストCPUのプロセッササイクルを解放します。
NvidiaがHot Chipsで明らかにしたマルチプレーントポロジーは、2段階構成で512,000以上のエンドポイントまでスケール可能であり、百万GPUクラスのクラスタへの道筋を示しています。このような超大規模展開に対するシリコンフォトニクスのサポートは、2026年後半を目標としています。プレーン間のパフォーマンス隔離は、ハードウェアレベルで実施される基本的な設計原則です。
仕様書を超えて、これがなぜ重要なのか
ベラ・ルービンは、大規模GPUクラスタにおける電力効率と耐障害性を重視したNvidiaのプラットフォームであり、チップ、ネットワーキング、ソフトウェア、ファブリックにわたるNvidiaのフルスタック戦略の中心に位置しています。
競合環境には、NvidiaがMellanoxの買収を通じて販売しているInfiniBandが含まれており、これは従来、ハイパフォーマンスコンピューティングのネットワーキングを支配してきました。Spectrum-Xは、AI市場がイーサネットベースのファブリックに標準化するとNvidiaが予測したものです。Arista NetworksやBroadcomなどの競合他社は、AIワークロードをターゲットにした機能を備えた高速イーサネットスイッチング市場で競争していますが、GPUからNIC、DPU、ファブリック管理ソフトウェアに至るまで垂直統合されたスタックを販売している企業は存在しません。
