NVIDIA、2027年リリース向けにRubin CPX AI推論プリフィルアクセラレータープロジェクトを再開

iconMetaEra
共有
AI summary icon概要
NVIDIAは、2027年リリースを予定するRubin CPX AI推論プリフィルアクセラレーターのプロジェクトを発表し、再開しました。MetaEraを基に開発されたRubin CPXは、長コンテキストのプリフィル段階に最適化されており、168GBのHBM4、ほぼRubin同等のパフォーマンス、および2300Wの電力消費を搭載しています。この製品は、2027年第1四半期にモジュラー式MGX ETLラック設計で出荷され、64〜256個のGPUをサポートします。システムはトレイ内にNVLink、トレイ間にはイーサネットを使用し、コストと速度のバランスを実現しています。Rubin CPXは標準的なRubin GPUと1対1でペアリングされ、プリフィルとKVキャッシュを処理し、他のGPUはデコードを担当します。この更新はAI+暗号通貨ニュースに該当し、NVIDIAが専用AIインフラに注力していることを示しています。
NVIDIAは、AI推論のプレフィルリング加速GPUプロジェクト「Rubin CPX」を再開し、2027年第1四半期からの生産を計画しています。この製品は長コンテキストプレフィルリングシナリオ向けに設計され、168GBのHBM4メモリを搭載し、標準的なRubin GPUに近い計算性能を実現し、単一カードの消費電力は2300ワットに達します。製品は独立したMGX ETLラック設計を採用し、64枚から256枚のGPUを柔軟に展開できます。インターコネクトアーキテクチャは階層構造を採用し、同一トレイ内ではNVLink、トレイ間ではイーサネットを使用し、性能とコストのバランスを実現しています。Rubin CPXは標準的なRubin GPUと1:1の比率で協調して動作し、CPXがプレフィルリングとKVキャッシュ生成を担当し、Rubin GPUがデコードを担当することで、長コンテキスト推論シナリオに最適化されています。

記事執筆者、出典:华尔街见聞

NVIDIAは、市場で既に放棄されたと見なされていたチッププロジェクトを静かに再開し、AI推論のコストが高いプリフィル(Prefill)プロセスに焦点を当てている。

NVIDIAはAI推論のプリフィルリング加速GPUプロジェクト「Rubin CPX」を再開し、製品設計を大幅に見直しました。現在の計画によると、新バージョンのRubin CPXは2027年第1四半期に生産を開始する予定です。

今回のプロジェクトの再開は、NVIDIAがAI推論段階のプレフィルリング性能とコストのボトルネック解決に力を入れていることを明確に示している。大規模モデルのコンテキスト長が継続的に増加する中で、プレフィルリング段階では大量の入力情報を処理しKVキャッシュを生成する必要があり、その効率はAI推論全体のコストと導入の経済性に直接影響を与える。

郭明錤は、現在のAI推論ワークロードの50%以上が入力コンテキスト処理とKVキャッシュの構築から来ていると述べている。

チップ仕様が大幅に調整され、算力は標準Rubinに近づきました

算力と消費電力において、新バージョンのCPXは標準Rubin GPUに近い性能を達成し、単一カードの最大消費電力も2300ワットに達します。メモリ面では、新バージョンのCPXは従来の128GB GDDR7から168GB HBM4に変更され、大幅にアップグレードされていますが、標準Rubin GPUの288GB HBM4には及んでいません。

郭明錤によると、8枚のCPX計算トレイのHBM4容量は合計で約1.34TBに達し、ほとんどの長コンテキストプリフィルリングワークロードおよび対応するKVキャッシュの要件をカバーできる。これは、Rubin CPXが単に汎用計算能力の向上を追求するのではなく、長コンテキストシナリオに向けたメモリ容量とプリフィルリング効率を再設計したことを意味する。

共有ラックから独立デプロイへ移行し、設定がより柔軟に

ラックアーキテクチャも今回の調整の重点です。

以前の計画では、CPXはRubin GPUと共有ラックを使用する予定でしたが、新バージョンでは独立したMGX ETLラックを採用し、顧客が実際のニーズに応じてCPXの算力を個別に拡張できるようにしました。

具体的には、顧客は64枚、128枚、192枚、または256枚のCPX GPUを搭載したデプロイ規模を選択できます。64枚のCPX GPUは1つのラックモジュールを構成し、8つの計算トレイを含み、各トレイには8枚のCPX GPUが搭載され、同時に1つのスイッチトレイが備えられます。

モジュール設計により、顧客は固定の大規模Rubinラックを購入する必要なく、事前充填負荷の実際の要件に応じてCPX計算能力を柔軟に追加できます。

階層的相互接続設計により、プリフェッチデプロイコストを削減

相互接続アーキテクチャ上で、Rubin CPXは層構造を採用し、パフォーマンスとコストの間でトレードオフを行っています。

単一の計算トレイ内で、8枚のCPX GPUがNVLinkによってスケールアップ拡張されます。各CPX GPUのNVLink帯域幅は1〜1.5TB/sで、標準的なRubin GPUの3.6TB/sよりも低いです。

トレイ間およびラックモジュール内では、CPXはSpectrum-6イーサネット全銅L1リンクを採用し、ラックモジュール間の接続には、各モジュールのSpectrum-6スイッチを介してOSFP光リンクを用いて接続します。

完全に高帯域GPU間接続に依存するソリューションと比較して、この階層アーキテクチャはプリフィルリングシナリオに焦点を当てたコスト最適化を重視しています。

Rubin GPUと連携し、長文推論をターゲットに

Rubin CPXは独立して動作する汎用GPUではなく、Vera Rubin NVL72と組み合わせてプリフィリングアクセラレーターとして使用されます。

郭明錤によると、NVIDIAはCPXとRubin GPUを1:1の比率で配置することを推奨しています。CPXがプレフィルリング段階の計算を担当しKVキャッシュを生成した後、Ethernet RDMAを介してKVキャッシュをRubin GPUに転送し、後続のデコードをRubin GPUが実行します。

製品の位置付けから見ると、Rubin CPXの核心は標準的なRubin GPUを置き換えることではなく、AI推論プロセスをさらに細分化し、異なるGPUがプリフィルリングとデコードのタスクをそれぞれ担うことです。

郭明錤將其定位為「長上下文預填充的最佳性價比方案」。隨著AI模型的上下文窗口不斷擴大,預填充階段的計算量和KV Cache規模持續增長,英偉達此次重啟CPX項目,或許正是試圖通過專用硬體和異構部署方式,進一步降低長上下文推理的成本。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。