NVIDIA relance le projet Rubin CPX AI inference prefill accelerator pour un lancement en 2027

iconMetaEra
Partager
AI summary iconRésumé
NVIDIA a fait une annonce de projet, relançant son accélérateur d'inférence AI Rubin CPX pour un lancement en 2027. Dérivé de MetaEra, le Rubin CPX est conçu pour les étapes de pré-remplissage à long contexte, intégrant 168 Go de HBM4, des performances proches de celles de Rubin et une consommation de 2300 W. Il sera livré au Q1 2027 selon une conception modulaire de rack MGX ETL, supportant de 64 à 256 GPU. Le système utilise NVLink à l'intérieur des plateaux et Ethernet entre les plateaux, équilibrant coût et vitesse. Le Rubin CPX s'associera en correspondance 1:1 avec les GPU Rubin standards, gérant le pré-remplissage et le cache KV, tandis que les autres gèrent le décodage. Cette mise à jour s'inscrit dans les actualités AI + crypto, illustrant l'accent mis par NVIDIA sur les infrastructures AI spécialisées.
NVIDIA a relancé le projet de GPU d'accélération de pré-remplissage pour l'inférence AI, appelé « Rubin CPX », avec une production prévue pour le premier trimestre 2027. Ce produit est conçu pour les scénarios de pré-remplissage à long contexte, doté de 168 Go de mémoire HBM4 et d'une puissance de calcul proche de celle du GPU Rubin standard, avec une consommation électrique de 2300 watts par carte. Il utilise une conception de rack MGX ETL indépendante, permettant un déploiement flexible de 64 à 256 GPU. L'architecture de connexion adopte une conception hiérarchique : NVLink à l'intérieur d'un seul plateau et Ethernet entre plateaux, équilibrant performance et coût. Rubin CPX sera utilisé en complément des GPU Rubin standard, en partenariat 1:1, où CPX gère le pré-remplissage et la génération du KV Cache, tandis que le GPU Rubin se charge du décodage, optimisé spécifiquement pour les scénarios d'inférence à long contexte.

Auteur et source de l'article : Wall Street Journal

NVIDIA a discrètement relancé un projet de puce que le marché croyait avoir abandonné, ciblant directement la phase de préremplissage (Prefill), où les coûts d'inférence IA sont élevés.

NVIDIA a relancé le projet de GPU d'accélération de pré-remplissage pour l'inférence AI « Rubin CPX » et a effectué d'importantes modifications de conception. Selon le plan actuel, la nouvelle version de Rubin CPX devrait entrer en production au premier trimestre 2027.

Le redémarrage de ce projet envoie un signal clair : NVIDIA renforce ses efforts pour résoudre les goulets d'étranglement en performance et en coût lors de la phase de pré-remplissage de l'inférence IA. À mesure que la longueur du contexte des grands modèles continue d'augmenter, la phase de pré-remplissage doit traiter une grande quantité d'informations d'entrée et générer un KV Cache, dont l'efficacité influence directement le coût global de l'inférence IA et sa rentabilité de déploiement.

Guo Mingchi affirme que plus de 50 % de la charge de travail d'inférence AI provient du traitement du contexte d'entrée et de la construction du KV Cache.

Spécifications du puce fortement ajustées, puissance de calcul proche du Rubin standard

En termes de puissance de calcul et de consommation d'énergie, les performances de la nouvelle version CPX approchent celles du GPU Rubin standard, avec une consommation maximale par carte atteignant 2 300 watts. En ce qui concerne la mémoire, la nouvelle version CPX utilise désormais 168 Go de HBM4, une amélioration nette par rapport aux 128 Go de GDDR7 de la version précédente, mais reste inférieure aux 288 Go de HBM4 du GPU Rubin standard.

Selon Guo Mingqi, la capacité totale HBM4 du plateau de calcul 8-CPU CPX s'élève à environ 1,34 To, suffisant pour couvrir la plupart des charges de travail de pré-remplissage à long contexte et leurs besoins correspondants en cache KV. Cela signifie que le Rubin CPX ne vise pas uniquement une puissance de calcul générale plus élevée, mais a été redessiné pour optimiser la capacité de mémoire vidéo et l'efficacité du pré-remplissage dans les scénarios à long contexte.

Passer d’un rack partagé à un déploiement indépendant, avec une configuration plus flexible

The rack architecture is also a key focus of this adjustment.

Dans la version précédente, CPX prévoyait de partager un rack avec Rubin GPU ; la nouvelle version utilise désormais un rack MGX ETL dédié, permettant aux clients d'augmenter la puissance de calcul de CPX selon leurs besoins réels.

Plus précisément, les clients peuvent choisir une configuration de déploiement de 64, 128, 192 ou 256 GPU CPX. Chaque module de rack comprend 64 GPU CPX, composé de 8 plateaux de calcul, chacun équipés de 8 GPU CPX, ainsi qu’un plateau d’interconnexion.

La conception modulaire permet aux clients d'augmenter flexiblement la puissance de calcul CPX en fonction des besoins réels en charge pré-remplie, sans avoir à acheter des racks Rubin à grande échelle fixes.

Conception interconnectée en couches, réduisant les coûts de déploiement de pré-remplissage

Sur l'architecture interconnectée, Rubin CPX adopte une conception en couches, équilibrant performance et coût.

À l'intérieur d'un seul plateau de calcul, 8 GPU CPX sont étendus en scale-up via NVLink. La bande passante NVLink de chaque GPU CPX est de 1 à 1,5 To/s, inférieure aux 3,6 To/s des GPU Rubin standards.

Au niveau du scale-out entre les plateaux et à l'intérieur des modules de rack, CPX utilise des liens L1 Ethernet entièrement cuivre Spectrum-6 ; pour les connexions entre modules de rack, les commutateurs Spectrum-6 de chaque module établissent l'interconnexion via des liens fibre OSFP.

Comme alternative aux solutions entièrement basées sur une interconnexion GPU à haut débit, cette architecture hiérarchique met l'accent sur l'optimisation des coûts pour les scénarios de pré-remplissage.

Collaborez avec Rubin GPU pour cibler l'inférence à long contexte

Rubin CPX n'est pas un GPU généraliste autonome, mais est conçu pour être utilisé en tant qu'accélérateur de pré-remplissage avec le Vera Rubin NVL72.

Selon Guo Mingqi, NVIDIA recommande de déployer les CPX et les GPU Rubin dans un rapport 1:1 : les CPX gèrent le calcul de la phase de pré-remplissage et génèrent le KV Cache, qui est ensuite transmis aux GPU Rubin via RDMA Ethernet pour le décodage ultérieur.

Du point de vue de la position produit, le cœur de Rubin CPX n'est pas de remplacer le GPU Rubin standard, mais de décomposer davantage le processus d'inférence AI pour permettre à différents GPU de prendre en charge respectivement le pré-remplissage et le décodage.

Guo Mingqi le positionne comme « la solution offrant le meilleur rapport qualité-prix pour le pré-remplissage à long contexte ». À mesure que les fenêtres de contexte des modèles d'IA s'élargissent, la charge de calcul et la taille du KV Cache à la phase de pré-remplissage ne cessent d'augmenter ; le redémarrage par NVIDIA du projet CPX vise probablement à réduire davantage les coûts de l'inférence à long contexte grâce à des matériel dédié et un déploiement hétérogène.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.