NVIDIA a relancé le projet de GPU d'accélération de pré-remplissage pour l'inférence AI, appelé « Rubin CPX », avec une production prévue pour le premier trimestre 2027. Ce produit est conçu pour les scénarios de pré-remplissage à long contexte, doté de 168 Go de mémoire HBM4 et d'une puissance de calcul proche de celle du GPU Rubin standard, avec une consommation électrique de 2300 watts par carte. Il utilise une conception de rack MGX ETL indépendante, permettant un déploiement flexible de 64 à 256 GPU. L'architecture de connexion adopte une conception hiérarchique : NVLink à l'intérieur d'un seul plateau et Ethernet entre plateaux, équilibrant performance et coût. Rubin CPX sera utilisé en complément des GPU Rubin standard, en partenariat 1:1, où CPX gère le pré-remplissage et la génération du KV Cache, tandis que le GPU Rubin se charge du décodage, optimisé spécifiquement pour les scénarios d'inférence à long contexte.Auteur et source de l'article : Wall Street Journal
NVIDIA a discrètement relancé un projet de puce que le marché croyait avoir abandonné, ciblant directement la phase de préremplissage (Prefill), où les coûts d'inférence IA sont élevés.
NVIDIA a relancé le projet de GPU d'accélération de pré-remplissage pour l'inférence AI « Rubin CPX » et a effectué d'importantes modifications de conception. Selon le plan actuel, la nouvelle version de Rubin CPX devrait entrer en production au premier trimestre 2027.
Le redémarrage de ce projet envoie un signal clair : NVIDIA renforce ses efforts pour résoudre les goulets d'étranglement en performance et en coût lors de la phase de pré-remplissage de l'inférence IA. À mesure que la longueur du contexte des grands modèles continue d'augmenter, la phase de pré-remplissage doit traiter une grande quantité d'informations d'entrée et générer un KV Cache, dont l'efficacité influence directement le coût global de l'inférence IA et sa rentabilité de déploiement.
Guo Mingchi affirme que plus de 50 % de la charge de travail d'inférence AI provient du traitement du contexte d'entrée et de la construction du KV Cache.
Spécifications du puce fortement ajustées, puissance de calcul proche du Rubin standard
En termes de puissance de calcul et de consommation d'énergie, les performances de la nouvelle version CPX approchent celles du GPU Rubin standard, avec une consommation maximale par carte atteignant 2 300 watts. En ce qui concerne la mémoire, la nouvelle version CPX utilise désormais 168 Go de HBM4, une amélioration nette par rapport aux 128 Go de GDDR7 de la version précédente, mais reste inférieure aux 288 Go de HBM4 du GPU Rubin standard.
Selon Guo Mingqi, la capacité totale HBM4 du plateau de calcul 8-CPU CPX s'élève à environ 1,34 To, suffisant pour couvrir la plupart des charges de travail de pré-remplissage à long contexte et leurs besoins correspondants en cache KV. Cela signifie que le Rubin CPX ne vise pas uniquement une puissance de calcul générale plus élevée, mais a été redessiné pour optimiser la capacité de mémoire vidéo et l'efficacité du pré-remplissage dans les scénarios à long contexte.
Passer d’un rack partagé à un déploiement indépendant, avec une configuration plus flexible
The rack architecture is also a key focus of this adjustment.
Dans la version précédente, CPX prévoyait de partager un rack avec Rubin GPU ; la nouvelle version utilise désormais un rack MGX ETL dédié, permettant aux clients d'augmenter la puissance de calcul de CPX selon leurs besoins réels.
Plus précisément, les clients peuvent choisir une configuration de déploiement de 64, 128, 192 ou 256 GPU CPX. Chaque module de rack comprend 64 GPU CPX, composé de 8 plateaux de calcul, chacun équipés de 8 GPU CPX, ainsi qu’un plateau d’interconnexion.
La conception modulaire permet aux clients d'augmenter flexiblement la puissance de calcul CPX en fonction des besoins réels en charge pré-remplie, sans avoir à acheter des racks Rubin à grande échelle fixes.
Conception interconnectée en couches, réduisant les coûts de déploiement de pré-remplissage
Sur l'architecture interconnectée, Rubin CPX adopte une conception en couches, équilibrant performance et coût.
À l'intérieur d'un seul plateau de calcul, 8 GPU CPX sont étendus en scale-up via NVLink. La bande passante NVLink de chaque GPU CPX est de 1 à 1,5 To/s, inférieure aux 3,6 To/s des GPU Rubin standards.
Au niveau du scale-out entre les plateaux et à l'intérieur des modules de rack, CPX utilise des liens L1 Ethernet entièrement cuivre Spectrum-6 ; pour les connexions entre modules de rack, les commutateurs Spectrum-6 de chaque module établissent l'interconnexion via des liens fibre OSFP.
Comme alternative aux solutions entièrement basées sur une interconnexion GPU à haut débit, cette architecture hiérarchique met l'accent sur l'optimisation des coûts pour les scénarios de pré-remplissage.
Collaborez avec Rubin GPU pour cibler l'inférence à long contexte
Rubin CPX n'est pas un GPU généraliste autonome, mais est conçu pour être utilisé en tant qu'accélérateur de pré-remplissage avec le Vera Rubin NVL72.
Selon Guo Mingqi, NVIDIA recommande de déployer les CPX et les GPU Rubin dans un rapport 1:1 : les CPX gèrent le calcul de la phase de pré-remplissage et génèrent le KV Cache, qui est ensuite transmis aux GPU Rubin via RDMA Ethernet pour le décodage ultérieur.
Du point de vue de la position produit, le cœur de Rubin CPX n'est pas de remplacer le GPU Rubin standard, mais de décomposer davantage le processus d'inférence AI pour permettre à différents GPU de prendre en charge respectivement le pré-remplissage et le décodage.
Guo Mingqi le positionne comme « la solution offrant le meilleur rapport qualité-prix pour le pré-remplissage à long contexte ». À mesure que les fenêtres de contexte des modèles d'IA s'élargissent, la charge de calcul et la taille du KV Cache à la phase de pré-remplissage ne cessent d'augmenter ; le redémarrage par NVIDIA du projet CPX vise probablement à réduire davantage les coûts de l'inférence à long contexte grâce à des matériel dédié et un déploiement hétérogène.
