Nvidia évalue un changement important des spécifications de son prochain GPU Rubin Ultra, pouvant livrer le processeur avec bien moins de mémoire à haute bande passante que ce que l'entreprise avait initialement ciblé. Ce ajustement, rapporté par TrendForce début août 2026, est une réponse directe à la réduction de l'offre de HBM provenant des trois principaux producteurs : SK Hynix, Samsung et Micron.
La vision originale de Rubin Ultra était ambitieuse. Lorsque Nvidia a dévoilé pour la première fois ce processeur lors de sa conférence GTC pour développeurs en 2025, les configurations envisagées incluaient jusqu’à 1 To de mémoire HBM4E. La GPU Vera Rubin actuelle, déjà en production de masse, est livrée avec jusqu’à 288 Go de mémoire HBM4 en empilements 12-Hi, offrant environ 22 To/s de bande passante mémoire. Rubin Ultra devait dépasser largement ces performances.
Actuellement, Nvidia teste au moins trois variantes avec une mémoire significativement réduite. Une configuration en cours d'examen utilise des piles HBM4 8-Hi offrant environ 192 Go de mémoire. Comparé aux 288 Go de la version actuelle Vera Rubin, cela représente une réduction de 33 % de la mémoire intégrée sur une puce censée marquer un saut générationnel.
Pourquoi la mémoire est essentielle pour les charges de travail IA
La mémoire à haut débit ne concerne pas seulement la capacité. La partie « débit » fait référence à la vitesse à laquelle les données se déplacent entre la mémoire et les cœurs de traitement du processeur. À 22 To/s, la Vera Rubin actuelle fonctionne déjà à des vitesses qui dépassent de plusieurs ordres de grandeur la mémoire serveur classique.
Le passage de piles 12-Hi à des piles 8-Hi réduit à la fois la capacité et, potentiellement, la bande passante. Nvidia testerait des variantes pour s'assurer que les performances maximales sont préservées malgré la réduction de mémoire, mais la physique des piles de mémoire réduites impose des limites réelles sur ce que les optimisations techniques peuvent récupérer.
Le rapport du 4 août de TrendForce indique que Nvidia évalue quatre configurations distinctes de HBM pour Rubin Ultra, le passage à une configuration autre que 12-Hi HBM4E étant motivé par des pénuries anticipées de DRAM et de HBM qui devraient s'aggraver jusqu'en 2027. Les défis de rendement et de production chez les trois principaux fournisseurs de HBM ont créé un goulot d'étranglement dans l'allocation de wafers que Nvidia ne peut pas résoudre unilatéralement.
Le coût caché de faire plus avec moins
Si Rubin Ultra est livré avec moins de mémoire par GPU, les entreprises exécutant des modèles d'IA très volumineux devront probablement utiliser plus de GPUs pour gérer les mêmes charges de travail. Un modèle qui tient sur quatre GPUs à haute mémoire pourrait nécessiter six ou huit GPUs à mémoire plus faible, ce qui entraîne des coûts supplémentaires : plus de consommation d'énergie, plus d'espace en rack, plus d'infrastructure d'interconnexion et plus de frais de licence.
Il existe également une nuance dans la vision des revenus de Nvidia. Le HBM4E, la mémoire à spécifications supérieures initialement prévue pour Rubin Ultra, génère des marges plus élevées tout au long de la chaîne d'approvisionnement. Un basculement vers des configurations HBM de niveau inférieur affecte la demande pour les produits mémoire les plus rentables, ce qui influence à son tour la priorisation des plans de production de SK Hynix, Samsung et Micron.
L'offre de HBM est déjà suffisamment limitée pour que les décisions d'allocation des fabricants de mémoire aient un poids géopolitique et concurrentiel réel. Nvidia est l'acheteur dominant, mais il concourt pour la capacité de wafers contre AMD, Google et une liste croissante de programmes de puces AI sur mesure provenant d'hyperscalers comme Amazon, Microsoft et Meta.
Ce que cela signifie pour le marché des puces IA
Les HBM de pointe nécessitent un empilement extrêmement précis des puces DRAM, et les taux de rendement pour les configurations 12-Hi sont inférieurs à ceux des empilements 8-Hi plus simples, créant des goulets d'étranglement de production qui ne peuvent pas être résolus rapidement.
Les fournisseurs de mémoire, quant à eux, doivent effectuer leurs propres calculs stratégiques. La pénurie étroite de HBM jusqu'en 2027 maintient les prix à un niveau élevé et la demande forte, mais les clients contraints d'acheter davantage de GPU pour compenser les réductions de mémoire créent une pression pour fermer éventuellement le déficit d'approvisionnement. L'entreprise qui parviendra en premier à une pile de 12-Hi ou 16-Hi avec un rendement supérieur aura un effet de levier significatif lors des prochaines négociations de conception de GPU.
