C'est incroyable.
Juste maintenant, NVIDIA a publié pour la première fois les données de tests intégrés de son prochain rack phare, Vera Rubin NVL72.
Et, ce test en direct a directement attiré DeepSeek -V4-Pro, exécutez la tâche la plus réelle d'« encodage d'agent » !
Les résultats sont surprenants : par rapport au serveur dominant actuel GB300 NVL72, le débit par mégawatt de Vera Rubin a augmenté jusqu'à 30 fois, et le coût par token a chuté jusqu'à 35 fois !

Quelqu'un s'écrie : « Je n'oserais même pas écrire un PPT pour tromper des investisseurs ! »
Un internaute a commenté : « Avant, on trouvait les H200 à 30 000 dollars trop chers, mais en regardant en arrière, on se rend compte que les H200 ne sont même plus la version basique. »

Analysons cela en détail.
De H200 à GB300, le débit des charges de travail Agent réelles a augmenté jusqu'à 30 fois, avec un coût environ doublé.
De GB300 à Vera Rubin, le débit a à nouveau augmenté jusqu'à 30 fois, et le prix de l'ensemble du rack a presque doublé.
Selon la loi de Moore de l'ancien Huang, les deux dernières années n'ont pas vu la plus grande avancée technologique d'NVIDIA dans le GPU lui-même, mais dans le fait d'augmenter le prix de quatre fois tout en gagnant une accélération de 900 fois !

Cette fois, NVIDIA annonce à tous une vérité contre-intuitive : l'ère des LLM est terminée, l'ère des agents est arrivée, et tous les anciens benchmarks d'IA sont obsolètes !

Dans le même temps, le processeur Vera, conçu spécifiquement pour les agents, a été installé en urgence par SpaceXAI de Musk, et est même prêt à être envoyé dans l'espace.
Aujourd'hui même, le Groq 3 LPX de NVIDIA entre également en production de masse.
Gemma 4 31B s'exécute dessus, la vitesse est tout simplement incroyable, atteignant directement 3 400 tokens par seconde. Débit du modèle de mille milliards de paramètres, en hausse de 35 fois.


Ces nouveaux records réécrivent dès cette nuit le paysage commercial de l'écosystème Agent !
Pourquoi NVIDIA doit-elle lancer Vera Rubin ?
Les dernières données d'OpenRouter apportent la réponse : dans le monde réel, une tâche d'Agent AI consomme 15 fois plus de tokens qu'une conversation de chat classique !
Par exemple, si un agent est chargé d'étudier une entreprise pour prendre une décision d'investissement, l'agent et les sous-agents effectuent constamment des raisonnements, et les tokens accumulés deviennent les entrées pour la prochaine étape ; le traitement de contextes longs devient alors le facteur le plus critique limitant l'IA de l'agent.

Plus le nombre d'interactions entre agents augmente, plus le débit est élevé — le nombre d'agents a augmenté de dix fois, les appels d'outils ont doublé, et le conflit entre puissance de calcul et algorithmes a généré de nouvelles exigences.

Ne faites pas de la discussion un agent, les anciens benchmarks sont tous annulés !
À ce moment-là, les tests d'évaluation traditionnels de l'IA (comme les tests de séquences de longueur fixe de 8K/1K) deviennent complètement inutiles.
NVIDIA officiellement : les mesures de performance doivent évoluer ! Il ne faut plus mesurer uniquement les demandes d'inférence, mais capturer l'ensemble du flux de travail de l'Agent.
À cet effet, ils ont utilisé le benchmark AgentX de SemiAnalysis.
Ce test n'est plus un questionnaire rigide, mais une reconstitution d'une « session de programmation » réelle, avec une croissance contextuelle, des appels d'outils et la génération de sous-agents.

C'est pourquoi le H200 semble à la traîne sur le nouveau champ de bataille des agents, et Vera Rubin est destinée à régner.
Vera Rubin NVL72 × DeepSeek-V4-Pro :
La machine de calcul arrive
Pour démontrer la puissance de Vera Rubin NVL72, NVIDIA utilise directement le roi de l'open source — DeepSeek Test en puce effectué sur le V4-Pro (1.6T).
Les données publiées ont donné des résultats étonnants —
Sous la charge de travail AgentX, le débit par mégawatt de Vera Rubin NVL72 a augmenté jusqu’à 30 fois par rapport au GB300 NVL72 !

Veuillez noter que la comparaison n'est pas effectuée avec l'ancien H200, mais avec le très populaire GB300.
GB300 au même DeepSeek En test V4-Pro, le débit par mégawatt a déjà augmenté de 15 fois par rapport à H200.
Cependant, Vera Rubin a encore augmenté de 30 fois sur les épaules de GB300, poussant encore plus haut la courbe de Pareto !
What does this mean?
For AI factories constrained by power supply, this directly expands the boundaries of physical laws.
Avec le même budget énergétique, Vera Rubin peut accomplir 30 fois plus de travail d'agent.
Pour des centres de données de plusieurs mégawatts voire gigawatts, cela équivaut à créer de toutes pièces 30 fois plus d'actifs de calcul.
De plus, la technologie NVIDIA DSX MaxLPS permet une gestion de l'alimentation au niveau des GPU, des baies et des charges de travail, permettant d'installer jusqu'à 40 % de GPU supplémentaires dans le même budget en mégawatts, augmentant ainsi encore la débit par mégawatt des usines d'IA !

Le coût des jetons chute de 35 fois ! Le « livre de comptes » de l'industrie des agents est entièrement réécrit
Par mégawatt de débit, le coût direct de génération de chaque token est affecté. L'explosion des performances entraîne comme conséquence la plus directe une explosion du modèle économique.
NVIDIA annonce que la production de Vera Rubin NVL72 réduit jusqu'à 35 fois le coût par million de tokens par rapport au GB300 NVL72 !

Lorsque le coût de l'inférence chute de 35 fois, des employés numériques opérant 24 heures sur 24 deviendront une réalité, et les super-applications grand public connaîtront une explosion.
Cette lame de Lao Huang a directement ouvert la porte à l'ère des applications Agent.

Conception ultra-collaborative : comment Huang a-t-il fait cela ?
Vous vous demandez peut-être : pourquoi une accélération de 30 fois ? Est-ce grâce au procédé de puce unique ?
Évidemment pas.
Vera Rubin NVL72 achieve remarkable performance gains through "extreme co-design".

Par exemple, les services séparés, le cache distribué KV, le routage sensible au KV, MegaMoE, etc.

De plus, NVFP4 compresse directement les poids du modèle à une précision de 4 bits, réduisant considérablement l'utilisation de la mémoire sans compromettre la qualité de la sortie, ce qui fait exploser le débit.
Et le NVLink de sixième génération avec les grands modèles MoE offre un réseau interconnecté 10 fois plus rapide et avec une latence trois fois plus faible que les réseaux Ethernet standards, permettant à des DeepSeek Ce grand modèle basé sur l'architecture MoE peut appeler de manière fluide différents sous-réseaux « experts » sur 72 GPU.
Il ne s'agit plus de vendre des cartes graphiques ; Old Huang vend un ensemble complet de « centrales électriques AI ».

NVIDIA Groq 3 LPX en production de masse complète :
3400 jetons/seconde, le code Agent change la donne !
Lors de cette conférence Hot Chips 2026, NVIDIA a également annoncé une nouvelle surprenante : la production à grande échelle du Groq 3 LPX a commencé !

Groq 3 LPX, une extension exclusive de la plateforme de centre de données Vera Rubin NVL72.
Il est spécialement conçu pour ce système, avec un accent sur l'accélération de l'inférence à faible latence.
Cette technologie de pointe a été acquise par NVIDIA en décembre dernier pour 20 milliards de dollars américains auprès de la startup Groq.

Les agents IA rencontrent des retards de décodage ; pour résoudre ce point douloureux, Groq 3 LPX sépare intelligemment le traitement du contexte volumineux de la génération de tokens.
La solution d'NVIDIA consiste à faire traiter les contextes à grande échelle par le GPU Rubin, et à déléguer la tâche de génération ultra-rapide de tokens au Groq 3 LPX.
L’un gère la lecture, l’autre gère l’écriture, chacun se concentre sur ce qu’il fait le mieux.

Dans un déploiement complet à l'échelle du rack, jusqu'à 256 accélérateurs LP30 peuvent travailler en synergie avec des GPU via une interconnexion à bande passante ultra-élevée pour constituer un moteur d'inférence à l'échelle entreprise.

Ainsi, Groq 3 LPX atteint directement une vitesse de sortie record.
Lors des tests de référence d'Artificial Analysis, Groq 3 LPX a exécuté Gemma 4 31B avec une fenêtre de contexte ultra-longue de 100 000 tokens, atteignant une vitesse de sortie impressionnante de 3 400 tokens/seconde !
Cela permet une réponse jusqu'à 4 fois plus rapide que les concurrents pour les charges de travail extrêmement sensibles à la latence.

Les tâches d'agents multi-étapes qui prenaient plusieurs heures auparavant peuvent désormais être accomplies en quelques minutes !

Groq 3 LPX réduit le temps de génération de 5000 tokens de 50 secondes à 1,5 seconde, soit un facteur de 34.

De plus, dans les tâches de codage, Groq 3 LPX atteint une vitesse de sortie maximale de 6981 tokens/s.

Huang Renxun a déclaré que l'avancement de la génération de jetons ultra-rapides via LPX a permis une « autre avancée majeure » en termes de débit et de réactivité de l'IA.

Nebius a déployé ce processeur dans Nebius Token Factory pour offrir une expérience extrême avec des réponses instantanées à chaque étape du cycle d'agent.

Suivi de près par Groq lui-même.

Premier CPU dédié aux agents lancé,
Elon Musk a « monté dans l'espace » toute la nuit !
La mesure la plus ambitieuse de cette annonce officielle est Vera CPU.
Pour l'Agent, NVIDIA a spécialement conçu un processeur.
Cette CPU, Vera, est spécialement conçue pour nourrir les agents intelligents,
Il est équipé de 88 cœurs Olympus développés en interne, d'une mémoire LPDDR5X à haut débit, avec une bande passante atteignant directement 1,2 To/s.

Pourquoi un nouveau CPU est-il nécessaire à l'ère des grands modèles ?
Sur place à Hot Chips, un cadre d'NVIDIA Vera CPU a déclaré : « L'IA agente est la tâche de calcul la plus complexe de l'histoire ».

Une tâche, mais derrière l'agent, des centaines d'étapes s'exécutent : appeler des outils, exécuter du code Python, parcourir le contexte, traiter d'énormes volumes de données...
Ces tâches de planification de livraison sont entièrement supportées par le CPU. C’est pourquoi NVIDIA doit concevoir un CPU dédié pour l’Agent.
C'est précisément en raison de cela que SpaceXAI de Musk a annoncé en urgence le déploiement à grande échelle du CPU NVIDIA Vera !
Début mai, NVIDIA a discrètement envoyé les premiers échantillons Vera à A Corp, OpenAI et SpaceX AI pour un premier test.
Seulement trois mois plus tard, SpaceXAI est impatient de le passer en déploiement complet.
Ce qui est encore plus fou, c’est que SpaceXAI construit une usine de calcul de puissance gigawatt sur la plateforme Vera Rubin pour alimenter Grok.
En plus de cela, cette puissance de calcul sera directement envoyée dans l'espace.
Musk a déclaré : « Deux entreprises de premier plan ont collaboré pour concevoir une version optimisée de Vera Rubin NVL72, qui sera déployée à grande échelle en 2028. »

La première génération de satellite AI « Starmind » de SpaceXAI prévoit d'utiliser le système rack-level Vera Rubin NVL72.

D'un seul GPU à une usine entière d'agents
Le même jour, les deux puces Vera CPU et Groq 3 LPX entrent en production de masse.
This is significant for NVIDIA.

À l'ère des grands modèles, NVIDIA a dominé l'entraînement et l'inférence grâce à ses GPU.
À l'ère des agents, son domaine s'est étendu au CPU, aux accélérateurs d'inférence, à NVLink, etc.
Ce que Vieux Huang vend ne se limite plus à une seule GPU.
Ce qu'il vend, c'est une usine d'IA capable de produire continuellement des tokens.
Cette fois-ci, Old Huang va refondre les bases de toute l'ère des « Agents ».
Références :
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI
