Isso é incrível.
Apenas agora, a NVIDIA divulgou pela primeira vez os dados de teste em chip da próxima geração de gabinete de topo, Vera Rubin NVL72.
E, neste teste prático, trouxemos diretamente DeepSeek -V4-Pro, execute a tarefa mais realista de "codificação de agente"!
Os resultados são surpreendentes: em comparação com o atual líder de mercado, GB300 NVL72, o Vera Rubin aumentou em até 30 vezes o throughput por megawatt e reduziu em até 35 vezes o custo por token!

Alguém exclamou: “Eu nem ousaria escrever um PPT tão enganoso para investidores!”
Outro usuário comentou: "Antes, achava que o H200 a US$30.000 cada era caro, mas agora, olhando para trás, o H200 nem chega a ser a versão básica."

Vamos analisar com cuidado.
De H200 para GB300, o throughput de cargas de trabalho de Agent reais aumentou até 30 vezes, com custo aproximadamente dobrado.
De GB300 para Vera Rubin, o throughput aumentou novamente até 30 vezes, e o preço de todo o rack quase dobrou novamente.
De acordo com a lei de Moore do velho Huang, nos últimos dois anos, o maior avanço técnico da NVIDIA não foi o próprio GPU, mas sim aumentar o preço em quatro vezes e obter um salto de velocidade de 900 vezes!

Desta vez, NVIDIA anunciou a todos uma verdade contraintuitiva: a era dos LLM acabou, a era dos Agentes chegou, e todos os benchmarks anteriores de IA estão obsoletos!

Ao mesmo tempo, o Vera CPU, projetado especificamente para agentes, foi instalado pela SpaceXAI de Elon Musk durante a noite e já está sendo preparado para ser lançado ao espaço.
Hoje também, o NVIDIA Groq 3 LPX entrou em produção em massa.
Gemma 4 31B roda acima, a velocidade é simplesmente incrível, chegando diretamente a 3.400 tokens por segundo. Throughput de modelo de trilhões de parâmetros, acelerando 35 vezes.


Esses novos recordes reescrevem imediatamente o cenário comercial do ecossistema Agent, a partir desta noite!
Por que a NVIDIA precisa lançar a Vera Rubin?
Os dados mais recentes do OpenRouter fornecem a resposta: no mundo real, uma tarefa de Agent AI consome 15 vezes mais tokens do que uma conversa de chat normal!
Por exemplo, se um agente for encarregado de pesquisar uma empresa para tomar decisões de investimento, durante esse processo, o agente e os subagentes realizarão raciocínios contínuos, e os tokens acumulados se tornarão a entrada para a próxima etapa; o processamento de contextos longos torna-se o fator mais crítico que limita a IA do agente.

Quanto mais interações ocorrerem entre agentes, maior será o throughput — o número de agentes aumentou dez vezes, as chamadas de ferramentas aumentaram duas vezes, e o conflito entre poder de computação e algoritmos gerou novas demandas.

Não use o chat como um agente; todos os benchmarks antigos foram descartados!
Neste momento, os testes tradicionais de IA (como testes de sequência de comprimento fixo de 8K/1K) tornam-se completamente inválidos.
NVIDIA oficialmente esclarece: a medição de desempenho precisa evoluir! Não se pode mais medir apenas solicitações únicas de inferência, é preciso capturar fluxos de trabalho completos de Agentes.
Para isso, eles utilizaram o benchmark AgentX da SemiAnalysis.
Este teste não é mais um questionário rígido, mas sim uma reprodução de uma "sessão de programação" real, com crescimento contextual, chamadas de ferramentas e geração de subagentes.

É por isso que o H200 está em desvantagem no novo campo de batalha dos Agentes, e Vera Rubin está destinada a reinar.
Vera Rubin NVL72 × DeepSeek-V4-Pro:
O minador de poder de hash chegou
Para demonstrar a capacidade da Vera Rubin NVL72, a NVIDIA usou diretamente o rei do código aberto— DeepSeek Realização de testes em chip para o V4-Pro (1.6T).
Os dados foram divulgados e os resultados foram surpreendentes—
Sob a carga de trabalho do AgentX, o throughput por megawatt do Vera Rubin NVL72 aumentou até 30 vezes em comparação com o GB300 NVL72!

Observe que a comparação aqui não é com o antigo H200, mas sim com o popular e principal GB300.
GB300 no mesmo DeepSeek Na versão de teste V4-Pro, o throughput por megawatt já aumentou 15 vezes em relação ao H200.
No entanto, Vera Rubin elevou ainda mais 30 vezes sobre os ombros do GB300, elevando ainda mais toda a curva de Pareto!
What does this mean?
Para as "fábricas de IA" limitadas pelo fornecimento de energia, isso amplia diretamente os limites das leis físicas.
Com o mesmo orçamento de energia, a Vera Rubin pode realizar 30 vezes mais trabalho de agentes.
Para data centers de megawatt ou até gigawatt, isso equivale a criar, do nada, 30 vezes mais ativos de processamento.
Além disso, a tecnologia NVIDIA DSX MaxLPS permite gerenciamento de energia em nível de GPU, rack e carga de trabalho, permitindo configurar até 40% mais GPUs no mesmo orçamento de megawatts, aumentando ainda mais o rendimento por megawatt das fábricas de IA!

Custo do token cai 35 vezes! O "livro-razão" da indústria de agentes é totalmente reescrito
Por megawatt de throughput, o custo direto de geração de cada token é diretamente afetado. O aumento de desempenho traz como consequência mais direta uma explosão de modelo de negócios.
NVIDIA anunciou que a Vera Rubin NVL72 reduziu em até 35 vezes o custo por milhão de tokens em comparação com a GB300 NVL72!

Quando o custo de inferência cair drasticamente 35 vezes, funcionários digitais 24/7 se tornarão realidade, e os superaplicativos voltados ao consumidor experimentarão uma grande explosão.
O corte do Lao Huang abriu diretamente as portas da era das aplicações de Agent.

Projeto de colaboração extrema: Como o Huang fez isso?
Você pode se perguntar: por que é possível acelerar 30 vezes? É graças ao processo de um único chip?
Claramente não.
Vera Rubin NVL72 apresenta um aumento de desempenho impressionante graças ao "design colaborativo extremo".

Por exemplo, serviços separados, cache distribuído KV, roteamento consciente de KV, MegaMoE, etc.

Além disso, o NVFP4 comprime diretamente os pesos do modelo para precisão de 4 bits, reduzindo significativamente o uso de memória sem comprometer a qualidade da saída, fazendo com que o throughput dispare.
E o NVLink de sexta geração, juntamente com grandes modelos MoE, fornecem uma rede interconectada 10 vezes mais rápida e com três vezes menos latência do que a Ethernet pronta, permitindo que DeepSeek Este grande modelo baseado na arquitetura MoE pode chamar fluentemente diferentes subredes de «especialistas» entre 72 GPUs.
Há muito tempo não se trata mais de vender placas gráficas; o velho Huang está vendendo uma completa "usina de IA".

NVIDIA Groq 3 LPX em produção em massa completa:
3400 tokens/segundo, o agente de código mudou!
Nesta conferência Hot Chips 2026, a NVIDIA também anunciou uma notícia chocante: o Groq 3 LPX já começou a ser produzido em massa!

Groq 3 LPX, uma extensão exclusiva da plataforma de data center Vera Rubin NVL72.
É especificamente personalizado para este sistema, com foco principal em aceleração de inferência de baixa latência.
Essa tecnologia secreta foi comprada pela NVIDIA em dezembro do ano passado, por 20 bilhões de dólares, da startup Groq.

Agentes de IA podem enfrentar problemas de latência na decodificação. Para resolver esse ponto doloroso, o Groq 3 LPX separa elegantemente o processamento de contexto extenso da geração de tokens.
A solução da NVIDIA é fazer com que a GPU Rubin processe contextos de grande escala e atribuir a tarefa de geração extremamente rápida de tokens ao Groq 3 LPX.
Um cuida da leitura, o outro cuida da escrita, cada um faz o que melhor sabe fazer.

Em uma implantação completa em nível de rack, até 256 aceleradores LP30 podem trabalhar em conjunto com GPUs por meio de interconexões de banda larga ultra elevada, formando um motor de inferência em escala empresarial.

Assim, o Groq 3 LPX alcançou diretamente uma velocidade de saída recorde.
No teste de referência da Artificial Analysis, o Groq 3 LPX executou o Gemma 4 31B com uma janela de contexto ultra longa de 100.000 tokens, alcançando uma velocidade de saída impressionante de 3.400 tokens/segundo!
Isso torna sua resposta até 4 vezes mais rápida que a dos concorrentes em cargas de trabalho extremamente sensíveis à latência.

Tarefas de agentes multistep que levavam horas para serem concluídas agora podem ser concluídas em minutos!

O Groq 3 LPX reduziu o tempo necessário para gerar 5.000 tokens de 50 segundos para 1,5 segundos, uma diferença de 34 vezes.

E na tarefa de codificação, o Groq 3 LPX alcança uma velocidade máxima de saída de 6981 tokens/s.

Huang Renxun afirmou diretamente que, por meio do LPX, avançou na geração de tokens ultra-rápidos, alcançando "outra grande salto" na capacidade de throughput e resposta da IA.

Nebius já implantou o chip no Nebius Token Factory, proporcionando uma experiência extremamente instantânea em cada etapa do ciclo de agentes.

Seguido por Groq em si.

Lançado o primeiro CPU exclusivo para Agentes,
Musk foi direto para o espaço durante a noite!
O movimento mais ambicioso neste anúncio oficial é o Vera CPU.
Para o Agent, a NVIDIA criou especificamente um CPU.
Essa CPU Vera é especificamente projetada para alimentar agentes inteligentes,
Ele é equipado com 88 núcleos Olympus desenvolvidos internamente, memória LPDDR5X de alta largura de banda, com largura de banda diretamente atingindo 1,2 TB/s.

Por que uma nova CPU é necessária na era dos grandes modelos?
No Hot Chips, executivos da NVIDIA Vera CPU afirmaram diretamente: "Agentic AI é a tarefa de computação mais complexa da história".

Uma tarefa única exige que o Agente execute centenas de etapas: chamar ferramentas, executar código Python, navegar no contexto, processar grandes volumes de dados...
Essas tarefas de agendamento de entregas estão sendo totalmente suportadas pelo CPU. Por isso, a NVIDIA precisa criar um CPU dedicado para o Agente.
Justamente por reconhecer esse ponto, a SpaceXAI de Musk anunciou连夜 a implantação em escala da CPU NVIDIA Vera!
Já em maio deste ano, a NVIDIA enviou discretamente as primeiras amostras da Vera para a Empresa A, OpenAI e SpaceX AI para um "teste inicial".
Apenas três meses depois, a SpaceXAI não conseguiu esperar para transferi-la para implantação total.
Mais louco ainda: a SpaceXAI está construindo uma fábrica de poder de processamento de gigawatts com base na plataforma Vera Rubin para alimentar o Grok.
Além disso, essa capacidade de mineração será enviada diretamente ao espaço.
Musk stated, "Two powerhouses joined forces to design an optimized version of the Vera Rubin NVL72, to be deployed at scale in 2028."

A primeira geração do satélite AI "Starmind" da SpaceXAI planeja utilizar o sistema de rack Vera Rubin NVL72.

De uma única GPU até uma fábrica inteira de Agentes
No mesmo dia, os dois chips Vera CPU e Groq 3 LPX entraram em produção em massa.
This is significant for NVIDIA.

Na era dos grandes modelos, a NVIDIA conquistou o treinamento e a inferência com suas GPUs.
Na era dos agentes, seu domínio já se estendeu a CPUs, aceleradores de inferência, NVLink, entre outros.
O que o Velho Huang vende já não é mais apenas uma GPU.
O que ele quer vender é uma fábrica de IA capaz de produzir tokens continuamente.
Desta vez, Lao Huang está prestes a reassentar toda a base da "Era dos Agentes".
Referências:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI
