NVIDIA presenta Vera Rubin NVL72, aumenta el rendimiento de DeepSeek 30 veces

icon MarsBit
Compartir
AI summary iconResumen
NVIDIA publicó noticias en la cadena que muestran los resultados de la prueba Vera Rubin NVL72, con un aumento de 30 veces en el rendimiento de DeepSeek-V4-Pro. Los costos de tokens disminuyeron 35 veces en comparación con GB300 NVL72. La plataforma incluye Vera CPU y Groq 3 LPX, que ahora están siendo utilizados por SpaceXAI. Podrían seguirse nuevas listas de tokens, ya que los aumentos de rendimiento sugieren una implementación más amplia de IA.

¡Increíble!

Just now, NVIDIA unveiled for the first time in its history the initial on-chip test data for its next-generation flagship cabinet, Vera Rubin NVL72.

Y además, esta prueba en vivo atrajo directamente DeepSeek -V4-Pro, ejecuta la tarea más realista de «codificación de agentes»

Los resultados son sorprendentes: en comparación con el actual superordenador líder GB300 NVL72, el Vera Rubin aumentó hasta 30 veces su rendimiento por megavatio y redujo hasta 35 veces su costo por token.

Agentes

¡Alguien exclamó: «¡Ni siquiera me atrevería a escribir una presentación de PowerPoint para engañar a los inversores!»

Otros usuarios comentaron: «Antes pensaba que el H200 a 30.000 dólares era caro, pero ahora veo que ni siquiera llega a ser la versión básica.»

Agentes

Vamos a analizarlo detenidamente.

Desde H200 hasta GB300, el rendimiento en cargas de trabajo de Agent reales aumentó hasta 30 veces, con un costo aproximadamente duplicado.

Desde GB300 hasta Vera Rubin, el rendimiento aumentó nuevamente hasta 30 veces más, y el precio de todo el bastidor se duplicó aproximadamente.

Según la ley de Moore de Old Huang, en estos dos años, el mayor avance técnico de NVIDIA no ha sido la GPU en sí, sino aumentar el precio cuatro veces y lograr un salto de velocidad de hasta 900 veces.

Agentes

Esta vez, NVIDIA le anunció a todos una verdad contraintuitiva: la era de los LLM ha terminado, ha llegado la era de los Agentes, ¡y todos los benchmarks anteriores de IA quedan obsoletos!

Agentes

Mientras tanto, la CPU Vera diseñada específicamente para agentes ya ha sido instalada por la SpaceXAI de Musk durante la noche, e incluso se prepara para enviarse al espacio.

Hoy también, la NVIDIA Groq 3 LPX ha entrado en producción masiva.

Gemma 4 31B se ejecuta arriba, la velocidad es simplemente increíble, alcanzando directamente 3400 tokens por segundo. Rendimiento de modelos de billones de parámetros, acelerado 35 veces.

Agentes

Agentes

¡Estos nuevos récords reescribirán el panorama comercial del ecosistema Agent a partir de esta noche!

¿Por qué NVIDIA debe lanzar Vera Rubin?

Los datos más recientes de OpenRouter dan la respuesta: en el mundo real, una tarea de Agent AI consume 15 veces más tokens que una conversación de chat normal.

Por ejemplo, si se le pide a un agente que investigue una empresa para tomar decisiones de inversión, durante este proceso, el agente y los subagentes razonarán continuamente, y los tokens acumulados se convertirán en la entrada para el siguiente paso; el procesamiento de contextos largos se convierte en el factor más crítico que limita la IA del agente.

Agentes

Cuanto más frecuentes sean las interacciones entre agentes, mayor será el rendimiento: al aumentar el número de agentes diez veces y las llamadas a herramientas el doble, la tensión entre capacidad de cómputo y algoritmos genera nuevas necesidades.

Agentes

No uses el chat como un agente; todos los benchmarks anteriores han sido anulados.

En este momento, las pruebas de referencia tradicionales de IA (como pruebas de secuencias fijas de 8K/1K) se vuelven completamente inválidas.

NVIDIA oficialmente señala: ¡Las mediciones de rendimiento deben evolucionar! Ya no se puede medir solo una sola solicitud de inferencia, se debe capturar el flujo de trabajo completo del Agente.

Para ello, utilizaron la prueba de referencia AgentX de SemiAnalysis.

Esta prueba ya no es una pregunta y respuesta rígida, sino una reproducción de una «sesión de programación» real con crecimiento contextual, llamadas a herramientas y generación de subagentes.

Agentes

Por eso, el H200 resulta insuficiente en el nuevo campo de batalla de los Agentes, y Vera Rubin está destinada a reinar.

Vera Rubin NVL72 × DeepSeek-V4-Pro:

Llega la máquina de hash

Para demostrar la capacidad de Vera Rubin NVL72, NVIDIA utiliza directamente al rey del código abierto— DeepSeek Prueba en chip realizada en V4-Pro (1.6T).

Al lanzarse los datos, los resultados fueron asombrosos—

Bajo la carga de trabajo de AgentX, el rendimiento por megavatio de Vera Rubin NVL72 aumentó hasta 30 veces en comparación con el GB300 NVL72.

Agentes

Tenga en cuenta que aquí no se compara con el antiguo H200, sino con el muy demandado GB300.

GB300 en el mismo DeepSeek En la prueba de V4-Pro, el rendimiento por megavatio ya es 15 veces mayor que el del H200.

Sin embargo, Vera Rubin se elevó 30 veces más sobre los hombros de GB300, ¡elevando aún más toda la curva de Pareto!

What does this mean?

For AI factories constrained by power supply, this directly expands the boundaries of physical laws.

Con el mismo presupuesto de energía, Vera Rubin puede realizar 30 veces más trabajo de agentes.

Para centros de datos de megavatios e incluso gigavatios, esto equivale a crear de la nada 30 veces más activos de poder de cómputo.

Además, la tecnología NVIDIA DSX MaxLPS permite la gestión de energía a nivel de GPU, rack y carga de trabajo, permitiendo configurar hasta un 40 % más de GPU dentro del mismo presupuesto de megavatios, lo que aumenta aún más el rendimiento por megavatio de las fábricas de IA.

Agentes

¡El costo del token se reduce 35 veces! La «contabilidad» de la industria de Agentes se reescribe por completo

Por cada megavatio de capacidad de procesamiento, se reduce directamente el costo de generación de cada token. El aumento del rendimiento trae como consecuencia más inmediata una explosión comercial.

NVIDIA anunció que la producción de Vera Rubin NVL72 reduce hasta 35 veces el costo por millón de tokens en comparación con GB300 NVL72.

Agentes

Cuando el costo de inferencia caiga bruscamente 35 veces, los empleados digitales operando 24/7 se volverán una realidad, y las superaplicaciones orientadas al consumidor experimentarán un gran auge.

Este golpe de Lao Huang abrió directamente la puerta a la era de las aplicaciones de Agent.

Agentes

Diseño de colaboración extrema: ¿Cómo lo logró Huang?

¿Te preguntarás: ¿por qué se puede acelerar 30 veces? ¿Se debe al proceso de un solo chip?

Claramente no.

Vera Rubin NVL72 logra un increíble aumento de rendimiento gracias al «diseño colaborativo extremo».

Agentes

Por ejemplo, servicios separados, caché distribuida KV, enrutamiento consciente de KV, MegaMoE, etc.

Agentes

Además, NVFP4 comprime directamente los pesos del modelo a una precisión de 4 bits, reduciendo significativamente el uso de memoria sin sacrificar la calidad de la salida, lo que hace que el rendimiento se dispare.

Y el NVLink de sexta generación junto con los grandes modelos MoE proporcionan una red interconectada 10 veces más rápida y con una latencia 3 veces menor que la Ethernet convencional, permitiendo que DeepSeek Este gran modelo basado en la arquitectura MoE puede invocar fluidamente diferentes subredes de «expertos» entre 72 GPU.

Hace tiempo que ya no se trata de vender tarjetas gráficas; Huang vende toda una «central eléctrica de IA».

Agentes

NVIDIA Groq 3 LPX en producción masiva completa:

3400 tokens/segundo, ¡el agente de código está cambiando!

En esta conferencia Hot Chips 2026, NVIDIA también anunció un mensaje impactante: ¡Groq 3 LPX ha comenzado la producción en masa!

Agentes

Groq 3 LPX, una extensión exclusiva de la plataforma de centro de datos Vera Rubin NVL72.

Está diseñado específicamente para este sistema, con un enfoque principal en la aceleración de inferencia de baja latencia.

Esta tecnología de punta fue adquirida por NVIDIA en diciembre del año pasado por 20.000 millones de dólares de la startup Groq.

Agentes

Los agentes de IA pueden experimentar retrasos en la decodificación; para resolver este problema, Groq 3 LPX separa hábilmente el procesamiento del contexto amplio de la generación de tokens.

La solución de NVIDIA consiste en hacer que la GPU Rubin maneje contextos de gran escala y asignar la tarea de generación extremadamente rápida de tokens a Groq 3 LPX.

Uno se encarga de la lectura, otro de la escritura; cada uno se enfoca en lo que mejor sabe hacer.

Agentes

En una implementación completa a nivel de rack, hasta 256 aceleradores LP30 pueden trabajar junto con GPUs mediante una interconexión de ultraalto ancho de banda para construir un motor de inferencia a escala empresarial.

Agentes

Así, Groq 3 LPX alcanzó directamente una velocidad de salida récord.

En las pruebas de referencia de Artificial Analysis, Groq 3 LPX ejecutó Gemma 4 31B con una ventana de contexto ultra larga de 100.000 tokens, alcanzando una velocidad de salida impresionante de 3.400 tokens/segundo.

Esto lo hace hasta 4 veces más rápido en respuestas que sus competidores en cargas de trabajo extremadamente sensibles a la latencia.

Agentes

¡Las tareas de agentes multipaso que antes tomaban varias horas ahora se pueden completar en minutos!

Agentes

Groq 3 LPX reduce el tiempo para generar 5000 tokens de 50 segundos a 1.5 segundos, una diferencia de 34 veces.

Agentes

Además, en tareas de codificación, Groq 3 LPX alcanza una velocidad máxima de salida de 6981 tokens/s.

Agentes

Huang Renxun afirmó directamente que el avance de la generación de tokens ultra rápidos mediante LPX logró «otro gran salto» en el rendimiento y la capacidad de respuesta de la IA.

Agentes

Nebius ha desplegado este chip en Nebius Token Factory para ofrecer una experiencia extremadamente rápida con respuestas instantáneas en cada paso del ciclo de agentes.

Agentes

Sigue siendo Groq en sí.

Agentes

Se lanza la primera CPU exclusiva para Agentes,

Musk viaja al espacio en plena noche!

El paso más ambicioso en este anuncio oficial es la Vera CPU.

Para el agente, NVIDIA diseñó específicamente un CPU.

Esta CPU, Vera, está diseñada específicamente para alimentar a los agentes inteligentes.

Cuenta con 88 núcleos Olympus desarrollados internamente, memoria LPDDR5X de alto ancho de banda con un ancho de banda directo de 1,2 TB/s.

Agentes

¿Por qué se necesita una CPU completamente nueva en la era de los grandes modelos?

En Hot Chips, un ejecutivo de la CPU Vera de NVIDIA afirmó directamente: "El Agentic AI es la tarea de cómputo más compleja de la historia".

Agentes

Una tarea, pero detrás del agente se ejecutan cientos de pasos: llamar herramientas, ejecutar código Python, navegar por el contexto, procesar cantidades masivas de datos...

Estas tareas de programación de repartidores recaen completamente sobre la CPU. Por lo tanto, NVIDIA debe diseñar un CPU dedicado para el Agente.

Precisamente por这一点,Musk's SpaceXAI anunció de inmediato la implementación a escala de la CPU NVIDIA Vera!

Ya en mayo de este año, NVIDIA envió discretamente las primeras muestras de Vera a A Corp, OpenAI y SpaceX AI para una prueba inicial.

Solo tres meses después, SpaceXAI no pudo esperar para pasar a su implementación completa.

Lo más loco es que SpaceXAI está construyendo una fábrica de potencia de cómputo de gigavatios sobre la plataforma Vera Rubin para impulsar a Grok.

不仅如此,这套算力还将被直接送往太空。

Musk dijo: "Dos empresas líderes se unieron para diseñar una versión optimizada de Vera Rubin NVL72, que se implementará a gran escala en 2028".

Agentes

La primera generación del satélite AI «Starmind» de SpaceXAI planea utilizar el sistema de rack Vera Rubin NVL72.

Agentes

De una sola GPU a una fábrica completa de Agentes

El mismo día, los dos chips Vera CPU y Groq 3 LPX entraron en producción masiva.

This is significant for NVIDIA.

Agentes

En la era de los grandes modelos, NVIDIA ha dominado el entrenamiento y la inferencia mediante GPUs.

En la era de los agentes, su alcance ya se ha extendido a CPU, aceleradores de inferencia, NVLink, etc.

Lo que vende Lao Huang ya no es solo una GPU.

Lo que él quiere vender es una fábrica de IA que puede producir tokens continuamente.

Esta vez, Old Huang está preparando una nueva base para toda la «Era de los Agentes».

Referencias:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Este artículo proviene del número de WeChat "Nueva Inteligencia", autor: Apocalipsis de la ASI

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.