Autor original: Dong Jing
Fuente original: 华尔街见闻
OpenAI lanza su primer chip propio, Jalapeño, que revoluciona el panorama de los chips de IA con una velocidad asombrosa: esto no es solo un lanzamiento de producto, sino una señal de que la IA está redefiniendo la forma en que se diseñan los chips.
Según el artículo de Wall Street Journal, Bloomberg informó el 25 de agosto que OpenAI afirmó que Jalapeño lidera a la GB300 de NVIDIA en dos métricas clave: la cantidad de carga de trabajo de IA procesada por unidad de consumo energético y la velocidad de respuesta. Este chip, desarrollado en colaboración entre OpenAI y Broadcom, está diseñado específicamente para la fase de inferencia de IA y podría entrar en uso práctico a finales de este año. Richard Ho, responsable de chips de OpenAI, indicó que Jalapeño logra un rendimiento potente con solo 700 vatios de bajo consumo, lo que ayuda a reducir significativamente los costos eléctricos de los centros de datos.

Según reveló la institución de investigación de semiconductores SemiAnalysis, este chip tardó solo aproximadamente 16 meses desde el inicio del diseño hasta la finalización de la fabricación, y el nodo clave de fabricación con empaquetado CoWoS se completó en noviembre de 2025, hace apenas 9 meses, mucho menos que el ciclo habitual de la industria de 18 a 36 meses.

Los investigadores de SemiAnalysis visitaron personalmente el laboratorio de OpenAI y realizaron pruebas prácticas de Jalapeño utilizando su conjunto de pruebas de referencia desarrollado internamente, InferenceX, llegando a la conclusión directa: este chip supera en rendimiento por vatio (perf/W) a todos los chips de NVIDIA, AMD y Google que habían probado anteriormente.
Lo más notable es que este rendimiento se logró sin habilitar optimizaciones como la decodificación especulativa de Jalapeño, ni la implementación separada de prellenado y decodificación, mientras que los demás chips participantes ya tenían activada su configuración óptima.
No es de extrañar que hasta el famoso analista de semiconductores Dylan Patel haya dicho directamente: “¡No solo se ha superado a Blackwell, sino también el chip Rubin de NVIDIA!”

El análisis sugiere que este resultado representa un desafío directo a la posición de mercado de NVIDIA y obliga al mercado a reevaluar el panorama de la competencia en chips de IA.
Datos reales: Jalapeño supera ampliamente a Blackwell en múltiples indicadores clave
Los resultados de prueba de SemiAnalysis muestran que Jalapeño tiene una ventaja considerable en eficiencia de inferencia.
En el modelo GPT-OSS 120B, Jalapeño puede generar aproximadamente 1459 tokens por segundo, mientras que el NVIDIA GB200 solo logra 535; en cuanto a la latencia de extremo a extremo, Jalapeño completa una tarea en solo 1.65 segundos, mientras que el GB300 requiere casi 6 segundos, una diferencia de 3.6 veces. En escenarios de alta interacción, cuando el GB300 se impulsa a su velocidad máxima de decodificación (169 tokens por segundo), el rendimiento de Jalapeño es 104.3 veces mayor.

En la métrica central de eficiencia energética de los centros de datos, que mide el número de tokens generados por megavatio por segundo, Jalapeño alcanza aproximadamente 53 millones de tokens/MW/s en el modelo GPT-OSS, mientras que el GB200 NVL72 alcanza solo alrededor de 10 millones.

SemiAnalysis señala que este indicador es esencialmente equivalente al número de tokens generados por julio, lo que determina directamente el techo de ingresos del centro de datos: en la actualidad, donde la capacidad de cómputo está limitada por la electricidad, esta ventaja es particularmente crucial.
Desde una perspectiva de costos a nivel de sistema, según SemiAnalysis, que incluye el suministro de energía, la disipación térmica y la red en sus cálculos, el costo total por hora por chip de Jalapeño es de aproximadamente 1.56 dólares, casi igual al de H100, que es de 1.55 dólares, mientras que el de NVIDIA Vera Rubin alcanza los 3.61 dólares.

Es importante destacar que SemiAnalysis también planteó varias reservas importantes.
En primer lugar, el modelo utilizado en la prueba no es el más avanzado actualmente; NVIDIA y AMD ya han publicado resultados basados en el paquete AgentX en modelos de mayor escala, como DeepSeek V4 Pro y Kimi K3, mientras que Jalapeño aún no ha completado las pruebas de AgentX, un paquete que refleja mejor el rendimiento en escenarios de producción reales, como múltiples rondas y contextos largos.
En segundo lugar, el comparador más justo sería la NVIDIA Vera Rubin, que también utiliza HBM4, en lugar de Blackwell; el rendimiento por vatio de Vera Rubin es aproximadamente 5.4 veces mayor que el del GB200 NVL72, y en cuanto al costo total de propiedad (TCO) por token, ambos son casi idénticos al Jalapeño.
En tercer lugar, Jalapeño aún se encuentra en la fase de prototipos de ingeniería, y la producción en masa se espera que comience a aumentar gradualmente hasta 2027.
Diseño de chips de IA: el efecto de espiral de GPT-Astra y Codex
La integración profunda de herramientas de IA es una de las razones principales por las que Jalapeño pudo completar su desarrollo a una velocidad tan asombrosa. Según SemiAnalysis, OpenAI utilizó ampliamente modelos de IA internos durante el proceso de diseño de chips, incluido el ampliamente observado GPT-Astra.
El usuario de la plataforma social X, Andrew Curran, citando información de OpenAI, señaló que GPT-Astra participó profundamente en todo el desarrollo de Jalapeño:
El equipo utilizó Codex y GPT-Astra para optimizar tres modelos de código abierto que originalmente no estaban incluidos en el plan de producción masiva de Jalapeño, logrando un rendimiento de alto nivel en dos meses.

Esto significa que la IA no solo acelera el diseño de los chips en sí, sino que también amplía rápidamente el rango de modelos que los chips pueden admitir.
Los datos de SemiAnalysis cuantifican aún más esta contribución:
El diseño asistido por IA reduce el área de las unidades SIMD en un 8% y el área del motor matricial en un 10%, mientras que supera la versión inicial en rendimiento de temporización y consumo de energía.

A nivel de software, OpenAI utilizó una versión interna extendida de Codex para escribir el núcleo de Jalapeño, con partes del código del núcleo que alcanzan aproximadamente 3000 líneas; en los módulos más exigentes en rendimiento, como la atención y MoE, el código generado por IA es 1.5 a 1.8 veces más rápido que la implementación de ingenieros humanos de élite.
SemiAnalysis ofrece una evaluación bastante perspicaz: los modelos de OpenAI (como GPT-5.6 Sol) que se ejecutan en GPUs de NVIDIA se están utilizando para diseñar un chip que representa una amenaza real para el foso de CUDA: "Las propias GPUs de NVIDIA están generando en tiempo real a su posible sucesor".

Análisis de la arquitectura: ¿Por qué lo "universal" es más rápido?
Se asume ampliamente que Jalapeño es un chip profundamente personalizado para los modelos propios de OpenAI, pero la conclusión de SemiAnalysis es exactamente lo contrario: Jalapeño es un chip general para inferencia de IA, capaz de ejecutar diversos modelos y cargas de trabajo, incluso incluyendo el juego Doom portado por Codex.
En el nivel de arquitectura, la filosofía de diseño central de Jalapeño es "eliminar la latencia fija". A diferencia de las GPU que dependen de jerarquías de memoria complejas, Jalapeño vincula directamente los núcleos de cálculo con las rebanadas de HBM, sincronizando los núcleos mediante una red de colección de alta ancho de banda dedicada, reduciendo significativamente la latencia de acceso a la memoria.
Además, Jalapeño utiliza un núcleo de ejecución fuera de orden (OoO) con caché L1, en lugar de los registros gestionados por software comúnmente utilizados por otros aceleradores, lo que le permite acercarse más al pico teórico del hardware en escenarios de lotes pequeños y baja latencia.
En cuanto al ancho de banda de memoria, Jalapeño utiliza HBM4, logrando un ancho de banda de memoria por paquete de 15,4 TB/s, con 22 de ancho de banda HBM por vatio, mientras que NVIDIA Rubin tiene 11,1 y GB300 solo 5,71.

SemiAnalysis señala que la velocidad de los pines HBM4 de Jalapeño es de 10 Gbps, ligeramente superior a los 9,6 Gbps de Rubin de NVIDIA, y el proveedor de HBM podría ser Samsung.
Es importante destacar que Jalapeño optó por no implementar la despliegue separado de prelleno y decodificación (PDD). SemiAnalysis proporcionó una explicación detallada:
En un entorno de producción real, parámetros como la proporción de entrada/salida, la concurrencia y la tasa de aciertos en caché cambian constantemente; un reparto fijo de piscinas reduce la utilización global; en cambio, los pools de recursos homogéneos pueden responder flexiblemente a los cambios en el tráfico, asignando dinámicamente recursos entre solicitudes sensibles a la latencia y procesamiento por lotes de alto rendimiento.
El foso de CUDA: ¿ya aparecieron grietas?
SemiAnalysis lanzó en su informe un juicio de gran peso: el foso competitivo de CUDA podría haber muerto.
La base de esto radica en la comparación de la velocidad de arranque del software. La producción en masa de CoWoS de NVIDIA Rubin se completó un mes antes que la de Jalapeño, pero hasta ahora, los únicos datos de referencia públicos de Rubin visibles para el exterior provienen de las muestras de ingeniería de CoreWeave; NVIDIA no ha permitido el acceso libre a laboratorios para terceros, como lo hizo OpenAI. SemiAnalysis considera que esto refleja no una brecha en el hardware en sí, sino una diferencia en la madurez del software.
Construir desde cero la pila de software permitió a OpenAI liberarse de las cargas históricas y tomar decisiones de arquitectura más limpias. OpenAI utiliza su propio lenguaje de programación de núcleo, Gluon (construido sobre Triton), y su motor de inferencia interno "Teacup", junto con Codex para optimizar rápidamente los núcleos. SemiAnalysis observó que, en menos de dos semanas, Jalapeño aumentó su rendimiento en más del 200% en velocidades de interacción específicas; en ocho días, el equipo expandió el paralelismo de tensores de TP8 a TP32, logrando una implementación a escala de gabinete completo entre racks.
Sin embargo, SemiAnalysis también señaló claramente que las pruebas actuales solo cubren la carga de trabajo relativamente simple de 8k1k y aún no se han completado las pruebas de largos contextos multironda de AgentX. Bajo cargas de trabajo de agentes más complejas, el rendimiento de componentes como el enrutador y la caché de prefijos se convertirá en una nueva prueba.
Próximo paso: B0 ha ingresado a la fábrica, el mapa de 10 GW se despliega gradualmente
La historia de Jalapeño está lejos de terminar.
Según SemiAnalysis, las muestras utilizadas en la prueba pública son todas de la stepping A0, mientras que la stepping B0 ya ha ingresado a la fábrica de obleas y se espera que mejore el rendimiento por vatio en aproximadamente un 25% respecto a la A0: la capacidad de cálculo MXFP4 de un solo die de cálculo B0 alcanzará 13,4 PFLOPs, manteniendo el TDP en 700 W.
A nivel de sistema, OpenAI colaboró con Celestica para diseñar una solución completa de rack: cada gabinete ASIC contiene 128 chips Jalapeño, y el sistema de dos gabinetes tiene un consumo total de aproximadamente 160 kW, comparable al gabinete dual de NVIDIA GB300.

En cuanto a la implementación a escala, un único dominio de red escalable puede conectar hasta 2048 Jalapeño XPU, cubriendo 16 racks. En cuanto a la producción en masa, SemiAnalysis espera un aumento progresivo a partir de 2027, con el siguiente hito objetivo siendo una implementación de 100 MW.
La imagen estratégica más amplia es que OpenAI ha firmado un acuerdo de cooperación con Broadcom para 10 GW de aceleradores personalizados, una cantidad aproximadamente equivalente a la potencia máxima de diez reactores nucleares.
Artículo de Wall Street Journal indica que Richard Ho, responsable de chips de OpenAI, afirmó que la empresa ha alcanzado niveles de consumo energético y costos que permiten reducir realmente los gastos de infraestructura, "esto es solo el primer paso". Él también enfatizó que NVIDIA sigue siendo un socio importante, ya que la demanda de OpenAI por capacidad de cómputo es extremadamente alta y no abandonará a sus proveedores actuales en el corto plazo.
Los analistas señalan que el significado de Jalapeño quizás no radique en cuántos chips de NVIDIA pueda reemplazar hoy, sino en que demuestra algo que antes se cuestionaba ampliamente: una empresa de IA, utilizando herramientas de IA, logró crear en un récord de tiempo un chip verdaderamente competitivo. Este volante ya ha comenzado a girar.
