El chip Jalapeño de OpenAI supera al Blackwell de NVIDIA en eficiencia

iconTechFlow
Compartir
AI summary iconResumen
El chip Jalapeño de OpenAI muestra una mayor eficiencia energética que el Blackwell de NVIDIA, según un análisis on-chain. Desarrollado en 16 meses, superó a los chips de NVIDIA, AMD y Google en pruebas clave. Diseñado para inferencia general de IA, Jalapeño ofrece un alto rendimiento de tokens por vatio sin decodificación especulativa. Aunque carece de soporte CUDA, su desempeño podría cambiar el mercado de chips de IA. Los datos on-chain sugieren un creciente interés en soluciones de hardware de IA alternativas.

Autor: SemiAnalysis

Compilado por Deep潮 TechFlow

Guía de Shenchao: Se revelan los datos de prueba del primer chip de inferencia desarrollado por OpenAI, Jalapeño, cuya eficiencia energética supera directamente al actual flagship de NVIDIA, Blackwell, y se acerca a la próxima generación, Rubin. Para las empresas de IA atrapadas en cuellos de botella de energía en sus centros de datos, este chip podría redefinir el panorama del mercado de capacidad de cómputo. Sin embargo, aún queda una incógnita sobre si el primer chip podrá realmente desafiar el ecosistema CUDA de NVIDIA.

Compare el costo total de propiedad, el rendimiento por megavatio y los detalles picantes de su ASIC desarrollado internamente con Rubin y Jalapeño

Durante los últimos dos años, OpenAI ha estado desarrollando en silencio "Jalapeño", un chip de inferencia que acaba de ser anunciado en Hot Chips. Los rumores sobre su éxito en la fabricación llevaban circulando un tiempo. Ahora tenemos los detalles. OpenAI nos invitó a examinar el chip, ingresar al laboratorio para verificar su autenticidad y realizar pruebas de rendimiento con nuestro kit InferenceX.

En junio de este año, OpenAI anunció un proyecto de chip en colaboración con Broadcom, diseñado desde cero específicamente para la inferencia de LLM. El diseño comenzó a mediados de 2024, y desde la contratación inicial del equipo hasta la fabricación del chip se tardó solo aproximadamente 16 meses, un ciclo de desarrollo de ASIC extremadamente rápido.

Generalmente, los chips de primera generación no son competitivos, pero OpenAI hizo lo contrario: superó a todos los chips de NVIDIA, AMD y Google que pudimos probar en varios modelos de código abierto de primer nivel, liderando la industria. OpenAI logró esto mediante un diseño extremadamente optimizado de software y hardware. Sorprendentemente, OpenAI no se enfocó excesivamente en un solo aspecto específico de la inferencia del modelo, sino que se centró en crear un chip universal que ofrezca alto rendimiento en todos los escenarios.

Este artículo profundizará en los detalles de la arquitectura, los detalles del software y los resultados de rendimiento de Jalapeño en InferenceX.

Un chip de inferencia universal

Todos dicen que el chip de OpenAI está diseñado específicamente para los modelos de OpenAI, pero esto es incorrecto; OpenAI ha creado un chip universal para inferencia de IA.

La línea de tiempo es loca. Esto demuestra que la afirmación de “acelerar el diseño de chips con IA” es cierta. A pesar de la rapidez de la línea de tiempo, OpenAI invirtió una gran cantidad de dinero, tomó decisiones de diseño prácticas y cuenta con un equipo muy fuerte, por lo que esto no es sorprendente.

Solo por sus especificaciones, es inmediatamente un competidor fuerte:

Y al usar HBM4, se vuelve lo suficientemente potente como para competir con las GPU insignia de NVIDIA y AMD:

Muchos medios han seguido las declaraciones casuales de OpenAI, afirmando que este chip optimizará sus modelos de manera que otros chips no pueden hacerlo. Esto es incorrecto. Jalapeño es un chip de inferencia general que puede ejecutar diversos modelos y cargas de trabajo, incluido nuestro benchmark InferenceX, que ejecutamos en el laboratorio junto con ingenieros de OpenAI. Como broma, OpenAI incluso nos mostró cómo ejecuta Doom, un juego portado a su chip únicamente con prompts de Codex.

A continuación, se muestran nuestros resultados más importantes de rendimiento por vatios, medidos en el throughput de tokens por megavatio de consumo total. Jalapeño supera con creces a todos los demás chips. Todo esto sin utilizar la predicción de múltiples tokens (MTP), mientras que los demás chips en el gráfico están configurados en su mejor SKU posible con MTP activado.

Jalapeño supera a Blackwell en rendimiento por vatios en casi todos los escenarios, sin estar optimizado para ningún punto específico de la curva. No solo destaca en escenarios de baja latencia, sino también en escenarios de alta capacidad de procesamiento. Una comparación más justa es observar los resultados de predicción por token único: Jalapeño supera a cada competidor por amplio margen. En escenarios de baja concurrencia, Jalapeño demuestra una interactividad asombrosa: con el modelo DeepSeek R1, alcanza más de 700 tokens por segundo por usuario con una concurrencia de 1.

Increíblemente, todo esto se logra con predicción de un solo token (STP), sin decodificación especulativa ni separación de prellenado-decodificación. Además de DeepSeek R1, observamos otros modelos como Kimi-K2.5 y GPT-OSS, que alcanzan aproximadamente 1,400 tokens por usuario por segundo. Para todos los modelos, confirmamos que los resultados de Jalapeño en GSM8k son equivalentes a los de los chips NVIDIA.

Aquí hay algunas notas importantes. En primer lugar, todos los datos provienen de OpenAI. Hemos verificado personalmente el funcionamiento de InferenceX en nuestro laboratorio, pero no ejecutamos el conjunto completo de pruebas de InferenceX ni vimos los resultados de AgentX. AgentX es nuestro conjunto preferido para comparar el rendimiento de los chips, ya que sus conjuntos de datos con contextos extremadamente largos y características de múltiples rondas reflejan el comportamiento de caché bajo cargas de trabajo de producción reales. Un marco que se desempeña bien en 8k1k podría rendir peor en AgentX, ya que las cargas de producción reales ponen a prueba componentes como enrutadores, mecanismos de caché de prefijos, gestión de caché e infraestructura de descarga. Las pruebas de una sola ronda de 8k1k no cubren estos aspectos. Para obtener más información, lea nuestro artículo sobre AgentX.

AgentX - InferenceXv3: ¿Sigue resistiendo el foso de CUDA en la inferencia de agentes?

En segundo lugar, creemos que la comparación con Blackwell es algo incompleta y poco justa. El verdadero competidor de Jalapeño son chips como Rubin, que también utilizan HBM4. El sistema Vera Rubin ya ha comenzado a enviar productos a clientes, mientras que Jalapeño de OpenAI aún solo tiene muestras de ingeniería y necesita algún tiempo antes de alcanzar la producción en masa.

Por lo tanto, el rendimiento realmente debería compararse con Rubin, no con Blackwell. De cierta manera, ya esperábamos que chips personalizados como Jalapeño superaran a Blackwell. La eficiencia energética de Vera Rubin NVL72 es 5.4 veces mayor que la del GB200 NVL72, como mencionamos en nuestro artículo del mes pasado sobre el análisis de las declaraciones de rendimiento de NVIDIA y CoreWeave. Más adelante compararemos los datos de rendimiento de Jalapeño con los de Vera Rubin de julio.

Vera Rubin NVL72 frente a GB200 NVL72? Análisis de TCO y arquitectura

En tercer lugar, los modelos probados no están en la vanguardia de la investigación de código abierto. NVIDIA y AMD ya han publicado resultados de modelos más grandes con AgentX, como DeepSeek V4 Pro y Kimi K3. Cuanto más grandes sean los modelos y más recientes sean sus lanzamientos, más complejo resulta hacerlos funcionar en nuevos chips. Sin embargo, el modelo que OpenAI ejecutó en Jalapeño tampoco es pequeño.

Análisis de rendimiento

El objetivo de diseño de OpenAI es el rendimiento por vatio. La razón es sencilla: OpenAI actualmente está limitado por la electricidad de los centros de datos, no por el presupuesto ni el espacio del centro de cómputo, por lo que el número de tokens por megavatio es crucial. En Computex 2026, Jensen Huang dijo que el rendimiento por vatio, la confiabilidad y la larga vida útil son las características fundamentales de las GPU del futuro. Sus palabras exactas fueron: “Si tienes 1 gigavatio de electricidad, entonces el rendimiento por vatio es ingreso”. También mencionó que no tiene sentido elegir una arquitectura incorrecta solo porque el chip sea más barato.

NVIDIA también enfatizó esto en la presentación de Vera en Hot Chips 2026, mostrando el mismo gráfico de ingresos: “Los centros de datos actuales están limitados por la electricidad.” La electricidad es crucial y impulsa los ingresos.

Los operadores no pueden obtener fácilmente más megavatios. La escala de tiempo para aumentar las GPU y aumentar la capacidad de la red eléctrica es muy diferente. El límite de energía de los centros de datos está sujeto a múltiples restricciones, como la interconexión con servicios públicos, infraestructura, capacidad de enfriamiento y diseño de UPS/generadores de respaldo. Los retrasos en la red eléctrica frecuentemente superan los avances en hardware y construcción, generando demanda de capacidad eléctrica detrás del medidor. Esto implica construir turbinas de gas y generadores locales dentro del propio centro de datos. Estas capacidades se encuentran detrás del medidor de servicios públicos y no dependen de la red pública, permitiendo a los operadores alimentar sus instalaciones sin esperar la interconexión a la red ni las actualizaciones de los servicios públicos. Esta es precisamente la razón por la que xAI depende en gran medida de la energía detrás del medidor para Colossus 2, mientras que su conexión real a la red eléctrica sigue significativamente retrasada. Consulte nuestro modelo energético para más información.

Como mencionamos en el post de X, tok/s/MW se puede simplificar como tokens por julio. Dado que un vatio es un julio por segundo, tok/s/MW representa la eficiencia del sistema y su capacidad para convertir energía en tokens.

En este aspecto, Jalapeño supera incluso a Rubin. El rendimiento de token por megavatio STP de Jalapeño de OpenAI supera los resultados MTP de Vera Rubin. Este resultado fue publicado por NVIDIA y CoreWeave en julio. También supera ampliamente el resultado MTP del GB200 en 2025. Como mencionamos en el artículo sobre Vera Rubin, la comparación se realiza entre VR y el resultado del GB200 de 2025, ya que ambos se encuentran en fases iniciales similares. Al mismo tiempo, comparar con el GB200 de 2025 mantiene constante la madurez del software. Sobre esta base, comparamos tres resultados: el más reciente de Vera Rubin de julio de 2026, el resultado del GB200 de 2025 y el resultado actual de Jalapeño. Esta comparación es muy razonable, ya que estos son los mejores datos públicos disponibles sobre Rubin. Además, OpenAI fabricó su propio chip después que Rubin. Tanto OpenAI como Rubin aún no son maduros, por lo que su rendimiento seguirá mejorando.

En cuanto al rendimiento y el costo total de propiedad (TCO), Vera Rubin y Jalapeño están empatados, generando casi el mismo número de tokens por dólar. Sin embargo, como se mencionó anteriormente, los resultados de Jalapeño no utilizaron decodificación especulativa, mientras que los de Vera Rubin sí la emplearon. La decodificación especulativa puede reducir el costo por token en aproximadamente 3 a 5 veces. Una vez que Jalapeño implemente la decodificación especulativa, su eficiencia de costo para proporcionar tokens será aún mayor. Por supuesto, parte de la ventaja en TCO proviene de evitar las altas márgenes de ganancia de NVIDIA y optar por las márgenes más bajas (aunque aún elevadas) de Broadcom. Pero esto no es la única razón. Por ejemplo, los proyectos de ASIC de IA de Meta y Microsoft han invertido más tiempo sin lograr implementarlos con éxito. Esto indica que el costo es solo una parte de la ecuación. Para una desglose completo del TCO de Jalapeño, consulte el modelo TCO de AI Cloud de SemiAnalysis.

En términos de arquitectura, OpenAI optó por no separar el prellenado (prefill) y la decodificación (decode) en distintos conjuntos de chips. El modelo de borrador y el modelo principal comparten el mismo chip y la misma estructura de interconexión. Este enfoque de diseño sacrifica cierta eficiencia teórica a cambio de una mayor facilidad operativa práctica. La motivación radica en que la composición de la carga de trabajo ha cambiado con el tiempo; por ejemplo, la proporción entre entradas, escrituras de caché, lecturas de caché y tokens de salida ha variado significativamente. Este cambio ocurrió tras experimentar tres generaciones de modelos: conocimiento, razonamiento y agentes, como se discutió recientemente en nuestro artículo. Por lo tanto, asignar cantidades fijas previamente definidas para siliconas heterogéneas de prellenado y decodificación conduciría a una ineficiencia creciente con el tiempo. OpenAI optó por un conjunto homogéneo en esta arquitectura y se esfuerza por lograr un rendimiento sólido en todos los tipos de tareas.

Y efectivamente lo logró. En Kimi K2.5 (basado en el modelo Cursor Composer 2.5), Jalapeño alcanzó casi 700 tok/s/usuario. Esta velocidad es más de 9 veces la del segundo chip mejor clasificado, que es de 100 tok/s/usuario.

En GPT-OSS, otra aplastante victoria. El rendimiento por vatios de Jalapeño es casi el doble del punto de rendimiento máximo del GB200, y más de 50 veces el punto de concurrencia 1 del GB200. Los puntos de Jalapeño con mayor concurrencia utilizan EP8.

¡Estos resultados son impresionantes! Pero debemos ser exigentes: solo son 8k1k, con una dificultad de ajuste mucho menor, y aún no hay datos de ejecución de AgentX. Como mencionamos en el artículo de AgentX, las cargas de trabajo de múltiples rondas y largo contexto ejercen presión sobre más aspectos de la pila de inferencia, como el enrutador y la caché de prefijos. Para destacar en cargas de trabajo de agentes, se requieren más optimizaciones. Para más información, lee el artículo de AgentX.

AgentX - InferenceXv3: ¿Puede la ventaja de CUDA mantenerse en la inferencia de agentes?

Especificaciones y arquitectura detalladas

Todos estos resultados provienen del paso A0 de Jalapeño, apenas 9 meses después del lanzamiento del proyecto. ¡Pero el paso B0 ya está en la fábrica de obleas! La optimización del paso B0 mejora el rendimiento por vatio en aproximadamente un 25% en comparación con la silicona A0 anterior. Específicamente, el paso B0 logra 13.4 PFLOPs de MXFP4 en un chip de tamaño de máscara única. Este chip se fabrica con el proceso N3P de TSMC. En comparación, un solo chip de cálculo Rubin logra 17.5 PFLOPs de NVFP4 denso en dimensiones similares y el mismo nodo.

Dado que el TDP de Jalapeño es de solo 700 W, en comparación con los 900-1150 W por chip de cálculo de Rubin, este rendimiento es aún más admirable. Como Jalapeño está orientado a inferencia y no a entrenamiento, OpenAI no necesita aumentar el TDP para maximizar los FLOPs. Esto es comprensible. Pero de todos modos, los resultados anteriores indican que Jalapeño ofrece un considerable pico de FLOPs teóricos.

Al compararse directamente con otros aceleradores, Jalapeño tiene el mayor ancho de banda de HBM por vatio y el mayor número de FLOPs por vatio. Este nivel es comparable con la configuración Rubin Max-Q de 1800W.

Jalapeño incorporará HBM4 y se convertirá en uno de los primeros chips en adoptar esta tecnología, incluso antes que los proyectos existentes de TPU y Trainium. Uno de los principios clave de la arquitectura de Jalapeño es aprovechar al máximo el ancho de banda de HBM, por lo que comprometerse con HBM no de máxima gama iría en contra de este objetivo. Esto logra un ancho de banda de memoria por paquete de 15,4 TB/s, superando a todos los demás aceleradores en venta que utilizan HBM3E. Un ancho de banda de 15,4 TB/s indica que su HBM4 alcanza una velocidad de pin de 10 Gbps, ligeramente por encima de los 9,6 Gbps de HBM4 en Rubin de Nvidia. Es muy probable que el HBM sea proporcionado por Samsung.

OpenAI completó la fabricación de Jalapeño en noviembre de 2025, más precisamente, un diseño CoWoS, no solo el chip superior. En los 9 meses posteriores a la fabricación de noviembre de 2025, y tras solo 3 meses de depuración en silicio real, OpenAI ya ha obtenido resultados excelentes con Jalapeño. Esto es aún más impresionante teniendo en cuenta que el equipo comenzó desde cero en la pila de software.

Al mismo tiempo, la producción en masa de CoWoS de Rubin se completó en octubre de 2025, un mes antes, pero los únicos resultados tempranos que hemos visto hasta ahora provienen de las muestras de ingeniería de CoreWeave. Nvidia no nos ha permitido probar y publicar benchmarks, como lo hizo OpenAI, lo que indica que su software de chip aún no está maduro. Dado que OpenAI ha podido ejecutar tan rápidamente nuevos modelos en sus propios chips, el foso de CUDA podría haber desaparecido.

Aún están lejos de estar optimizados, y podemos ver que en general Jalapeño proporcionó mejores datos. No creemos que el hardware de Nvidia sea peor, sino que el desarrollo de software de Jalapeño ha avanzado más rápido que el de Nvidia. Esto demuestra el poder del diseño coordinado hardware/software, que es precisamente el área en la que los equipos ASIC de los laboratorios más avanzados pueden superar a fabricantes de chips comerciales más maduros. De forma contraintuitiva, comenzar desde cero también podría beneficiar a OpenAI, ya que puede tomar decisiones de arquitectura completamente nuevas sin estar limitada por la compatibilidad hacia atrás o versiones antiguas de software.

Aunque OpenAI ya tiene una muestra de ingeniería de Jalapeño, la producción en masa actualmente está planificada para aumentar gradualmente en 2027, con la mayor parte de la producción programada para finales del próximo año. Para más detalles sobre la cantidad de unidades y el precio promedio de venta, consulte el modelo SemiAnalysis Accelerator.

Se puede decir que OpenAI Jalapeno es un ASIC de gran escala.

En comparación con la línea de tiempo de Rubin, la velocidad de Jalapeño es asombrosa. Como se mostró anteriormente, a pesar de que Rubin comenzó antes, los resultados de Jalapeño superan a los de Rubin.

Arquitectura Jalapeño

Desde una perspectiva de arquitectura profunda, el motor de matriz de este chip utiliza el formato numérico MXFP y una matriz de pulsación con pesos residentes, similar a la TPU. Sin embargo, en comparación directa con la TPU, admite formas/dimensiones más pequeñas, lo que significa que no experimenta caídas de rendimiento inesperadas como las multiplicaciones matriciales con formas no coincidentes en matrices de pulsación más grandes.

También cuenta con un núcleo escalar de 64 bits y núcleos vectoriales FP32/INT32. OpenAI también ha implementado diseño de redundancia a nivel de placa y recuperación de rendimiento integrada a nivel de núcleos y canales. Afirman que la asistencia de IA en el diseño del chip redujo el área SIMD en un 8% y el área del motor matricial en un 10%. Aunque no especifican las condiciones exactas de proceso/tensión/temperatura (PVT), mencionan que el módulo asistido por IA mejoró el timing y el consumo de energía en comparación con el módulo inicial.

El diseño de arquitectura Jalapeño se centra en eliminar la transferencia de memoria del KVCache y los pesos, así como la latencia y el sobrecarga fijas, para acercarse más al rendimiento pico original de cálculo/ancho de banda en comparación con otros aceleradores, incluso con lotes pequeños o formas pequeñas.

Los núcleos y los HBM se dividen en múltiples segmentos, donde cada segmento de núcleo tiene una vista local de baja latencia sobre su propio segmento de HBM. La sincronización entre segmentos se realiza a través de una red de colecciones dedicada de alto ancho de banda. Esta estructura de memoria minimalista otorga a Jalapeño una ventaja potencial significativa frente a las GPU, ya que el acceso a la memoria en las GPU debe atravesar un sistema de memoria complejo, generando latencias más altas que deben amortizarse o ocultarse sobre formas grandes.

Esta opción es viable porque, al colocar cuidadosamente los pesos y los KV, la sincronización entre núcleos se puede limitar a comunicaciones de ancho de banda alto y conocido, como la comunicación de paralelismo de tensores que puede superponerse con el cálculo.

Además, existe un NoC general adicional para comunicaciones generales y acceso a la red extendida. En general, OpenAI logra un ahorro significativo de energía y un aumento notable del rendimiento en comparación con Nvidia y Google mediante un sistema NOC y de memoria simplificado.

En su núcleo, OpenAI describe un núcleo fuera de orden (OoO) con caché L1. Esto difiere significativamente del patrón que vemos en otros aceleradores, que utilizan registros gestionados por software, generalmente acompañados de soporte DMA asíncrono. El argumento aquí es que esto permite que Jalapeño evite sobrecargas fijas, como la latencia de barreras, que en otros aceleradores (como las GPU) deben ocultarse o amortizarse aumentando la carga de trabajo por núcleo, lo que dificulta acercarse a la ancho de banda o capacidad de procesamiento pico originales.

El costo es que Jalapeño depende de una buena prefetch para asegurar que las solicitudes de memoria lleguen a tiempo, lo cual es más difícil de predecir y razonar. Sin embargo, con Codex para obtener seguimientos detallados dentro de un buen marco, encontrar el kernel óptimo con la mejor prefetch para una forma dada podría requerir casi ninguna intervención humana. Creemos que esto es exactamente la razón por la que OpenAI pudo implementar tan rápidamente DeepSeek R1, Kimi K2.5 y GPT-OSS.

El núcleo también admite dimensiones de matriz "más pequeñas", lo que (dependiendo de cuán pequeñas sean) debería hacerlo más versátil en diferentes modelos y dimensiones de lote, siendo menos sensible al alineamiento de dimensiones de matriz, al overhead de relleno y a la ineficiencia por bloques. Por ejemplo, los chips TPU, Trainium y Etched poseen matrices de pulsación muy grandes que podrían requerir lotes grandes o dimensiones de modelo exactamente divisibles para evitar ineficiencias por bloques.

Con Jalapeño, OpenAI se centra en eliminar la latencia fija en el sistema para acercarse lo más posible al rendimiento roofline en todas las regiones de la curva de Pareto. Teóricamente, esto podría generar ventajas relativas frente a las GPU en múltiples puntos de operación:

El rendimiento máximo para inferencia de baja latencia y lotes pequeños es mucho superior al de las GPU. Las GPU están limitadas por sobrecostos fijos como la latencia de inicio, la latencia de barrera y la latencia del sistema de memoria.

Incluso con lotes grandes o contextos largos, tiene el potencial de acercarse más al techo del hardware.

Esto viene con una advertencia: aunque teóricamente existe un límite de rendimiento, el núcleo real puede ser más difícil de alcanzar. Por lo tanto, su enfoque parece ser:

Diseñar el rendimiento máximo para todas las formas de carga de trabajo

Deja que Codex realice el trabajo pesado y encuentre el núcleo que implementa este límite.

El equipo de OpenAI ha lanzado la carga de trabajo InferenceX en Jalapeño con un tiempo de ciclo extremadamente rápido.

Por lo tanto, nos sentimos optimistas respecto a este método.

Si Jalapeño tiene éxito, liberará una señal fuerte.

La obsesión de la industria con los modelos de programación y los compiladores universales perfectos será superada por los modelos de IA más avanzados.

OpenAI escribe el núcleo Jalapeño como si escribiera ensamblador.

Cada núcleo tiene código optimizado manualmente, aproximadamente 3000 líneas en total.

Además, cuenta con verificación de corrección y soporte para sanitizadores personalizados.

El trabajo inicial del núcleo fue con intervención humana, no completamente automatizado.

Luego se pasó a la versión interna más escalable de Codex.

OpenAI planea vender esta versión a clientes empresariales.

El motor de servicio interno se llama "Teacup".

Curiosamente, OpenAI anteriormente no tenía una implementación interna del núcleo MLA.

Hasta que realizaron pruebas de referencia de DeepSeek con InferenceX.

Codex puede escribir núcleos funcionales y eficientes tan rápidamente sin necesidad de que intervenga el equipo de ingeniería de núcleos.

Esto demuestra la capacidad de desarrollo de la tubería de software.

OpenAI usa Gluon para programar Jalapeño.

Gluon es el lenguaje de programación interno de OpenAI.

Gluon se construye sobre Triton y conserva el modelo de programación SPMD (Single Program Multiple Data) de Triton.

Pero expone la abstracción de programación subyacente.

Por ejemplo, para las GPU de NVIDIA, proporciona una API que se mapea a instrucciones PTX.

Incluye instrucciones MMA, instrucciones TMA, mecanismo mbarrier, etc.

La abstracción más única que ofrece Gluon es el diseño.

En general, la disposición define el mapeo entre los recursos de hardware y los elementos del tensor.

Por ejemplo, el quinto registro de Warp 9 corresponde al elemento del tensor en la fila 6, columna 7.

La abstracción de diseño de Gluon se basa en Linear Layouts.

Esta es un álgebra de diseño inventada por OpenAI.

Linear Layouts formaliza matemáticamente qué es un diseño.

Y proporcionar herramientas para el diseño de la interfaz.

Esto admite muchas funciones, como conversiones de diseño verificables correctamente.

También hay swizzling de memoria óptimo.

En el modelo de programación de Jalapeño, cada programa Gluon se asigna a un hilo persistente.

We believe this suggests that Jalapeño is suitable for persistent kernel programming patterns.

Cada programa se ejecuta en múltiples tiles, con el trabajo asignado por el programador, no por el programador de hardware.

OpenAI mencionó TensorInfo.

Es una abstracción de un diseño codificado explícitamente.

Esto podría ser un conjunto de diseños diseñados para Jalapeño.

Será impulsado por Linear Layouts.

Finalmente, cada núcleo proporciona un prefetched de datos y una unidad de desacoplamiento fuera de orden.

Por ejemplo, el usuario puede programar la espera de datos preobtenidos.

Los datos están bloqueados por un semáforo.

La ironía del destino es que modelos de OpenAI como GPT 5.6 Sol actualmente se ejecutan en GPU de NVIDIA.

They are used to design chips that pose a real threat to CUDA's moat.

Las propias GPU de NVIDIA están impulsando en tiempo real al posible sucesor.

Al comparar a través del tiempo, aún podemos ver la velocidad de desarrollo de Jalapeño.

En menos de dos semanas, el rendimiento de ciertos escenarios de interacción aumentó más del 200 %.

Cada tarball que recibimos del equipo Jalapeño contiene un mundo maravilloso.

No solo se mejoró el rendimiento del núcleo, sino que el equipo Jalapeño activó TP32 en 8 días.

Extend the previous TP8 configuration beyond a single system to achieve a full rack-level configuration for running large models.

This development speed is indeed impressive.

Para verificar el rendimiento antes de ejecutarlo en hardware real, OpenAI también tiene un simulador llamado "chilisim".

Su precisión está dentro del 5% del hardware real, utilizando un bus trace de ancho fijo.

La capacidad de seguimiento es limitada en A0, pero mejora significativamente en B0.

Esto podría deberse a los datos reales de funcionamiento del oblea A0.

El ingeniero demostró el funcionamiento del modelo interno con Codex CLI.

Su apodo es "Raiku" o "5.3 Codex Spark", con un TPOT de 1.2 ms.

El equipo también mostró una demostración escrita por Codex que se ejecuta directamente en el chip.

Incluye Doom a 36 FPS y simulación de dinámica de fluidos FP32.

También hay visualización de arrastre de ratón "Liquid Light".

En cuanto a los modelos, la solución interna de OpenAI llamada megakernel tiene el apodo "gigakernel".

Se construye alrededor de un único megakernel que se ejecuta en el dispositivo para reducir la sobrecarga de la CPU y el tiempo de inicio.

El equipo sigue avanzando en el cálculo de la estrategia durante las pruebas.

Atención interna especial sobre cómo coordinar el uso de 1 millón de rollouts.

¿Debería usar Disagg? Esa es la pregunta

Anteriormente mencionamos que OpenAI no utiliza la separación prefill-decode en estos chips.

Nos sorprendió, ya que el rendimiento de las GPU de NVIDIA y AMD se benefició significativamente de PDD.

Incluso en hardware homogéneo.

Vamos a profundizar por qué el equipo de Jalapeño hizo esto.

Cuando la carga de trabajo es fija, la separación prefill-decode parece atractiva.

Prefill y decode tienen diferentes cargas sobre el hardware.

Asigne cada fase a un pool ajustado individualmente para mejorar la eficiencia bajo la relación entrada-salida seleccionada.

Pero el tráfico de producción no mantendrá esa proporción.

La longitud de la secuencia de entrada/salida, la concurrencia, la tasa de aciertos en caché, la tasa de aceptación especulativa y los objetivos de latencia varían durante todo el día.

Una vez que el dispositivo se divide en piscinas de prefill y decode, una demanda excesiva de prefill dejará los chips de decode inactivos y las solicitudes se acumularán.

Pero demasiadas solicitudes de decode tienen el efecto contrario.

The operator must continuously predict the correct split and reserve backup capacity on both sides.

Y reequilibrar un sistema cuya proporción ideal cambia constantemente.

En el sistema unificado, ciertos recursos pueden subutilizarse en etapas específicas.

But each device can still be used to serve the next request.

En un sistema separado, un chip completo podría quedar inactivo solo por pertenecer a un grupo incorrecto.

La utilización local parece mejor, pero la utilización global podría ser muy baja.

La separación también destruye la localidad.

El trabajador de prellenado genera la caché KV grande que el trabajador de decodificación necesita inmediatamente.

El sistema debe transmitir este estado a través de la red para que pueda continuar la generación.

Esto aumenta el consumo de ancho de banda, la sincronización, la cola y otro dominio de fallas.

El costo también aumenta con la longitud de la secuencia de entrada, ya que la caché KV crece.

Sin embargo, evitar el movimiento de KV se centra principalmente en la optimización del consumo de energía y la latencia.

Mover algunos KV puede aumentar la utilización del hardware, a costa del consumo de energía y la latencia por solicitud.

Los clústeres intercambiables pueden transferir capacidad entre solicitudes sensibles a la latencia y lotes orientados a rendimiento.

El desglose fijo inactiva el hardware cuando cambia la combinación de tráfico.

Además, el cambio en la longitud del contexto altera el equilibrio entre la atención y el FFN.

Cualquier proporción de hardware fija es eficiente solo cerca del punto de diseño.

Las mismas restricciones se aplican a la decodificación especulativa. El modelo borrador debe proporcionar tokens candidatos al validador con una latencia extremadamente baja. Separar ambos en distintos pools dedicados convierte el bucle de decodificación íntimamente acoplado en un protocolo distribuido. La comunicación y coordinación adicionales podrían consumir la latencia ahorrada por el modelo borrador. Solo al colocar ambos modelos en el mismo dispositivo y sobre una estructura de baja latencia se conserva la localidad que hace valiosa la decodificación especulativa.

Sin embargo, en lugares donde la demanda es suficientemente grande, estable y predecible, la desacoplación aún prevalece, especialmente cuando las GPU tradicionales requieren lotes masivos y por etapas para lograr un buen rendimiento. Pero esto no es una comida gratis.

De japonés a indio (de suave a muy picante): Katsu, Vindaloo y Chana — ¿cómo se ensamblan estos platos de curry en un sistema de rack?

El sistema Jalapeño está compuesto, a nivel de unidad de rack, por un rack de host CPU y un rack de ASIC. El rack de host aloja 16 plataformas de CPU host denominadas "Katsu". Cada Katsu corresponde a una de las 16 plataformas ASIC de la derecha, denominadas "Vindaloo". Cada host está equipado con dos CPU AMD EPYC de la clase Turin, 1,5 TB de DRAM por rack, 2x E1.S y 2x SSD M.2. Cada plataforma también incluye una red frontal de 400G (2x200G). Cada plataforma Katsu se conecta a cada plataforma Vindaloo mediante 8 cables DAC PCIe externos. Estos cables se distribuyen horizontalmente en la parte frontal del rack. El diseño a nivel de sistema se realizó en colaboración con Celestica.

El gabinete ASIC está compuesto por 16 bandejas Vindaloo y 8 bandejas de conmutador de expansión (6 locales + 2 globales), denominado “Chana”. Cada bandeja Vindaloo contiene 8 ASIC Jalapeño, lo que suma un total de 128 ASIC Jalapeño por gabinete. Los ASIC se conectan a cada bandeja de conmutador Chana mediante un backplane de cableado de cobre, similar al Oberon de Nvidia. La topología de expansión se divide en dominios locales y globales. El dominio local cubre los 128 ASIC dentro del gabinete. El dominio global conecta hasta 16 gabinetes o 2.048 ASIC. Explicaremos con mayor detalle el ancho de banda y la topología a continuación.

La alimentación del bastidor lateral es de aproximadamente 50 kW (31 kW en producción), y los bastidores ASIC consumen 130 kW. El sistema completo de dos bastidores es de aproximadamente 160 kW. En términos de consumo energético, esto equivale básicamente a un bastidor de doble ancho GB300.

OpenAI puede conectar hasta 2,048 Jalapeño XPU dentro de una sola red expandida. La red expandida consta de dos dominios. El dominio local conecta los 128 XPU dentro del rack mediante una backplane. El dominio global utiliza una combinación de cables de cobre e interconexiones ópticas para conectar los 2,048 XPU de 16 racks. Cada rack contiene 8 bandejas de interruptores Chana. Los 6 interruptores Chana centrales se utilizan para el dominio local, cada uno con un ASIC de conmutación Tomahawk 6 de 102.4 T. Los 2 interruptores Chana superior e inferior se utilizan para el dominio global. Creemos que podrían ser 2 interruptores Tomahawk 6 de 102.4 T cada uno, con un máximo de 204.8 T por bandeja de interruptores.

En la región local, 128 chips Jalapeño ofrecen un ancho de banda unidireccional de 4.8 Tb/s por XPU. Estos se conectan en modo full-mesh a 6 ASIC Tomahawk 6 de 102.4 Tb/s. Esto equivale a 48 pares diferenciales (DP) de conectores macho-hembra por XPU. En total, se utilizan 6,144 pares DP de cables pasivos de cobre para la expansión local por rack.

En el dominio global, 16 bastidores con un total de 2.048 XPU se conectan mediante una combinación de backplane de cobre, interruptores eléctricos de 204.8T TH6, módulos ópticos de 1.6T y conmutadores ópticos de circuitos. Cada XPU tiene un ancho de banda unidireccional de 1.6 Tb/s en sus enlaces globales. Cada XPU cuenta con 16 pares diferenciales (DP) de conectores macho y hembra para la conexión con el backplane entre el XPU y el conmutador global. Cada bandeja de conmutador global tiene 2 ASIC, cuyo ancho de banda de salida se distribuye entre el backplane y los dispositivos ópticos del panel frontal.

Entre los dominios locales y globales, hay 64 pares DP por conector de backplane por XPU. En total, hay 8.192 pares DP de cableado pasivo de cobre por rack.

El dominio global utiliza una arquitectura pura de rail, compuesta por 8 rails dentro del dominio global. Creemos que OpenAI enruta los enlaces ópticos en el dominio global mediante conmutadores ópticos de circuito (OCS) instalados en cada rack. El ancho de banda global de 1.6 Tb/s de cada XPU llega al panel de conmutación global a través de una placa trasera de cobre, y luego sale del conmutador mediante módulos ópticos de 1.6 T en el panel frontal. Primero entra en un conmutador óptico pasivo y luego abandona el rack. Esto permite escalar el dominio hasta 2.048 XPU, distribuidos en 16 racks, con 128 XPU por rack.

Dado que la red extendida representa solo aproximadamente el 10% del costo total del sistema, esta flexibilidad brinda una valiosa opción para modelos futuros de 10 a 20 billones de parámetros o ventanas de contexto de 2 a 4 millones de tokens. En cuanto a la implementación, OpenAI colabora con neocloud. También recopiló datos de confiabilidad con socios de centros de datos hace un mes, mientras optimizaba el tiempo de implementación desde el muelle hasta el rack.

Siguiente paso

A continuación, discutiremos el futuro de Jalapeño, cuyo primer token de producción está a punto de lanzarse. El siguiente objetivo es 100 MW; los principales obstáculos están en el hardware: cuánto pueden producir, qué tan bien pueden desplegar y operar centros de datos, y cómo manejar la supervisión y la resiliencia. El software ya ha sido validado, y con modelos internos, cualquier ventaja de software se puede superar fácilmente. Detrás de la puerta de pago, discutiremos el impacto en empresas de chips como NVIDIA, AMD y Cerebras, que han firmado contratos con OpenAI para los próximos años.

También cubrimos la producción, cantidad y cronograma de los chips de próxima generación en el modelo Accelerator.

La parte posterior es contenido de pago; debido a problemas de permisos, no se realizó una traducción adicional, pero el texto anterior ya contiene suficiente información que refleja el desafío de OpenAI a los chips de NVIDIA. Para los jugadores interesados en el sector de chips y en el precio de NVIDIA, esta información ofrecerá una referencia fresca y sólida.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.