OpenAI, NVIDIA y Google difieren en el diseño de chips de IA para la inferencia de LLM

iconMetaEra
Compartir
AI summary iconResumen
El show de noticias de IA y cripto muestra que los principales actores divergen en el diseño de chips para inferencia de LLM. OpenAI’s Jalapeño se enfoca en la inferencia, NVIDIA combina GPUs con LPU de Groq, y Google separa los TPU 8t y 8i para entrenamiento e inferencia. La inferencia ahora requiere mayor ancho de banda HBM, mayor SRAM y rutas de red más cerradas. A medida que los chips se vuelven más específicos para cada carga de trabajo, el costo por token adquiere importancia junto con los FLOPS. Una actualización en la estrategia de diseño está reconfigurando la competencia en hardware de IA.
El panorama de la competencia en chips de IA está experimentando un cambio profundo. OpenAI lanzó el chip Jalapeño enfocado en la inferencia de LLM, NVIDIA combina GPU con LPU de Groq para lograr cómputo heterogéneo, y Google divide el entrenamiento y la inferencia en dos chips distintos: TPU 8t y TPU 8i. Estas tres vías reflejan las distintas necesidades de recursos de hardware para entrenamiento e inferencia: el entrenamiento se centra en cálculos matriciales y conectividad a gran escala, mientras que la inferencia requiere mayor ancho de banda HBM, mayor SRAM y rutas de red más cortas. A medida que aumenta la brecha entre las configuraciones de chips para ambos tipos de carga de trabajo, los FLOPS ya no son el único criterio de evaluación, y el costo por token se convierte en el nuevo indicador de la competencia en hardware de IA.

Autor y fuente del artículo: Leifengwang

El costo del token se convierte en un nuevo punto de referencia para la competencia de hardware de modelos grandes

Inteligencia embodied, invadiendo la cocina llena de humo

La vida de un robot trabajador bajo un millón de visitas

El exvicepresidente de Covariant AI, Zhoupu Shuzhong, resumió directamente el papel de LPU como llenar el vacío de Vera Rubin en la región de Decode de baja latencia.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

El diseño del chip de Groq también gira casi en torno a esto. Un rack LPX tiene 256 LPU, que en conjunto suman solo 128 GB de SRAM, una capacidad que no se puede comparar a escala con el HBM en los racks de GPU, pero el ancho de banda agregado de SRAM puede alcanzar 40 PB/s.

Este diseño valora especialmente la "proximidad". HBM puede almacenar muchos estados del modelo, pero está más alejado de las unidades de cálculo; SRAM es caro y difícil de escalar en capacidad, pero los datos están dentro del chip, lo que permite una ancho de banda muy alto y una latencia de acceso muy baja.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Cada paso realiza cálculos limitados y accede a datos con frecuencia; colocar los datos más cerca de la ALU se reflejará directamente en el tiempo de espera del siguiente Token.

Groq también redujo aún más el control de hardware dinámico. El LPU es una arquitectura de ejecución determinista, y la programación de instrucciones se realiza principalmente por software con anticipación. Cada chip actúa simultáneamente como procesador y enrutador, y el compilador programa conjuntamente los recursos de cómputo y los recursos de red, incluso eliminando mecanismos tradicionales como el control de flujo de hardware y los canales virtuales.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

El costo también es evidente: esta arquitectura no es tan versátil como la GPU, y el SRAM integrado no puede almacenar el estado completo de los modelos grandes. Por lo tanto, NVIDIA no hizo que Groq 3 ejecutara el modelo completo de forma independiente, sino que desarrolló un sistema heterogéneo más complejo.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

La prellena se realiza en la GPU, la mayor parte del Decode se coloca en la LPU; la Atención dentro del Decode puede regresar a la GPU. La GPU y la LPU mantienen sus propios KV Cache, intercambiando principalmente Tokens de borrador y superponiendo el cálculo y la comunicación mediante micro-batch. Dado que la LPU es un dominio síncrono, mientras que la GPU y el KV Cache externo pertenecen a un sistema asíncrono, NVIDIA incluso incorpora un FPGA como puente asíncrono entre ambos.

Esta estructura ilustra muy bien hasta qué punto ha avanzado la especialización de los chips de IA. Ya no solo se separan los chips de entrenamiento y los chips de inferencia, sino que incluso diferentes partes de una sola operación de Decode pueden ejecutarse en arquitecturas distintas.

Sin embargo, los datos presentados por NVIDIA también delimitan este enfoque: cuando el negocio solo busca un rendimiento total y puede aceptar una latencia más alta, la GPU Rubin sigue siendo muy eficiente; a medida que aumenta la demanda de velocidad por token por usuario, LPX comienza a mostrar sus ventajas, y al utilizar más LPU, la eficiencia general de rendimiento también disminuye.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Por lo tanto, la aparición de Groq 3 no significa que las GPU hayan sido eliminadas para inferencia. Indica otra cosa: es difícil que la misma GPU ocupe simultáneamente ambos extremos de alto rendimiento y latencia extremadamente baja; hacer que dos tipos de hardware operen en sus respectivos intervalos más adecuados permite al sistema ampliar más fácilmente la curva de rendimiento.

Google colocó este corte en un nivel más alto.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Entrenamiento e inferencia, con dos recetas de chips distintas

Google en esta generación de TPU 8 creó simultáneamente el TPU 8t y el TPU 8i,t orientado al entrenamiento,i orientado a la inferencia. Esta clasificación se basa en la configuración de memoria del chip.

En la demostración en vivo de Hot Chips, el TPU 8t utiliza 6 grupos de HBM, mientras que el TPU 8i utiliza 8 grupos. Google explica que la inferencia requiere más HBM por unidad de cálculo, así como un porcentaje más alto de SRAM, por lo que el 8i asigna más recursos a SRAM, capacidad de memoria y ancho de banda.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Esta diferencia merece reflexión. Si los chips de IA solo se trataran de comparar la potencia matricial, no tendría sentido que la versión de inferencia dedicara tanta área de chip y recursos de empaquetado a la memoria. El diseño del TPU 8i indica que Google ha identificado el cuello de botella en el suministro de datos.

Durante el entrenamiento, un lote grande distribuye el costo de lectura de los pesos entre muchos tokens; durante la decodificación, se generan pocos tokens en cada paso, pero los pesos y la caché KV siguen accediéndose con frecuencia. Por lo tanto, la cantidad de ancho de banda HBM requerido por cada FLOPS unitario difiere entre ambas tareas.

Google incluso llevó esta diferencia hasta la topología de red. Anteriormente, el 3D Torus comúnmente utilizado en TPU era más adecuado para el entrenamiento, enfocándose en el rendimiento total dentro de clústeres a gran escala. El TPU 8i admite BoardFly, con rutas de red más cortas: el límite de rutas de BoardFly es de 7 hops, mientras que el 3D Torus alcanza 16 hops.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Para el entrenamiento, después de unos pocos saltos de red adicionales, aún suele haber una gran cantidad de cálculos matriciales, lo que permite amortizar el tiempo de comunicación. El intervalo de cálculo para cada paso de Decode es corto, por lo que la latencia de varios saltos de red es más propensa a caer directamente dentro del intervalo entre tokens.

MoE hace que este problema sea aún más evidente. MoE permite que un Token active solo una parte de los Expert, lo cual es muy eficiente desde el punto de vista del cálculo, pero el Router envía los Tokens a diferentes Expert. Una vez que estos Expert están distribuidos en chips distintos, la reducción en el cálculo se acompaña de un aumento en la comunicación All-to-All.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Por lo tanto, el TPU 8i también incorpora el Collective Acceleration Engine, que realiza ciertas operaciones colectivas en el I/O Die cerca de la interfaz de red. Los datos no necesitan moverse primero al Compute Die y luego completar la operación a través del HBM, lo que permite eliminar parte del movimiento de datos dentro del chip.

La asignación de recursos para la versión de entrenamiento TPU 8t está claramente inclinada hacia el otro extremo. El entrenamiento requiere una gran cantidad de FLOPS y un enorme dominio de Scale-Up para sincronizar parámetros y gradientes. El Superpod de TPU 8t puede escalar hasta 9600 chips, con aproximadamente 2 PB de HBM compartido y 121 EFLOPS FP4 de capacidad de cómputo agregada; Google también introdujo la red Virgo para crear un sistema dedicado que conecte entrenamientos a mayor escala.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Google también mencionó un problema práctico de diseño de chips: dark silicon.

El área del chip y el presupuesto de consumo de energía son limitados. Si se integran en el mismo chip los numerosos recursos de cálculo matricial necesarios para el entrenamiento, junto con más SRAM, HBM y redes de baja latencia requeridas para la inferencia, en cierto tipo de carga de trabajo siempre habrá una parte de los circuitos que permanecerá inactiva durante mucho tiempo.

Jalapeño domina el split, ¿comienza la división en la ruta de inferencia GPU?

Dado que ambas tareas requieren proporciones diferentes de recursos, hacer dos chips separados es más limpio.

De FLOPS a la economía de tokens

Poner las tres rutas juntas hace que las diferencias sean realmente claras.

OpenAI hace Jalapeño, especializando los chips hasta el nivel de inferencia de LLM, pero manteniendo la programación flexible de Prefill y Decode en hardware homogéneo; NVIDIA sigue desglosando hacia abajo, asignando distintas etapas de la inferencia a GPU y Groq LPU; Google corta hacia arriba, convirtiendo directamente el entrenamiento y la inferencia en dos TPU distintas.

Detrás de estas rutas no hay nuevos principios de cálculo misteriosos; lo que cambia es la proporción de recursos. El entrenamiento busca asignar más transistores al cálculo matricial y a la interconexión a gran escala, porque un lote alto distribuye el costo de transferencia de datos; la inferencia de baja latencia requiere mayor ancho de banda HBM, mayor SRAM, mejor localidad de KV Cache y rutas de red más cortas, porque mucho tiempo se gasta esperando datos.

Cuando las "recetas de chips" requeridas por ambos tipos de carga se vuelven cada vez más distintas, utilizar un solo chip universal para atenderlos hará que las pérdidas de eficiencia se vuelvan cada vez más evidentes.

Es por eso que los números clave en esta ronda de competencia de hardware están cambiando. Los FLOPS siguen siendo importantes, pero ahora aparecen junto a ellos Tokens/s/user, TBT, TTFT, Tokens/kW, ancho de banda de HBM y latencia de red.

They are actually describing the same thing: the computing power is already in place; can the system continuously feed in data and deliver the generated Token as quickly as possible?

OpenAI, NVIDIA y Google aún no han establecido la misma línea divisoria; lo que probablemente seguirá cambiando en el futuro es dónde debería trazarse esta línea.

El entrenamiento y la inferencia pueden separarse, el prefill y el decode pueden separarse, y dentro del decode, la atención y otros cálculos también pueden seguir separándose. Cuanto más fino sea el desglose, más fácil será mejorar la eficiencia de cada tarea, pero la programación de recursos, el transporte del KV Cache y la comunicación entre hardware se volverán más complejos.

Por lo tanto, el desafío de la próxima fase de la competencia en chips de IA tal vez ya no sea simplemente fabricar un chip más potente.

Lo más difícil es decidir: ¿qué tareas merecen una chip dedicado y cuáles deben seguir ejecutándose en el mismo hardware para reducir el costo total de Token del sistema?

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.