Recientemente, NVIDIA publicó una guía oficial de inferencia de modelos grandes, pero al hojearla, casi parecía una recopilación de artículos de equipos chinos.
Así son las cosas.
El 2 de septiembre, el blog técnico de NVIDIA publicó un artículo extenso titulado "Decodificar la colaboración en el diseño de modelos de IA mediante la especulación".
El núcleo del artículo es una tabla de comparación que presenta lado a lado los seis métodos de aceleración de inferencia más populares actualmente, desglosando claramente incluso los costos de entrenamiento y los escenarios adecuados.

Su importancia radica en que, de manera extremadamente rara, el líder del sector de chips ha establecido como norma cómo deben diseñarse los modelos para ajustarse a los límites físicos del hardware.
Y cuando buscan alrededor la solución óptima para bailar en los límites de la oblea de silicio, los planes centrales incluidos en la guía son casi todos liderados por equipos chinos.
Esto ya va mucho más allá de una simple revisión de algoritmos. ¿Qué secretos revela realmente esta tabla? Desglosémosla línea por línea.
Casi ganar puro: ¿Qué está haciendo Speculation Decode?
Para entender esta tabla, primero debes comprender qué es el "speculative decoding".
Los modelos grandes generan palabras una por una. Cada vez que produce una palabra, los cientos de GB de parámetros deben recorrer completamente la memoria de la GPU. En realidad, la mayor parte del tiempo, la capacidad de cómputo espera a que la memoria transfiera los datos.
La solución de «Desencriptar la especulación» es muy sencilla y directa—
Primero, utiliza un modelo ligero para realizar una predicción preliminar y adivina siete caracteres de una sola vez; luego, el modelo grande valida esos siete caracteres de una sola vez.
Verificar siete caracteres lleva aproximadamente el mismo tiempo que escribir uno tú mismo, ya que de todos modos hay que mover todos los pesos.
Quien adivine correctamente lo recibe directamente, quien se equivoque debe volver desde el punto de interrupción. Debido a que el modelo grande solo acepta los caracteres que originalmente sabía escribir, la salida final no requiere ningún cambio en la puntuación. Esto es lo que se denomina «aceleración sin pérdida».

En este juego, toda la extracción de poder de cálculo gira en torno a una fórmula matemática esperada central:
Speedup = 𝔼[L] × TtargetTdraft + Tverify
El numerador es el rendimiento 𝔼[L], que representa la longitud esperada aceptada (cuántos caracteres, en promedio, el modelo grande puede seleccionar por ronda).
El denominador es el costo adicional que pagas, el tiempo que tarda el modelo pequeño en hacer la predicción (Tdraft) más el tiempo que tarda el modelo grande en la verificación final (Tverify).
Para hacer que la aceleración (Speedup) se dispare, solo hay dos caminos: o bien aumentar el numerador (adivinar con más precisión), o bien comprimir al máximo el denominador (adivinar más rápido).
Ascendiendo sobre los hombros de la competencia, logrando la cuarta generación de evolución
Siguiendo la tabla de NVIDIA de arriba hacia abajo, verás una línea clara de competencia.
La primera línea es el modelo de borrador externo más antiguo, que requiere un pequeño modelo independiente entrenado como asistente.
NVIDIA ha revelado directamente una factura exorbitante: entrenar desde cero consume de 1T a 10T de tokens, lo que implica un costo muy elevado.
Pero sigue en la lista porque NVIDIA le ha asignado un destino específico: los chips Groq (LPU) que compraron por 20.000 millones de dólares.
La última línea es el método de consulta de n-gramas sin entrenamiento, que copia directamente fragmentos repetidos buscándolos en el texto anterior, y solo es adecuado para escenarios rígidos de copiar y pegar grandes bloques.
Las cuatro líneas del medio son las que realmente representan la evolución tecnológica.

Segunda línea: EAGLE-3.
Equipo de Yuhui Li de la Universidad de Pekín y Hongyang Zhang de la Universidad de Waterloo, entre otros.
Desde ICML y EMNLP hasta NeurIPS, en tres años lanzó tres generaciones, llevando el camino antiguo de "adivinar palabra por palabra" hasta su límite físico.
Fue el absoluto dominante en este campo, pero en la nueva tabla de NVIDIA, ha sido relegado a la posición de «referencia», con una razón muy breve: su longitud de aceptación ya ha sido superada por la ola posterior.
Tercera línea: MTP (Multi-Token Prediction).
La idea, aunque original de Meta en 2024, fue realmente consolidada como estándar en la inferencia de modelos grandes por DeepSeek -V3.
NVIDIA recibe una evaluación muy alta: la mejor opción para modelos grandes en GPU. La idea central es que este enfoque debe entrenarse junto con el modelo principal desde la fase de preentrenamiento.
Cuarta línea: DFlash. El protagonista que logra un acelerador sin pérdidas de 6x.
Tres autores: Jian Chen, Yesheng Liang, Zhijian Liu. Abandona por completo el enfoque serial de adivinar una palabra a la vez, como en EAGLE y MTP, y en su lugar adopta modelos de difusión, generando directamente la secuencia de predicción de 7 tokens en un solo cálculo hacia adelante, reduciendo al mínimo el denominador (tiempo).
Por cierto, el asesor Zhijian Liu es profesor asistente en la UCSD, pero también es científico investigador del Instituto de NVIDIA.
Fila cinco: DSpark. Desarrollado por un equipo de 24 personas combinado de DeepSeek y la Universidad de Pekín.
Aunque la arquitectura paralela de DFlash es rápida, tiene una debilidad fatal: cuanto más avanzas, menos precisa es la adivinación. Para forzar un aumento en el numerador (longitud aceptada), DSpark incorpora un módulo serial extremadamente ligero sobre la base paralela.
Los datos de prueba son muy claros: la longitud aceptada aumenta casi un 30% en comparación con EAGLE-3 y un 18% en comparación con DFlash. En DeepSeek En el entorno de producción en línea de V4, la velocidad es un 60% a 85% más rápida que MTP.
Hardware constants, reverse lock-in model architecture
Estas cuatro generaciones de tecnología pueden extraer toda la potencia de cálculo hasta este nivel, y no solo dependen de ingeniosidades algorítmicas.
Mucha gente cree que cuanto más adivines en un borrador, más ganarás, pero esto ignora por completo las leyes físicas del silicio.
Cuando la atención domina el tiempo de decodificación, el número total de tokens que se deben procesar en la fase de validación del modelo grande es 1+D (1 entrada real + D predicciones de borrador).
Para alimentar estos datos a la GPU, el hardware agrupa en el nivel inferior las cabezas de consulta y las cabezas de KV; el tamaño de los bloques de núcleos de atención por grupo debe estar estrictamente limitado por los límites físicos de la matriz de la GPU (Tile Size, generalmente 128 en arquitecturas actuales).
Se ha obtenido la fórmula de alineación subyacente: G × (1 + D) ≤ 128
Al hacer una ligera deducción, se llega al principio final del guía de NVIDIA:
D = 128G − 1
Donde G es el número de grupos de atención (la proporción entre los encabezados Query y KV).
Esto significa que la forma en que se agrupan las atenciones al diseñar tu modelo determina directamente cuántos caracteres debe adivinar el borrador para llenar perfectamente los bloques de la GPU.
Si G=8, puedes adivinar exactamente 15 borradores; si G=32, solo puedes adivinar 3. El hardware no puede cruzar el límite: incluso si solo usas la mitad del último Tile, el poder de cómputo se cobrará igual como si hubieras usado un Tile completo.
Anteriormente, la decodificación especulativa era un paquete de aceleración externo que el equipo de ingeniería intentaba implementar después de que el modelo hubiera sido entrenado y lanzado. Pero ahora, las leyes físicas subyacentes te indican: una constante de la matriz de hardware se retroalimenta directamente en los parámetros de diseño del modelo.
En nuestra memoria, rara vez un fabricante de chips ha incorporado así una ecuación de restricción de hardware subyacente en el diseño de un modelo grande.
Epílogo
El enfoque de la competencia por la eficiencia del modelo ha cambiado por completo.
La era de simplemente acumular grandes parámetros está llegando a su fin; hoy en día, la verdadera clave del éxito depende de quién entienda mejor los límites físicos de ese trozo de silicio bajo sus pies.
En este nuevo campo de juego donde los gigantes de los chips han invertido las reglas, el equipo chino ya se ha convertido silenciosamente en la respuesta predeterminada para romper el estancamiento.
Un gigante de la potencia de cómputo como NVIDIA naturalmente no se preocupará por qué algoritmos se encuentran en el estante.
Pero esta solución óptima que extrae el límite de las obleas de silicio, ¿quién la creó? Está escrito en negro sobre blanco, con total claridad.
Este artículo proviene del canal de WeChat "Nueva Inteligencia", autor: Apocalipsis ASI
