Recentemente, a NVIDIA publicou um guia oficial de inferência de grandes modelos, mas, ao folhear, acabou parecendo uma coletânea de artigos de equipes chinesas.
É assim que é.
Em 2 de setembro, o blog técnico da NVIDIA publicou um artigo longo intitulado "Decodificando Co-Design de Modelos de IA com Speculation".
O ponto central do artigo é uma tabela de seleção que apresenta lado a lado os seis métodos mais populares de aceleração de inferência, expondo claramente os custos de treinamento e os cenários de aplicação.

Sua importância reside no fato de que o líder da indústria de chips raramente, de forma oficial, transformou em norma a ideia de como os modelos devem ser projetados para se alinhar aos limites físicos do hardware.
E quando eles olham ao redor em busca da solução ideal que dança nos limites do chip de silício, as propostas centrais do guia são quase todas lideradas por equipes chinesas.
Isso já ultrapassou muito o escopo de uma simples revisão de algoritmos. O que exatamente essa tabela revelou? Vamos analisar linha por linha.
Negócio quase puro: o que a Speculation Decoder está fazendo
Para entender esta tabela, primeiro é preciso compreender o que é "speculative decoding".
O modelo grande produz palavras uma por uma. Cada vez que gera uma palavra, centenas de GB de parâmetros precisam percorrer completamente a memória da GPU. Na verdade, na maioria do tempo, a capacidade de processamento fica aguardando os dados serem transferidos pela memória.
A solução para “Decodificação Especulativa” é muito simples e direta—
Primeiro, use um modelo leve para fazer uma previsão preliminar, adivinhando sete caracteres de uma vez; depois, o modelo grande valida esses sete caracteres de uma só vez.
Verificar sete caracteres e escrever um por conta própria levam aproximadamente o mesmo tempo, já que o peso precisa ser transferido de qualquer forma.
Quem acertar recebe diretamente, quem errar recomeça a partir do ponto de interrupção. Como o grande modelo só aceita caracteres que ele já sabe escrever, a saída final nem precisa mudar uma pontuação. Isso é o que se chama de “aceleração sem perda”.

Neste jogo, toda a exploração de poder de mineração gira em torno de uma fórmula matemática esperada:
Speedup = 𝔼[L] × TtargetTdraft + Tverify
O numerador é o retorno 𝔼[L], que representa o comprimento esperado aceito (o número médio de caracteres que o grande modelo acerta por rodada).
O denominador é o custo adicional que você paga, o tempo que o modelo pequeno leva para fazer a previsão (Tdraft) somado ao tempo que o modelo grande leva para a verificação final (Tverify).
Quer acelerar o speedup? Há apenas dois caminhos: ou aumentar o numerador (chutar com mais precisão), ou comprimir drasticamente o denominador (chutar mais rápido).
Aproveitando os ombros dos concorrentes, evoluindo para a quarta geração
Ao seguir a tabela da NVIDIA de cima para baixo, você verá uma linha clara de competição.
A primeira linha é o modelo mais antigo de "rascunho externo", que precisa de um pequeno modelo treinado separadamente como assistente.
NVIDIA revelou diretamente uma fatura astronômica: treinar do zero consome de 1T a 10T de tokens, com um custo muito elevado.
No entanto, ele ainda permanece na lista porque a NVIDIA designou um destino específico para ele — os chips Groq (LPU) que eles adquiriram por 20 bilhões de dólares.
A última linha é o método de consulta de n-gramas sem treinamento, que copia diretamente fragmentos repetidos encontrados no texto anterior, sendo adequado apenas para cenários rígidos de cópia e colagem em grandes blocos.
As quatro linhas do meio são as que realmente representam a evolução tecnológica.

Segunda linha: EAGLE-3.
Equipe de Yuhui Li da Universidade de Pequim e Hongyang Zhang da Universidade de Waterloo, entre outros.
Da ICML à EMNLP, três gerações lançadas em três anos, levando o caminho antigo de "adivinhar palavra por palavra" ao limite físico.
Ela já foi a absoluta dominadora deste campo, mas na nova tabela da NVIDIA, foi empurrada para a posição de "referência", com um motivo extremamente curto: o comprimento de aceitação já foi superado pelas ondas seguintes.
Terceira linha: MTP (Multi-Token Prediction).
A ideia, embora introduzida pela Meta em 2024, foi realmente consolidada como padrão para inferência de grandes modelos por DeepSeek -V3.
NVIDIA recebeu avaliações extremamente positivas — a melhor escolha para modelos grandes em GPU. O ponto central é que essa solução precisa ser treinada junto com o modelo principal desde a fase de pré-treinamento.
Quarta linha: DFlash. O jogador duro que conquista aceleração sem perda de 6x.
Três autores: Jian Chen, Yesheng Liang, Zhijian Liu. Ele descarta completamente a abordagem serial de "adivinhar uma palavra de cada vez" usada por EAGLE e MTP, em vez disso, adota modelos de difusão para gerar diretamente a sequência de previsão de 7 tokens em um único cálculo direto, comprimindo o denominador (tempo) ao máximo.
Por falar nisso, o orientador Zhijian Liu é professor assistente da UCSD, mas também é cientista de pesquisa do NVIDIA Research.
Fifth line: DSpark. Developed by a 24-person team composed of DeepSeek and Peking University.
A arquitetura paralela do DFlash é rápida, mas tem uma falha fatal: quanto mais avança, menos precisa se torna. Para forçar o aumento do numerador (comprimento aceito), o DSpark adiciona, sobre a base paralela, um módulo serial extremamente leve.
Os dados reais são muito claros: o comprimento aceito aumenta cerca de 30% em relação ao EAGLE-3 e 18% em relação ao DFlash. Em DeepSeek No ambiente de produção online da V4, a velocidade é 60% a 85% mais rápida que a MTP.
Hardware constants, reverse lock model architecture
Essas quatro gerações de tecnologia conseguem extrair toda a capacidade de processamento até esse ponto, não apenas por meio de ideias algorítmicas engenhosas.
Muitas pessoas acreditam que quanto mais adivinhar em um rascunho, mais se ganha, mas isso ignora completamente as regras físicas do chip.
Quando a atenção domina o tempo de decodificação, o número total de tokens a serem processados na fase de validação do modelo grande é 1+D (1 entrada real + D previsões de rascunho).
Para alimentar esses dados à GPU, o hardware agrupa os cabeçalhos Query e KV em blocos na camada inferior, e o tamanho do bloco do núcleo de atenção em cada grupo deve ser estritamente limitado pelos limites da matriz física da GPU (Tile Size, geralmente 128 na arquitetura atual).
Foi obtida a fórmula de alinhamento de base: G × (1 + D) ≤ 128
Ao fazer uma pequena dedução, chega-se ao critério constante final no guia da NVIDIA:
D = 128G − 1
Neste contexto, G é o número de grupos de atenção (razão entre cabeças de Query e cabeças de KV).
Isso significa que, desde o início do design do seu modelo, como o foco é agrupado determina diretamente quantos caracteres o rascunho deve adivinhar para preencher perfeitamente os blocos da GPU.
Se G=8, o rascunho adivinha exatamente 15; se G=32, só pode adivinhar 3. O hardware não ultrapassa os limites: mesmo que você use apenas metade do último Tile, a capacidade de processamento ainda é cobrada como se fosse um Tile inteiro.
Antes, a decodificação por especulação era um pacote de aceleração adicionado posteriormente pela equipe de engenharia, após o modelo ser treinado e lançado. Mas agora, as leis físicas subjacentes lhe dizem: uma constante da matriz de hardware foi diretamente retroalimentada nos parâmetros de design da arquitetura do modelo.
Na nossa memória, raramente vemos fabricantes de chips inserirem equações de restrição de hardware subjacente diretamente no projeto de um grande modelo.
Epílogo
O foco da competição pela eficiência de execução do modelo mudou completamente.
A era de simplesmente acumular grandes parâmetros está chegando ao fim; agora, o verdadeiro fator decisivo é quem entende melhor os limites físicos daquele pedaço de silício sob os pés.
Neste novo campo de jogo onde gigantes de chips inverteram as regras, a equipe chinesa já se tornou silenciosamente a resposta padrão para a ruptura.
Um gigante de computação como a NVIDIA naturalmente não se importa com qual algoritmo está na prateleira.
Mas quem foi o autor desta solução ótima que espreme até o limite dos waferes? Está escrito em preto e branco, bem claro.
Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI
