O Google DeepMind acabou de publicar um artigo que pode alterar silenciosamente a forma como os modelos de linguagem processam texto. A técnica, chamada de “recirculação”, pega ativações das camadas mais profundas de um transformer e as mistura de volta às camadas mais rasas durante a inferência. O artigo, coautorizado por pesquisadores da Universidade do Texas em Austin, demonstra que essa conexão recorrente leve oferece ganhos de desempenho que rivalizam e, em alguns casos, superam o fine-tuning completo. Nenhum retrinamento necessário. Nenhuma cirurgia arquitetônica significativa.
O que a recirculação realmente faz
A recirculação quebra o fluxo unidirecional do processamento do transformer. Uma fração das ativações calculadas nas camadas mais profundas do modelo é retornada às camadas mais rasas durante a geração de tokens. O modelo, essencialmente, tem uma segunda passagem para compreender suas próprias representações internas, permitindo-lhe refinar o que o artigo chama de seus “estados de crença” em múltiplos passos.
A principal distinção em relação a abordagens existentes, como prompting em cadeia de pensamento ou arquiteturas de transformador em loop, é que a recirculação não exige tokens adicionais de raciocínio nem aumento na profundidade arquitetural. É uma modificação acoplada ao modo como a inferência é executada, não um redesenho do modelo em si.
Os números são difíceis de ignorar
A equipe do DeepMind testou a recirculação na família de modelos Gemma3, incluindo variantes de 1B, 4B e 12B parâmetros. A recirculação básica resultou em uma redução aproximada de 8,5% na perplexidade em nove conjuntos de dados de modelagem de linguagem, com latência zero adicionada durante a geração.
A recirculação adaptativa foi aprimorada, alcançando uma redução média de 23% na perplexidade nos mesmos nove conjuntos de dados. Para contexto, o ajuste completo apenas conseguiu uma redução de 21,6%. Em tarefas de raciocínio, o benchmark GSM8K apresentou um aumento relativo de 21% na precisão com a recirculação adaptativa.
Há um compromisso. O processamento de pré-carregamento, a fase em que o modelo processa a prompt inicial, torna-se serial sob recirculação, aumentando o custo inicial de processamento de uma prompt.
Por que a comunidade de IA está prestando atenção
O artigo, listado como arXiv:2608.17981, já foi reproduzido independentemente. Implementações no GitHub confirmaram os ganhos em modelos fora da família Gemma, incluindo o Llama 3.2 1B. Discussões se espalharam pelas comunidades de pesquisa no X e em plataformas de mídia tecnológica chinesa.
A recirculação opera no nível de ativação, abaixo da superfície de geração de tokens, o que a torna complementar a, e não competitiva com, técnicas de prompt, como o raciocínio em cadeia, que consomem tokens de saída e adicionam latência.
