Google DeepMind acaba de publicar un artículo que podría cambiar silenciosamente la forma en que los modelos de lenguaje procesan el texto. La técnica, llamada “recirculación”, toma las activaciones de las capas más profundas de un transformer y las mezcla de nuevo en sus capas más superficiales durante la inferencia. El artículo, coautorizado por investigadores de la Universidad de Texas en Austin, demuestra que esta conexión recurrente ligera ofrece mejoras de rendimiento que compiten, y en algunos casos superan, el ajuste completo. Sin necesidad de volver a entrenar. Sin cirugía arquitectónica importante.
Qué hace realmente la recirculación
La recirculación rompe el flujo unidireccional del procesamiento del transformador. Una fracción de las activaciones calculadas en las capas más profundas del modelo se devuelve a las capas más superficiales durante la generación de tokens. El modelo obtiene esencialmente una segunda oportunidad para comprender sus propias representaciones internas, lo que le permite refinar lo que el artículo denomina sus "estados de creencia" en múltiples pasos.
La distinción clave respecto a enfoques existentes como el prompting en cadena de pensamiento o arquitecturas de transformadores con bucle es que la recirculación no requiere tokens de razonamiento adicionales ni mayor profundidad arquitectónica. Es una modificación adicional al funcionamiento de la inferencia, no un rediseño del modelo en sí.
Los números son difíciles de ignorar
El equipo de DeepMind probó la recirculación en la familia de modelos Gemma3, incluyendo variantes de 1B, 4B y 12B parámetros. La recirculación básica logró una reducción aproximada del 8,5% en la perplexidad en nueve conjuntos de datos de modelado de lenguaje, con cero latencia adicional durante la generación.
La recirculación adaptativa se impulsó aún más, logrando una reducción media del 23% en la perplexidad en esos mismos nueve conjuntos de datos. Para contexto, el ajuste completo solo logró una reducción del 21,6%. En tareas de razonamiento, el benchmark GSM8K experimentó un aumento relativo del 21% en la precisión con la recirculación adaptativa.
Hay un compromiso. El procesamiento de prellenado, la etapa en la que el modelo procesa la prompt inicial, se vuelve serial bajo recirculación, aumentando el costo inicial de procesar una prompt.
Por qué la comunidad de IA está prestando atención
El artículo, listado como arXiv:2608.17981, ya ha sido reproducido independientemente. Las implementaciones en GitHub han confirmado las mejoras en modelos fuera de la familia Gemma, incluyendo Llama 3.2 1B. Las discusiones se han extendido por las comunidades de investigación en X y plataformas de medios tecnológicos chinos.
La recirculación opera a nivel de activación, por debajo de la superficie de generación de tokens, lo que la hace complementaria en lugar de competitiva con técnicas de indicación como el razonamiento de cadena de pensamiento, que consumen tokens de salida y añaden latencia.
