El artículo de Google DeepMind revela que el método de recirculación mejora el rendimiento de los transformadores

iconCryptoBriefing
Compartir
AI summary iconResumen
Google DeepMind lanzó un nuevo artículo que presenta un método llamado "recirculation" para mejorar los modelos transformer. La técnica envía las activaciones de capas más profundas de vuelta a capas anteriores durante la inferencia, mejorando el rendimiento sin necesidad de reentrenar. Los informes de noticias on-chain muestran que el método redujo la perplexidad en un 23% y mejoró la precisión del razonamiento en un 21% en el benchmark GSM8K. Sin embargo, aumenta los costos iniciales de procesamiento. Los medios de noticias cripto destacan el potencial de ganancias de eficiencia de IA en aplicaciones de cadena de bloques.

Google DeepMind acaba de publicar un artículo que podría cambiar silenciosamente la forma en que los modelos de lenguaje procesan el texto. La técnica, llamada “recirculación”, toma las activaciones de las capas más profundas de un transformer y las mezcla de nuevo en sus capas más superficiales durante la inferencia. El artículo, coautorizado por investigadores de la Universidad de Texas en Austin, demuestra que esta conexión recurrente ligera ofrece mejoras de rendimiento que compiten, y en algunos casos superan, el ajuste completo. Sin necesidad de volver a entrenar. Sin cirugía arquitectónica importante.

Qué hace realmente la recirculación

La recirculación rompe el flujo unidireccional del procesamiento del transformador. Una fracción de las activaciones calculadas en las capas más profundas del modelo se devuelve a las capas más superficiales durante la generación de tokens. El modelo obtiene esencialmente una segunda oportunidad para comprender sus propias representaciones internas, lo que le permite refinar lo que el artículo denomina sus "estados de creencia" en múltiples pasos.

La distinción clave respecto a enfoques existentes como el prompting en cadena de pensamiento o arquitecturas de transformadores con bucle es que la recirculación no requiere tokens de razonamiento adicionales ni mayor profundidad arquitectónica. Es una modificación adicional al funcionamiento de la inferencia, no un rediseño del modelo en sí.

Anuncio

Los números son difíciles de ignorar

El equipo de DeepMind probó la recirculación en la familia de modelos Gemma3, incluyendo variantes de 1B, 4B y 12B parámetros. La recirculación básica logró una reducción aproximada del 8,5% en la perplexidad en nueve conjuntos de datos de modelado de lenguaje, con cero latencia adicional durante la generación.

La recirculación adaptativa se impulsó aún más, logrando una reducción media del 23% en la perplexidad en esos mismos nueve conjuntos de datos. Para contexto, el ajuste completo solo logró una reducción del 21,6%. En tareas de razonamiento, el benchmark GSM8K experimentó un aumento relativo del 21% en la precisión con la recirculación adaptativa.

Hay un compromiso. El procesamiento de prellenado, la etapa en la que el modelo procesa la prompt inicial, se vuelve serial bajo recirculación, aumentando el costo inicial de procesar una prompt.

Por qué la comunidad de IA está prestando atención

El artículo, listado como arXiv:2608.17981, ya ha sido reproducido independientemente. Las implementaciones en GitHub han confirmado las mejoras en modelos fuera de la familia Gemma, incluyendo Llama 3.2 1B. Las discusiones se han extendido por las comunidades de investigación en X y plataformas de medios tecnológicos chinos.

La recirculación opera a nivel de activación, por debajo de la superficie de generación de tokens, lo que la hace complementaria en lugar de competitiva con técnicas de indicación como el razonamiento de cadena de pensamiento, que consumen tokens de salida y añaden latencia.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.