Google DeepMind только что опубликовала статью, которая может тихо изменить способ, которым языковые модели обрабатывают текст. Техника, называемая «рециркуляцией», берет активации из более глубоких слоев трансформера и смешивает их обратно в более поверхностные слои во время вывода. Статья, написанная совместно с исследователями из Университета Техаса в Остине, демонстрирует, что этот легкий рекуррентный связь обеспечивает прирост производительности, сопоставимый с полной дообучкой и в некоторых случаях превосходящий его. Не требуется повторное обучение. Не требуется значительная архитектурная операция.
Что на самом деле делает рециркуляция
Рекуррентность нарушает односторонний поток обработки в трансформере. Доля активаций, вычисленных в более глубоких слоях модели, возвращается обратно в более поверхностные слои во время генерации токенов. Модель получает вторую возможность проанализировать свои собственные внутренние представления, что позволяет ей уточнить так называемые «состояния убеждений», о которых говорится в статье, на нескольких этапах.
Ключевое отличие от существующих подходов, таких как пошаговое подсказывание или циклические архитектуры трансформеров, заключается в том, что рекиркуляция не требует дополнительных токенов рассуждения или увеличения архитектурной глубины. Это дополнительное изменение способа выполнения вывода, а не переработка самой модели.
Числа невозможно игнорировать
Команда DeepMind протестировала рекуррентную обработку на семействе моделей Gemma3, включая варианты с 1B, 4B и 12B параметрами. Базовая рекуррентная обработка обеспечила примерно 8,5%-е снижение перплексии на девяти наборах данных для языкового моделирования при нулевой дополнительной задержке во время генерации.
Адаптивная рециркуляция была дальнейшим образом улучшена, обеспечив среднее снижение перплексии на 23% на тех же девяти наборах данных. Для сравнения, полная дообучка позволила достичь снижения только на 21,6%. В задачах на рассуждение benchmark GSM8K показал относительное повышение точности на 21% с использованием адаптивной рециркуляции.
Существует компромисс. Обработка предварительной загрузки — этап, на котором модель анализирует начальный запрос, — становится последовательной при рекиркуляции, что увеличивает начальные затраты на обработку запроса.
Почему сообщество ИИ обращает внимание
Статья, указанная как arXiv:2608.17981, уже была независимо воспроизведена. Реализации на GitHub подтвердили повышение производительности на моделях вне семейства Gemma, включая Llama 3.2 1B. Обсуждения распространились среди исследовательских сообществ на X и китайских технологических платформах.
Рециркуляция работает на уровне активации, ниже поверхности генерации токенов, что делает её дополнительной, а не конкурирующей с методами запросов, такими как рассуждение по цепочке, которые потребляют выходные токены и добавляют задержку.
