Google DeepMind 剛發表了一篇論文,可能悄然改變語言模型處理文字的方式。這項稱為「recirculation」的技術,會在推理過程中,將變壓器較深層的激活值混合回較淺層。這篇由德克薩斯大學奧斯汀分校研究人員共同撰寫的論文顯示,這種輕量級的循環連接能帶來與完整微調相當,甚至在某些情況下超越微調的性能提升。無需重新訓練,無需重大架構調整。
什麼是循環實際所做的
迴圈機制打破了變壓器處理的單向流動。在生成標記的過程中,模型較深層次計算出的部分激活值會被反饋至較淺層次。這使得模型能夠對自身的內部表示進行第二次處理,從而跨多個步驟優化論文所稱的「信念狀態」。
與現有的方法(如鏈式思維提示或迴圈變壓器架構)的主要區別在於,再循環無需額外的推理標記或增加架構深度。它只是對推理運行方式的一種附加修改,而非對模型本身的重新設計。
這些數字很難忽視
DeepMind 團隊在 Gemma3 模型系列中測試了循環機制,包括 1B、4B 和 12B 參數版本。基本循環機制在九個語言建模數據集上使困惑度降低了約 8.5%,且在生成過程中無任何額外延遲。
自適應循環進一步推進,在相同的九個數據集上使困惑度平均降低 23%。作為參考,完整微調僅實現了 21.6% 的降低。在推理任務中,GSM8K 基準測試的準確率相對提升了 21%。
這存在一種權衡。在迴圈重複下,預填充處理(模型消化初始提示的階段)會變為序列化,從而增加處理提示的前期成本。
為何 AI 社區正在關注
該論文編號為 arXiv:2608.17981,已獲得獨立重現。GitHub 上的實現已確認在 Gemma 系列以外的模型上取得進展,包括 Llama 3.2 1B。相關討論已在 X 平台的研究社群及中國科技媒體平台上廣泛 spread。
重複使用在啟用層級運作,位於令牌生成層面之下,因此與提示技術(如鏈式思維推理)互為補充,而非競爭關係,後者會消耗輸出令牌並增加延遲。
