Google DeepMind 論文揭示循環方法提升 Transformer 效能

iconCryptoBriefing
分享
AI summary icon精華摘要
Google DeepMind 發布了一篇新論文,介紹了一種稱為「recirculation」的方法,以提升 transformer 模型的表現。該技術在推論期間將較深層的激活值反饋至較早的層,無需重新訓練即可提升效能。鏈上新聞報導指出,該方法在 GSM8K 基準測試中將困惑度降低了 23%,並提升了 21% 的推理準確率。然而,它也提高了初始處理成本。加密貨幣新聞媒體強調了此技術在區塊鏈應用中提升 AI 效率的潛力。

Google DeepMind 剛發表了一篇論文,可能悄然改變語言模型處理文字的方式。這項稱為「recirculation」的技術,會在推理過程中,將變壓器較深層的激活值混合回較淺層。這篇由德克薩斯大學奧斯汀分校研究人員共同撰寫的論文顯示,這種輕量級的循環連接能帶來與完整微調相當,甚至在某些情況下超越微調的性能提升。無需重新訓練,無需重大架構調整。

什麼是循環實際所做的

迴圈機制打破了變壓器處理的單向流動。在生成標記的過程中,模型較深層次計算出的部分激活值會被反饋至較淺層次。這使得模型能夠對自身的內部表示進行第二次處理,從而跨多個步驟優化論文所稱的「信念狀態」。

與現有的方法(如鏈式思維提示或迴圈變壓器架構)的主要區別在於,再循環無需額外的推理標記或增加架構深度。它只是對推理運行方式的一種附加修改,而非對模型本身的重新設計。

廣告

這些數字很難忽視

DeepMind 團隊在 Gemma3 模型系列中測試了循環機制,包括 1B、4B 和 12B 參數版本。基本循環機制在九個語言建模數據集上使困惑度降低了約 8.5%,且在生成過程中無任何額外延遲。

自適應循環進一步推進,在相同的九個數據集上使困惑度平均降低 23%。作為參考,完整微調僅實現了 21.6% 的降低。在推理任務中,GSM8K 基準測試的準確率相對提升了 21%。

這存在一種權衡。在迴圈重複下,預填充處理(模型消化初始提示的階段)會變為序列化,從而增加處理提示的前期成本。

為何 AI 社區正在關注

該論文編號為 arXiv:2608.17981,已獲得獨立重現。GitHub 上的實現已確認在 Gemma 系列以外的模型上取得進展,包括 Llama 3.2 1B。相關討論已在 X 平台的研究社群及中國科技媒體平台上廣泛 spread。

重複使用在啟用層級運作,位於令牌生成層面之下,因此與提示技術(如鏈式思維推理)互為補充,而非競爭關係,後者會消耗輸出令牌並增加延遲。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露