Google DeepMindは、言語モデルがテキストを処理する方法を静かに変える可能性のある論文を公開しました。この手法は「リサーキュレーション」と呼ばれ、トランスフォーマーの深い層からのアクティベーションを推論中に浅い層に再び混ぜ合わせます。テキサス大学オースティン校の研究者らと共同で執筆されたこの論文は、この軽量な再帰的接続が、完全なファインチューニングと同等、あるいは場合によってはそれ以上の性能向上をもたらすことを実証しています。再学習は不要で、アーキテクチャの大規模な変更も必要ありません。
再循環が実際に何を行うか
リサイクルは、トランスフォーマー処理の一方通行の流れを打破する。モデルのより深い層で計算された活性化の一部が、トークン生成中により浅い層にフィードバックされる。これにより、モデルは自らの内部表現を再び理解する機会を得て、論文で「信念状態」と呼ぶものを複数のステップにわたって洗練することが可能になる。
リサーキュレーションの従来のアプローチ(例:チェインオブソースプロンプティングやループ型トランスフォーマーアーキテクチャ)との主な違いは、追加の推論トークンやアーキテクチャの厚さを必要としない点です。これはモデル自体の再設計ではなく、推論の実行方法への追加的な変更です。
その数字は無視できない
DeepMindチームは、Gemma3モデルファミリー(1B、4B、12Bパラメータ版を含む)においてリサーキュレーションをテストしました。基本的なリサーキュレーションにより、9つの言語モデリングデータセットでパープレキシティが約8.5%低下し、生成中の遅延はゼロでした。
適応的再循環をさらに進化させ、同じ9つのデータセット全体でパープレキシティの平均削減率が23%を達成。比較として、フルファインチューニングでは21.6%の削減にとどまった。推論タスクでは、GSM8Kベンチマークで適応的再循環により精度が21%相対的に向上した。
トレードオフがあります。モデルが初期プロンプトを処理するプリフィル処理の段階は、再循環により直列化され、プロンプト処理の初期コストが増加します。
なぜAIコミュニティが注目しているのか
arXiv:2608.17981として掲載された論文は、すでに独立して再現されています。GitHub上の実装により、Gemmaファミリー以外のモデル、特にLlama 3.2 1Bにおいても性能向上が確認されています。この議論は、X上および中国のテクノロジーメディアプラットフォームで広がっています。
リサーキュレーションは、トークン生成の表面よりも下位のアクティベーションレベルで動作するため、チェインオブソースリーズニングのような出力トークンを消費し、遅延を追加するプロンプティング手法と補完的であり、競合するものではありません。
