Google DeepMindの論文が、リサイクル法がTransformerのパフォーマンスを向上させることを明らかに

iconCryptoBriefing
共有
AI summary icon概要
Google DeepMindは、トランスフォーマーモデルの性能を向上させるための「リサーキュレーション」という手法を導入する新しい論文を公開しました。この技術は、推論中に深い層のアクティベーションを以前の層にフィードバックすることで、再学習なしに性能を向上させます。オンチェーンニュースによると、この手法はGSM8Kベンチマークでパープレキシティを23%削減し、推論精度を21%向上させました。ただし、初期処理コストが上昇します。暗号通貨ニュースメディアは、この技術がブロックチェーンアプリケーションにおけるAIの効率向上に潜在的な可能性をもたらすと注目しています。

Google DeepMindは、言語モデルがテキストを処理する方法を静かに変える可能性のある論文を公開しました。この手法は「リサーキュレーション」と呼ばれ、トランスフォーマーの深い層からのアクティベーションを推論中に浅い層に再び混ぜ合わせます。テキサス大学オースティン校の研究者らと共同で執筆されたこの論文は、この軽量な再帰的接続が、完全なファインチューニングと同等、あるいは場合によってはそれ以上の性能向上をもたらすことを実証しています。再学習は不要で、アーキテクチャの大規模な変更も必要ありません。

再循環が実際に何を行うか

リサイクルは、トランスフォーマー処理の一方通行の流れを打破する。モデルのより深い層で計算された活性化の一部が、トークン生成中により浅い層にフィードバックされる。これにより、モデルは自らの内部表現を再び理解する機会を得て、論文で「信念状態」と呼ぶものを複数のステップにわたって洗練することが可能になる。

リサーキュレーションの従来のアプローチ(例:チェインオブソースプロンプティングやループ型トランスフォーマーアーキテクチャ)との主な違いは、追加の推論トークンやアーキテクチャの厚さを必要としない点です。これはモデル自体の再設計ではなく、推論の実行方法への追加的な変更です。

広告

その数字は無視できない

DeepMindチームは、Gemma3モデルファミリー(1B、4B、12Bパラメータ版を含む)においてリサーキュレーションをテストしました。基本的なリサーキュレーションにより、9つの言語モデリングデータセットでパープレキシティが約8.5%低下し、生成中の遅延はゼロでした。

適応的再循環をさらに進化させ、同じ9つのデータセット全体でパープレキシティの平均削減率が23%を達成。比較として、フルファインチューニングでは21.6%の削減にとどまった。推論タスクでは、GSM8Kベンチマークで適応的再循環により精度が21%相対的に向上した。

トレードオフがあります。モデルが初期プロンプトを処理するプリフィル処理の段階は、再循環により直列化され、プロンプト処理の初期コストが増加します。

なぜAIコミュニティが注目しているのか

arXiv:2608.17981として掲載された論文は、すでに独立して再現されています。GitHub上の実装により、Gemmaファミリー以外のモデル、特にLlama 3.2 1Bにおいても性能向上が確認されています。この議論は、X上および中国のテクノロジーメディアプラットフォームで広がっています。

リサーキュレーションは、トークン生成の表面よりも下位のアクティベーションレベルで動作するため、チェインオブソースリーズニングのような出力トークンを消費し、遅延を追加するプロンプティング手法と補完的であり、競合するものではありません。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。