Meta AI、コード速度最適化における強化学習の課題を特定

iconCryptoBriefing
共有
AI summary icon概要
Meta AIのFAIRチームによるAIと暗号通貨のニュースでは、強化学習がコード速度最適化において、ノイズの多いタイミング、スパースな報酬、不安定性という課題に直面していることが示されています。同チームは、正しさと速度を組み合わせたベンチマーク「DMC-Optim」をリリースし、Qwen 2.5 7BやCWM 32Bなどのモデルのパス率を向上させました。AIの進歩を追跡するトレーダーにとって、新規トークンの上場は引き続き重要な焦点です。

AIに動作するコードを書かせることは一つのことで、動作が高速なコードを書かせることは、明らかにまったく別の課題である。

7月29日に発表されたMeta AIのFAIRチームによる新しい論文は、強化学習をコードの正しさからコードの速度最適化へ拡張すると、標準的なアプローチでは対処できない多くの問題が生じることを明らかにしています。その原因は、ノイズの多いタイミング測定、スパースな報酬、そして性能を重視するよう求められたときに破綻するアルゴリズムです。

速度の問題

コードが正しい答えを生成しているかを測定すると、明確なバイナリ信号が得られます。しかし、コードの実行速度を測定するのは複雑です。同じマシンで同じコードを二回実行すると、実行時間がわずかに異なります。バックグラウンドプロセス、CPUスケジューリング、メモリ割り当てなどが、タイミング測定にノイズをもたらします。

広告

Metaチームは、強化学習のツールキットに含まれる標準的なアルゴリズムである一般化強化方策最適化(GRPO)が、このようなノイズの多い速度測定値を入力すると不安定になることを発見しました。

報酬の希薄さが問題を悪化させます。ほとんどのコード最適化はわずかな速度向上しかもたらさないため、モデルは「はい、この変更で速くなりました」という強い正のシグナルをめったに得られません。

DMC-Optim:新しい問題に対する新しいベンチマーク

これらの課題に対処するために、研究者は、キャリブレーション済みのサンドボックス環境と専用のトレーニングパイプラインを備えたDMC-Optimというベンチマークを構築しました。このシステムは、オフラインシミュレーター内で正確性と実行速度の両方の報酬を組み合わせ、タイミングノイズを無視するのではなく管理できる制御された環境を実現しています。

結果は議論の余地がありません。Qwen 2.5 7Bの合格率は18.0%から31.3%へと上昇し、約74%の相対的改善を達成しました。CWM 32Bの合格率は30.7%から50.4%へと上昇し、64%の相対的向上を記録しました。LCBベンチマークでは、このアプローチで学習されたCWM 32Bは、検証可能な報酬による標準的な強化学習で学習されたモデルと比較して、83%の頻度で中央値の速度を上回りました。

測定ノイズを意図的に増幅した劣化したタイミング条件において、DMC-Optimベンチマークは標準的な手法と比較して100%から200%の性能向上を示しました。

この論文は、Meta AIのピエール・シャモン、鄭坤浩、ジュリエット・デクギス、ベノワ・サゴ、ガブリエル・シンナエーブによって執筆されました。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。