AIに動作するコードを書かせることは一つのことで、動作が高速なコードを書かせることは、明らかにまったく別の課題である。
7月29日に発表されたMeta AIのFAIRチームによる新しい論文は、強化学習をコードの正しさからコードの速度最適化へ拡張すると、標準的なアプローチでは対処できない多くの問題が生じることを明らかにしています。その原因は、ノイズの多いタイミング測定、スパースな報酬、そして性能を重視するよう求められたときに破綻するアルゴリズムです。
速度の問題
コードが正しい答えを生成しているかを測定すると、明確なバイナリ信号が得られます。しかし、コードの実行速度を測定するのは複雑です。同じマシンで同じコードを二回実行すると、実行時間がわずかに異なります。バックグラウンドプロセス、CPUスケジューリング、メモリ割り当てなどが、タイミング測定にノイズをもたらします。
Metaチームは、強化学習のツールキットに含まれる標準的なアルゴリズムである一般化強化方策最適化(GRPO)が、このようなノイズの多い速度測定値を入力すると不安定になることを発見しました。
報酬の希薄さが問題を悪化させます。ほとんどのコード最適化はわずかな速度向上しかもたらさないため、モデルは「はい、この変更で速くなりました」という強い正のシグナルをめったに得られません。
DMC-Optim:新しい問題に対する新しいベンチマーク
これらの課題に対処するために、研究者は、キャリブレーション済みのサンドボックス環境と専用のトレーニングパイプラインを備えたDMC-Optimというベンチマークを構築しました。このシステムは、オフラインシミュレーター内で正確性と実行速度の両方の報酬を組み合わせ、タイミングノイズを無視するのではなく管理できる制御された環境を実現しています。
結果は議論の余地がありません。Qwen 2.5 7Bの合格率は18.0%から31.3%へと上昇し、約74%の相対的改善を達成しました。CWM 32Bの合格率は30.7%から50.4%へと上昇し、64%の相対的向上を記録しました。LCBベンチマークでは、このアプローチで学習されたCWM 32Bは、検証可能な報酬による標準的な強化学習で学習されたモデルと比較して、83%の頻度で中央値の速度を上回りました。
測定ノイズを意図的に増幅した劣化したタイミング条件において、DMC-Optimベンチマークは標準的な手法と比較して100%から200%の性能向上を示しました。
この論文は、Meta AIのピエール・シャモン、鄭坤浩、ジュリエット・デクギス、ベノワ・サゴ、ガブリエル・シンナエーブによって執筆されました。
