Mengajar AI untuk menulis kod yang berfungsi adalah satu perkara. Mengajarnya untuk menulis kod yang berfungsi cepat adalah, jelas, haiwan yang sama sekali berbeza.
Sebuah kertas baru daripada pasukan FAIR Meta AI, yang diterbitkan pada 29 Julai, menunjukkan bahawa memperluaskan pembelajaran penkuatan dari kebetulan kod kepada pengoptimuman kelajuan kod penuh dengan masalah yang tidak dapat ditangani oleh pendekatan standard. Penyebabnya: pengukuran masa yang bising, ganjaran jarang, dan algoritma yang runtuh apabila anda meminta mereka untuk memperhatikan prestasi, bukan hanya ketepatan.
Masalah dengan kelajuan
Apabila anda mengukur sama ada kod menghasilkan jawapan yang betul, anda akan mendapat isyarat binari yang bersih. Tetapi mengukur seberapa pantas kod berjalan adalah rumit. Jalankan kod yang sama dua kali pada mesin yang sama dan anda akan mendapat masa pelaksanaan yang sedikit berbeza. Proses latar belakang, penjadualan CPU, pengagihan memori, semuanya memperkenalkan gangguan ke dalam pengukuran masa.
Pasukan Meta mendapati bahawa Generalized Reinforcement Policy Optimization, atau GRPO, algoritma piawai dalam toolkit pembelajaran penguatan, menjadi tidak stabil apabila anda memberinya pengukuran kelajuan bising jenis ini.
Kesengsaraan ganjaran memperburuk isu ini. Kebanyakan pengoptimuman kod menghasilkan peningkatan kelajuan yang sederhana, bermakna model jarang mendapat isyarat positif yang kuat yang memberitahunya “ya, perubahan itu membuatkan segalanya lebih cepat.”
DMC-Optim: tolok ukur baharu untuk masalah baharu
Untuk mengatasi cabaran-cabaran ini, penyelidik membina DMC-Optim, satu piawaian yang menampilkan persekitaran sandbox yang dikalibrasi dan saluran latihan khas. Sistem ini menggabungkan ganjaran untuk ketepatan dan kelajuan pelaksanaan dalam simulator luar talian, pada dasarnya mencipta persekitaran terkawal di mana gangguan masa boleh dikendalikan bukan diabaikan.
Keputusan ini sukar untuk dipertikaikan. Kadar lulus untuk Qwen 2.5 7B meningkat dari 18.0% kepada 31.3%, peningkatan relatif sekitar 74%. CWM 32B melihat kadar lulusnya naik dari 30.7% kepada 50.4%, keuntungan relatif sebanyak 64%. Dalam tolok LCB, CWM 32B yang dilatih dengan pendekatan ini mengalahkan perbandingan kelajuan median sebanyak 83% daripada model yang dilatih dengan pembelajaran peneguhan biasa daripada ganjaran yang boleh disahkan.
Dalam keadaan masa yang terjejas, di mana gangguan pengukuran sengaja diperbesar, piawaian DMC-Optim menunjukkan peningkatan prestasi antara 100% hingga 200% berbanding kaedah biasa.
Kertas itu ditulis oleh Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot, dan Gabriel Synnaeve, semua daripada Meta AI.
