Meta AI Mengenal Cabaran dalam Pembelajaran Penguatan untuk Pengoptimuman Kelajuan Kod

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
Berita AI + kripto daripada pasukan FAIR Meta AI menunjukkan pembelajaran penguatan menghadapi rintangan dalam pengoptimuman kelajuan kod akibat ketidakpastian masa, ganjaran jarang, dan ketidakstabilan. Pasukan tersebut melancarkan DMC-Optim, satu tolok ukur yang menggabungkan kebetulan dan kelajuan, meningkatkan kadar lulus untuk model seperti Qwen 2.5 7B dan CWM 32B. Pelancaran token baharu tetap menjadi fokus utama pedagang yang memantau perkembangan AI.

Mengajar AI untuk menulis kod yang berfungsi adalah satu perkara. Mengajarnya untuk menulis kod yang berfungsi cepat adalah, jelas, haiwan yang sama sekali berbeza.

Sebuah kertas baru daripada pasukan FAIR Meta AI, yang diterbitkan pada 29 Julai, menunjukkan bahawa memperluaskan pembelajaran penkuatan dari kebetulan kod kepada pengoptimuman kelajuan kod penuh dengan masalah yang tidak dapat ditangani oleh pendekatan standard. Penyebabnya: pengukuran masa yang bising, ganjaran jarang, dan algoritma yang runtuh apabila anda meminta mereka untuk memperhatikan prestasi, bukan hanya ketepatan.

Masalah dengan kelajuan

Apabila anda mengukur sama ada kod menghasilkan jawapan yang betul, anda akan mendapat isyarat binari yang bersih. Tetapi mengukur seberapa pantas kod berjalan adalah rumit. Jalankan kod yang sama dua kali pada mesin yang sama dan anda akan mendapat masa pelaksanaan yang sedikit berbeza. Proses latar belakang, penjadualan CPU, pengagihan memori, semuanya memperkenalkan gangguan ke dalam pengukuran masa.

Iklan

Pasukan Meta mendapati bahawa Generalized Reinforcement Policy Optimization, atau GRPO, algoritma piawai dalam toolkit pembelajaran penguatan, menjadi tidak stabil apabila anda memberinya pengukuran kelajuan bising jenis ini.

Kesengsaraan ganjaran memperburuk isu ini. Kebanyakan pengoptimuman kod menghasilkan peningkatan kelajuan yang sederhana, bermakna model jarang mendapat isyarat positif yang kuat yang memberitahunya “ya, perubahan itu membuatkan segalanya lebih cepat.”

DMC-Optim: tolok ukur baharu untuk masalah baharu

Untuk mengatasi cabaran-cabaran ini, penyelidik membina DMC-Optim, satu piawaian yang menampilkan persekitaran sandbox yang dikalibrasi dan saluran latihan khas. Sistem ini menggabungkan ganjaran untuk ketepatan dan kelajuan pelaksanaan dalam simulator luar talian, pada dasarnya mencipta persekitaran terkawal di mana gangguan masa boleh dikendalikan bukan diabaikan.

Keputusan ini sukar untuk dipertikaikan. Kadar lulus untuk Qwen 2.5 7B meningkat dari 18.0% kepada 31.3%, peningkatan relatif sekitar 74%. CWM 32B melihat kadar lulusnya naik dari 30.7% kepada 50.4%, keuntungan relatif sebanyak 64%. Dalam tolok LCB, CWM 32B yang dilatih dengan pendekatan ini mengalahkan perbandingan kelajuan median sebanyak 83% daripada model yang dilatih dengan pembelajaran peneguhan biasa daripada ganjaran yang boleh disahkan.

Dalam keadaan masa yang terjejas, di mana gangguan pengukuran sengaja diperbesar, piawaian DMC-Optim menunjukkan peningkatan prestasi antara 100% hingga 200% berbanding kaedah biasa.

Kertas itu ditulis oleh Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot, dan Gabriel Synnaeve, semua daripada Meta AI.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.