Meta AI Mengidentifikasi Tantangan dalam Pembelajaran Penguatan untuk Optimalisasi Kecepatan Kode

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
Berita AI + kripto dari tim FAIR Meta AI menunjukkan bahwa reinforcement learning menghadapi hambatan dalam optimasi kecepatan kode akibat timing yang berisik, reward yang jarang, dan ketidakstabilan. Tim tersebut meluncurkan DMC-Optim, sebuah benchmark yang menggabungkan kebenaran dan kecepatan, meningkatkan tingkat keberhasilan untuk model seperti Qwen 2.5 7B dan CWM 32B. Pencatatan token baru tetap menjadi fokus utama bagi para trader yang mengikuti perkembangan AI.

Mengajari AI untuk menulis kode yang berfungsi adalah satu hal. Mengajari AI untuk menulis kode yang berfungsi cepat ternyata merupakan hal yang sama sekali berbeda.

Sebuah makalah baru dari tim FAIR Meta AI, yang diterbitkan pada 29 Juli, mengungkapkan bahwa memperluas pembelajaran penguatan dari kebenaran kode ke optimasi kecepatan kode penuh dengan masalah yang tidak dapat ditangani oleh pendekatan standar. Pelakunya: pengukuran waktu yang berisik, imbalan yang jarang, dan algoritma yang runtuh ketika Anda meminta mereka untuk peduli pada kinerja, bukan hanya akurasi.

Masalah dengan kecepatan

Ketika Anda mengukur apakah kode menghasilkan jawaban yang benar, Anda mendapatkan sinyal biner yang bersih. Tetapi mengukur seberapa cepat kode berjalan itu rumit. Jalankan kode yang sama dua kali di mesin yang sama dan Anda akan mendapatkan waktu eksekusi yang sedikit berbeda. Proses latar belakang, penjadwalan CPU, alokasi memori, semuanya memperkenalkan kebisingan ke dalam pengukuran waktu.

Iklan

Tim Meta menemukan bahwa Generalized Reinforcement Policy Optimization, atau GRPO, algoritma standar dalam toolkit reinforcement learning, menjadi tidak stabil ketika Anda memberinya pengukuran kecepatan berisik jenis ini.

Kesparsean hadiah memperparah masalah ini. Sebagian besar optimasi kode menghasilkan peningkatan kecepatan yang kecil, yang berarti model jarang mendapatkan sinyal positif kuat yang memberitahunya “ya, perubahan itu membuat segalanya lebih cepat.”

DMC-Optim: tolok ukur baru untuk masalah baru

Untuk mengatasi tantangan-tantangan ini, para peneliti membangun DMC-Optim, sebuah benchmark yang menampilkan lingkungan sandbox yang dikalibrasi dan pipeline pelatihan khusus. Sistem ini menggabungkan reward untuk baik kebenaran maupun kecepatan eksekusi dalam simulator offline, pada dasarnya menciptakan lingkungan terkendali di mana noise waktu dapat dikelola daripada diabaikan.

Hasilnya sulit dibantah. Tingkat kelulusan untuk Qwen 2.5 7B melonjak dari 18,0% menjadi 31,3%, peningkatan relatif sekitar 74%. CWM 32B melihat tingkat kelulusannya naik dari 30,7% menjadi 50,4%, peningkatan relatif 64%. Pada benchmark LCB, CWM 32B yang dilatih dengan pendekatan ini mengalahkan perbandingan kecepatan median sebanyak 83% dari waktu, dibandingkan dengan model yang dilatih dengan reinforcement learning standar dari imbalan yang dapat diverifikasi.

Dalam kondisi waktu yang terdegradasi, di mana noise pengukuran sengaja diperbesar, benchmark DMC-Optim menunjukkan peningkatan kinerja antara 100% hingga 200% dibandingkan metode standar.

Makalah ini ditulis oleh Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot, dan Gabriel Synnaeve, semua dari Meta AI.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.