Natukoy ng Meta AI ang mga hamon sa reinforcement learning para sa pag-optimize ng bilis ng code

iconCryptoBriefing
I-share
AI summary iconSummary
Ang AI + balita sa crypto mula sa FAIR team ng Meta AI ay nagpapakita na ang reinforcement learning ay nakakaranas ng mga hamon sa code speed optimization dahil sa noisy timing, sparse rewards, at instability. Ipinakilala ng team ang DMC-Optim, isang benchmark na naglalaman ng correctness at speed, na nagpataas ng pass rates para sa mga modelo tulad ng Qwen 2.5 7B at CWM 32B. Ang mga bagong token listing ay nananatiling pangunahing tulong para sa mga trader na sinusubaybayan ang mga pag-unlad sa AI.

Ang pagtuturo sa isang AI na sumulat ng code na gumagana ay isang bagay. Ang pagtuturo sa kanya na sumulat ng code na gumagana fast ay, sa tingin nila, iba’t ibang hayop.

Isang bagong papel mula sa FAIR team ng Meta AI, na inilathala noong Hulyo 29, ay nagpapakita na ang pagpapalawak ng reinforcement learning mula sa tamang code patungo sa pag-optimize ng bilis ng code ay puno ng mga problema na hindi kayang handle ng mga standard na pagkakasunod-sunod. Ang mga dahilan: malalim na pagtukoy ng oras, maliit na reward, at mga algoritmo na bumubulok kapag hiniling mo sa kanila na mag-alala tungkol sa performance, hindi lang sa akurasyon.

Ang problema sa bilis

Kapag sinusukat mo kung ang code ay nagpapakita ng tamang sagot, makakakuha ka ng malinaw na binary na signal. Ngunit ang pagsusukat kung gaano kalakas ang pagpapatakbo ng code ay magulo. Ipinapatakbo mo ang parehong code dalawang beses sa parehong machine at makakakuha ka ng kaunting iba’t ibang oras ng pagpapatakbo. Ang mga background process, CPU scheduling, memory allocation, lahat ay nagdudulot ng ingay sa mga pagsusukat ng oras.

Pamamahayag

Nakakita ang koponan ng Meta na ang Generalized Reinforcement Policy Optimization, o GRPO, isang karaniwang algoritmo sa toolkit ng reinforcement learning, ay naging hindi stable kapag binigyan ito ng mga ganitong uri ng noisy speed measurements.

Ang kakaibang pagkakatanggap ng reward ay nagpapalala sa problema. Karamihan sa mga pagpapabuti ng code ay nagdudulot ng maliit na pagpapabilis, kaya ang modelo ay kakaunti lang na nakakatanggap ng malakas na positibong signal na sabi nito, “oo, ginawa ng pagbabagong iyon ang mga bagay na mas mabilis.”

DMC-Optim: isang bagong benchmark para sa bagong problema

Upang harapin ang mga hamon na ito, nilikha ng mga siyentipiko ang DMC-Optim, isang benchmark na may calibradong sandbox environment at isang espesyal na training pipeline. Ang sistema ay nagkakaisa ng mga reward para sa kawastuhan at bilis ng pagpapatupad sa isang offline simulator, na sa pangkabuuan ay gumagawa ng isang kontroladong kapaligiran kung saan ang timing noise ay maaaring ma-manage kaysa iwanan.

Mahirap ipaglaban ang mga resulta. Ang pass rate para sa Qwen 2.5 7B ay tumataas mula sa 18.0% patungo sa 31.3%, isang halos 74% relative improvement. Kumita ang CWM 32B ng pagtaas sa pass rate mula sa 30.7% patungo sa 50.4%, isang 64% relative gain. Sa LCB benchmark, tinamaan ng CWM 32B na tinuturuan gamit ang paraang ito ang median speed comparisons 83% ng oras, kumpara sa mga modelong tinuturuan gamit ang standard reinforcement learning mula sa verifiable rewards.

Sa mga kondisyon ng pagkakamali sa oras, kung saan ang ingay sa pagsukat ay sadyang pinapalakas, ipinakita ng DMC-Optim benchmark ang pagpapabuti sa performance sa pagitan ng 100% at 200% kumpara sa mga karaniwang paraan.

Isinulat ng Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot, at Gabriel Synnaeve, lahat mula sa Meta AI.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.