Meta AI 識別出強化學習在代碼速度優化中的挑戰

iconCryptoBriefing
分享
AI summary icon精華摘要
Meta AI 的 FAIR 團隊的 AI 與加密貨幣新聞顯示,強化學習在代碼速度優化方面面臨噪音計時、稀疏獎勵和不穩定性的挑戰。該團隊推出了 DMC-Optim 基準,結合正確性與速度,提升了 Qwen 2.5 7B 和 CWM 32B 等模型的通過率。新代幣上線仍是追蹤 AI 進展的交易者關注的重點。

教導人工智慧撰寫能運作的程式碼是一回事,教導它撰寫能快速運作的程式碼,則似乎是完全不同的另一回事。

Meta AI 的 FAIR 團隊於 7 月 29 日發表的一篇新論文指出,將強化學習從程式碼正確性延伸至程式碼速度優化,存在許多標準方法無法處理的問題。禍首包括:嘈雜的計時測量、稀疏的獎勵,以及當要求演算法關注效能而非僅僅準確性時便會崩潰的演算法。

速度的問題

當你測量代碼是否產生正確的答案時,會得到一個清晰的二進制信號。但測量代碼運行速度卻很混亂。在同一台機器上兩次運行相同的代碼,會得到略有不同的執行時間。背景進程、CPU 調度、記憶體配置都會為計時測量引入雜訊。

廣告

Meta 團隊發現,通用強化策略優化(GRPO)——這是一種強化學習工具包中的標準算法——在輸入此類嘈雜的速度測量數據時會變得不穩定。

獎勵稀疏性加劇了這一問題。大多數代碼優化僅帶來邊際的速度提升,意味著模型很少獲得強烈的正面信號來告訴它「是的,這個更改讓事情變得更快」。

DMC-Optim:一個針對新問題的全新基準

為應對這些挑戰,研究人員構建了 DMC-Optim,這是一個包含校準沙盒環境和專用訓練管道的基準測試。該系統在離線模擬器中結合了正確性和執行速度的獎勵,本質上創造了一個可管理而非忽略時序噪聲的受控環境。

結果令人難以辯駁。Qwen 2.5 7B 的通過率從 18.0% 提升至 31.3%,相對改善約 74%。CWM 32B 的通過率從 30.7% 上升至 50.4%,相對增長 64%。在 LCB 基準測試中,採用此方法訓練的 CWM 32B 在 83% 的情況下勝過使用標準可驗證獎勵強化學習訓練的模型。

在計時條件劣化的情況下,當測量噪聲被故意放大時,DMC-Optim 基準表現比標準方法提升了 100% 至 200%。

該論文由來自 Meta AI 的 Pierre Chambon、Kunhao Zheng、Juliette Decugis、Benoît Sagot 和 Gabriel Synnaeve 撰寫。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露