एक एआई को काम करने वाला कोड लिखना सिखाना एक बात है। इसे काम करने वाला कोड तेज लिखना सिखाना, ऐसा लगता है, एक पूरी तरह अलग बात है।
29 जुलाई को प्रकाशित मेटा एआई के एफएआईआर टीम के एक नए पेपर में यह बताया गया है कि कोड की सहीगता से कोड की गति अनुकूलन तक प्रबलन सीखने का विस्तार करना समस्याओं से भरा हुआ है जिन्हें मानक दृष्टिकोण सिर्फ नहीं संभाल सकते। दोषी: शोर वाले समय मापन, विरल पुरस्कार, और ऐसे एल्गोरिदम जो आप जब उनसे केवल सटीकता के बजाय प्रदर्शन के बारे में चिंता करने को कहते हैं, तो वे टूट जाते हैं।
गति की समस्या
जब आप मापते हैं कि कोड सही उत्तर देता है या नहीं, तो आपको एक साफ़ बाइनरी सिग्नल मिलता है। लेकिन कोड के चलने की गति को मापना अव्यवस्थित है। एक ही मशीन पर एक ही कोड को दो बार चलाएं और आपको थोड़े अलग निष्पादन समय मिलेंगे। पृष्ठभूमि प्रक्रियाएँ, CPU स्केड्यूलिंग, मेमोरी आवंटन, सभी समय मापन में शोर उत्पन्न करते हैं।
मेटा टीम ने पाया कि सुदृढीकरण शिक्षण टूलकिट में सामान्यीकृत पुनर्बलन नीति अनुकूलन, या GRPO, एक मानक एल्गोरिथम है, जो जब आप इसे इस प्रकार के शोर वाले गति मापन देते हैं, तो अस्थिर हो जाता है।
इनाम की दुर्लभता समस्या को जटिल बनाती है। अधिकांश कोड अनुकूलन छोटे गति सुधार देते हैं, जिसका अर्थ है कि मॉडल को लगभग कभी मजबूत सकारात्मक संकेत नहीं मिलता कि “हाँ, यह बदलाव चीजों को तेज़ बना दिया।”
DMC-Optim: एक नए समस्या के लिए एक नया मानक
इन चुनौतियों का सामना करने के लिए, शोधकर्ताओं ने DMC-Optim बेंचमार्क बनाया, जिसमें एक कैलिब्रेटेड सैंडबॉक्स वातावरण और एक विशेष प्रशिक्षण पाइपलाइन शामिल है। यह सिस्टम एक ऑफलाइन सिमुलेटर में सहीता और निष्पादन गति दोनों के लिए पुरस्कारों को जोड़ता है, जिससे मूलतः एक नियंत्रित वातावरण बनता है जहाँ समय संबंधी शोर को नज़रअंदाज़ करने के बजाय प्रबंधित किया जा सकता है।
परिणामों के साथ बहस करना मुश्किल है। Qwen 2.5 7B की पास दर 18.0% से बढ़कर 31.3% हो गई, जो लगभग 74% का सापेक्ष सुधार है। CWM 32B की पास दर 30.7% से बढ़कर 50.4% हो गई, जो 64% का सापेक्ष लाभ है। LCB बेंचमार्क पर, इस दृष्टिकोण के साथ प्रशिक्षित CWM 32B, मानक पुष्टि योग्य पुरस्कारों से प्रशिक्षित मॉडलों की माध्यमिक गति तुलनाओं की तुलना में 83% समय पर बेहतर प्रदर्शन किया।
घटिया समयनिर्धारण की स्थितियों में, जहाँ मापन के शोर को जानबूझकर बढ़ाया गया है, DMC-Optim बेंचमार्क ने मानक विधियों की तुलना में 100% से 200% तक के प्रदर्शन में सुधार दर्ज किया।
पेपर के लेखक पिएर शैम्बोन, कुनहाओ जेंग, जूलिएट डेकुगिस, बेनोइत सैगोट और गैब्रिएल सिन्नेवे हैं, जो सभी मेटा एआई से हैं।
