मेटा AI कोड स्पीड ऑप्टिमाइजेशन के लिए रीइनफोर्समेंट लर्निंग में चुनौतियों की पहचान करता है

iconCryptoBriefing
साझा करें
AI summary iconसारांश
मेटा एआई के FAIR टीम की एआई + क्रिप्टो समाचार दर्शाती है कि रीइनफोर्समेंट लर्निंग कोड स्पीड ऑप्टिमाइजेशन में शोर टाइमिंग, स्पार्स पुरस्कार और अस्थिरता के कारण कठिनाइयों का सामना कर रही है। टीम ने DMC-Optim नामक एक बेंचमार्क लॉन्च किया है, जो सही परिणाम और गति को मिलाता है, जिससे Qwen 2.5 7B और CWM 32B जैसे मॉडल्स के पास रेट में वृद्धि हुई है। एआई के विकासों का पालन करने वाले ट्रेडर्स के लिए नए टोकन की सूचीबद्धता अभी भी एक प्रमुख फोकस है।

एक एआई को काम करने वाला कोड लिखना सिखाना एक बात है। इसे काम करने वाला कोड तेज लिखना सिखाना, ऐसा लगता है, एक पूरी तरह अलग बात है।

29 जुलाई को प्रकाशित मेटा एआई के एफएआईआर टीम के एक नए पेपर में यह बताया गया है कि कोड की सहीगता से कोड की गति अनुकूलन तक प्रबलन सीखने का विस्तार करना समस्याओं से भरा हुआ है जिन्हें मानक दृष्टिकोण सिर्फ नहीं संभाल सकते। दोषी: शोर वाले समय मापन, विरल पुरस्कार, और ऐसे एल्गोरिदम जो आप जब उनसे केवल सटीकता के बजाय प्रदर्शन के बारे में चिंता करने को कहते हैं, तो वे टूट जाते हैं।

गति की समस्या

जब आप मापते हैं कि कोड सही उत्तर देता है या नहीं, तो आपको एक साफ़ बाइनरी सिग्नल मिलता है। लेकिन कोड के चलने की गति को मापना अव्यवस्थित है। एक ही मशीन पर एक ही कोड को दो बार चलाएं और आपको थोड़े अलग निष्पादन समय मिलेंगे। पृष्ठभूमि प्रक्रियाएँ, CPU स्केड्यूलिंग, मेमोरी आवंटन, सभी समय मापन में शोर उत्पन्न करते हैं।

विज्ञापन

मेटा टीम ने पाया कि सुदृढीकरण शिक्षण टूलकिट में सामान्यीकृत पुनर्बलन नीति अनुकूलन, या GRPO, एक मानक एल्गोरिथम है, जो जब आप इसे इस प्रकार के शोर वाले गति मापन देते हैं, तो अस्थिर हो जाता है।

इनाम की दुर्लभता समस्या को जटिल बनाती है। अधिकांश कोड अनुकूलन छोटे गति सुधार देते हैं, जिसका अर्थ है कि मॉडल को लगभग कभी मजबूत सकारात्मक संकेत नहीं मिलता कि “हाँ, यह बदलाव चीजों को तेज़ बना दिया।”

DMC-Optim: एक नए समस्या के लिए एक नया मानक

इन चुनौतियों का सामना करने के लिए, शोधकर्ताओं ने DMC-Optim बेंचमार्क बनाया, जिसमें एक कैलिब्रेटेड सैंडबॉक्स वातावरण और एक विशेष प्रशिक्षण पाइपलाइन शामिल है। यह सिस्टम एक ऑफलाइन सिमुलेटर में सहीता और निष्पादन गति दोनों के लिए पुरस्कारों को जोड़ता है, जिससे मूलतः एक नियंत्रित वातावरण बनता है जहाँ समय संबंधी शोर को नज़रअंदाज़ करने के बजाय प्रबंधित किया जा सकता है।

परिणामों के साथ बहस करना मुश्किल है। Qwen 2.5 7B की पास दर 18.0% से बढ़कर 31.3% हो गई, जो लगभग 74% का सापेक्ष सुधार है। CWM 32B की पास दर 30.7% से बढ़कर 50.4% हो गई, जो 64% का सापेक्ष लाभ है। LCB बेंचमार्क पर, इस दृष्टिकोण के साथ प्रशिक्षित CWM 32B, मानक पुष्टि योग्य पुरस्कारों से प्रशिक्षित मॉडलों की माध्यमिक गति तुलनाओं की तुलना में 83% समय पर बेहतर प्रदर्शन किया।

घटिया समयनिर्धारण की स्थितियों में, जहाँ मापन के शोर को जानबूझकर बढ़ाया गया है, DMC-Optim बेंचमार्क ने मानक विधियों की तुलना में 100% से 200% तक के प्रदर्शन में सुधार दर्ज किया।

पेपर के लेखक पिएर शैम्बोन, कुनहाओ जेंग, जूलिएट डेकुगिस, बेनोइत सैगोट और गैब्रिएल सिन्नेवे हैं, जो सभी मेटा एआई से हैं।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।