गूगल डीपमाइंड पेपर में रीसर्कुलेशन विधि के बारे में बताया गया है जो ट्रांसफॉर्मर प्रदर्शन को बढ़ाती है

iconCryptoBriefing
साझा करें
AI summary iconसारांश
Google DeepMind ने ट्रांसफॉर्मर मॉडल्स को बेहतर बनाने के लिए 'रीसर्कुलेशन' नामक एक विधि पेश की है। यह तकनीक निष्पादन के दौरान गहरी परतों के एक्टिवेशन्स को पहले की परतों में वापस भेजती है, जिससे पुनः प्रशिक्षण के बिना प्रदर्शन में वृद्धि होती है। ऑन-चेन समाचार रिपोर्ट्स के अनुसार, इस विधि ने GSM8K बेंचमार्क पर परप्लेक्सिटी को 23% कम कर दिया और तर्क की सटीकता में 21% की सुधार किया। हालाँकि, इससे प्रारंभिक प्रोसेसिंग लागत में वृद्धि होती है। क्रिप्टो समाचार मीडिया ब्लॉकचेन अनुप्रयोगों में AI की कुशलता में सुधार की संभावना पर प्रकाश डालते हैं।

Google DeepMind ने एक पेपर प्रकाशित किया है जो भाषा मॉडल्स के टेक्स्ट प्रोसेस करने के तरीके को शांति से बदल सकता है। इस तकनीक का नाम “recirculation” है, जो ट्रांसफॉर्मर की गहरी परतों से एक्टिवेशन्स लेती है और निष्पादन के दौरान उन्हें उसकी सतही परतों में मिला देती है। ऑस्टिन, टेक्सास विश्वविद्यालय के शोधकर्ताओं के साथ सह-लेखित यह पेपर दर्शाता है कि यह हल्की पुनरावृत्ति कनेक्शन पूर्ण फाइन-ट्यूनिंग के बराबर, और कुछ मामलों में उससे अधिक प्रदर्शन देती है। कोई पुनः प्रशिक्षण की आवश्यकता नहीं। कोई प्रमुख आर्किटेक्चरल सर्जरी की आवश्यकता नहीं।

रीसाइकिलेशन वास्तव में क्या करता है

पुनर्चक्रण ट्रांसफॉर्मर प्रोसेसिंग के एक-दिशात्मक प्रवाह को तोड़ देता है। मॉडल की गहरी परतों में गणना किए गए सक्रियणों का एक भाग टोकन उत्पन्न करते समय उथली परतों में वापस भेज दिया जाता है। मॉडल मूल रूप से अपने आंतरिक प्रतिनिधित्व को समझने के लिए दूसरा पास प्राप्त करता है, जिससे यह कई चरणों में अपने “विश्वास स्थितियों” को सुधारने में सक्षम होता है, जैसा कि कागज़ में कहा गया है।

चेन-ऑफ-थॉट प्रॉम्प्टिंग या लूप्ड ट्रांसफॉर्मर आर्किटेक्चर जैसे मौजूदा दृष्टिकोणों से मुख्य अंतर यह है कि रीसर्कुलेशन को अतिरिक्त तर्क टोकन या अतिरिक्त आर्किटेक्चरल डेप्थ की आवश्यकता नहीं होती। यह निष्कर्षण के कार्यान्वयन का एक बोल्ट-ऑन संशोधन है, न कि मॉडल के स्वयं का पुनर्डिजाइन।

विज्ञापन

संख्याओं को नजरअंदाज करना मुश्किल है

डीपमाइंड टीम ने गेमा3 मॉडल परिवार, जिसमें 1B, 4B और 12B पैरामीटर वेरिएंट्स शामिल हैं, के लिए पुनर्चक्रण का परीक्षण किया। बेसिक पुनर्चक्रण ने नौ भाषा मॉडलिंग डेटासेट्स पर लगभग 8.5% की परप्लेक्सिटी में कमी दी, जबकि जनरेशन के दौरान कोई अतिरिक्त लेटेंसी नहीं जोड़ी गई।

अनुकूलित पुनर्चक्रण को आगे बढ़ाया गया, जिससे उन्हीं नौ डेटासेट्स पर बेपरेहाई में 23% की औसत कमी हुई। संदर्भ के लिए, पूर्ण फाइन-ट्यूनिंग केवल 21.6% की कमी कर पाई। तर्क कार्यों पर, GSM8K बेंचमार्क में अनुकूलित पुनर्चक्रण के साथ सटीकता में 21% की सापेक्ष वृद्धि हुई।

एक विकल्प है। प्रीफिल प्रोसेसिंग, जिस चरण में मॉडल प्रारंभिक प्रॉम्प्ट को समझता है, रीसर्कुलेशन के अंतर्गत अनुक्रमिक हो जाता है, जिससे प्रॉम्प्ट को प्रोसेस करने की प्रारंभिक लागत बढ़ जाती है।

क्यों एआई समुदाय ध्यान दे रहा है

कागजात, जिसे arXiv:2608.17981 के रूप में सूचीबद्ध किया गया है, पहले ही स्वतंत्र रूप से पुनर्उत्पादित किया जा चुका है। GitHub के कार्यान्वयन ने Gemma परिवार के बाहर के मॉडल्स, जिनमें Llama 3.2 1B शामिल हैं, पर लाभों की पुष्टि की है। चर्चाएँ X और चीनी तकनीकी मीडिया प्लेटफॉर्म्स पर शोध समुदायों के बीच फैल चुकी हैं।

रीसर्कुलेशन एक्टिवेशन स्तर पर कार्य करता है, टोकन-जनरेशन सतह के नीचे, जिससे यह चेन-ऑफ-थॉट रीजनिंग जैसी प्रॉम्प्टिंग तकनीकों के प्रतिस्पर्धी नहीं, बल्कि पूरक है, जो आउटपुट टोकन का उपयोग करती हैं और लेटेंसी जोड़ती हैं।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।