Google DeepMind ने एक पेपर प्रकाशित किया है जो भाषा मॉडल्स के टेक्स्ट प्रोसेस करने के तरीके को शांति से बदल सकता है। इस तकनीक का नाम “recirculation” है, जो ट्रांसफॉर्मर की गहरी परतों से एक्टिवेशन्स लेती है और निष्पादन के दौरान उन्हें उसकी सतही परतों में मिला देती है। ऑस्टिन, टेक्सास विश्वविद्यालय के शोधकर्ताओं के साथ सह-लेखित यह पेपर दर्शाता है कि यह हल्की पुनरावृत्ति कनेक्शन पूर्ण फाइन-ट्यूनिंग के बराबर, और कुछ मामलों में उससे अधिक प्रदर्शन देती है। कोई पुनः प्रशिक्षण की आवश्यकता नहीं। कोई प्रमुख आर्किटेक्चरल सर्जरी की आवश्यकता नहीं।
रीसाइकिलेशन वास्तव में क्या करता है
पुनर्चक्रण ट्रांसफॉर्मर प्रोसेसिंग के एक-दिशात्मक प्रवाह को तोड़ देता है। मॉडल की गहरी परतों में गणना किए गए सक्रियणों का एक भाग टोकन उत्पन्न करते समय उथली परतों में वापस भेज दिया जाता है। मॉडल मूल रूप से अपने आंतरिक प्रतिनिधित्व को समझने के लिए दूसरा पास प्राप्त करता है, जिससे यह कई चरणों में अपने “विश्वास स्थितियों” को सुधारने में सक्षम होता है, जैसा कि कागज़ में कहा गया है।
चेन-ऑफ-थॉट प्रॉम्प्टिंग या लूप्ड ट्रांसफॉर्मर आर्किटेक्चर जैसे मौजूदा दृष्टिकोणों से मुख्य अंतर यह है कि रीसर्कुलेशन को अतिरिक्त तर्क टोकन या अतिरिक्त आर्किटेक्चरल डेप्थ की आवश्यकता नहीं होती। यह निष्कर्षण के कार्यान्वयन का एक बोल्ट-ऑन संशोधन है, न कि मॉडल के स्वयं का पुनर्डिजाइन।
संख्याओं को नजरअंदाज करना मुश्किल है
डीपमाइंड टीम ने गेमा3 मॉडल परिवार, जिसमें 1B, 4B और 12B पैरामीटर वेरिएंट्स शामिल हैं, के लिए पुनर्चक्रण का परीक्षण किया। बेसिक पुनर्चक्रण ने नौ भाषा मॉडलिंग डेटासेट्स पर लगभग 8.5% की परप्लेक्सिटी में कमी दी, जबकि जनरेशन के दौरान कोई अतिरिक्त लेटेंसी नहीं जोड़ी गई।
अनुकूलित पुनर्चक्रण को आगे बढ़ाया गया, जिससे उन्हीं नौ डेटासेट्स पर बेपरेहाई में 23% की औसत कमी हुई। संदर्भ के लिए, पूर्ण फाइन-ट्यूनिंग केवल 21.6% की कमी कर पाई। तर्क कार्यों पर, GSM8K बेंचमार्क में अनुकूलित पुनर्चक्रण के साथ सटीकता में 21% की सापेक्ष वृद्धि हुई।
एक विकल्प है। प्रीफिल प्रोसेसिंग, जिस चरण में मॉडल प्रारंभिक प्रॉम्प्ट को समझता है, रीसर्कुलेशन के अंतर्गत अनुक्रमिक हो जाता है, जिससे प्रॉम्प्ट को प्रोसेस करने की प्रारंभिक लागत बढ़ जाती है।
क्यों एआई समुदाय ध्यान दे रहा है
कागजात, जिसे arXiv:2608.17981 के रूप में सूचीबद्ध किया गया है, पहले ही स्वतंत्र रूप से पुनर्उत्पादित किया जा चुका है। GitHub के कार्यान्वयन ने Gemma परिवार के बाहर के मॉडल्स, जिनमें Llama 3.2 1B शामिल हैं, पर लाभों की पुष्टि की है। चर्चाएँ X और चीनी तकनीकी मीडिया प्लेटफॉर्म्स पर शोध समुदायों के बीच फैल चुकी हैं।
रीसर्कुलेशन एक्टिवेशन स्तर पर कार्य करता है, टोकन-जनरेशन सतह के नीचे, जिससे यह चेन-ऑफ-थॉट रीजनिंग जैसी प्रॉम्प्टिंग तकनीकों के प्रतिस्पर्धी नहीं, बल्कि पूरक है, जो आउटपुट टोकन का उपयोग करती हैं और लेटेंसी जोड़ती हैं।
