source avatarsleepy.md

साझा करें

OpenAI Astra का यह "इनोवेशन", ByteDance ने पिछले साल ही खुले तौर पर किया था। इस रास्ते को recurrent depth कहते हैं। सरल शब्दों में, यह बस लंबे CoT को जनरेट करके अधिक सोचने के बजाय, एक ही Transformer block के सेट को hidden state पर बार-बार रिपीट करना है, ताकि latent space में अधिक कैलकुलेशन डाला जा सके। मुश्किल सवालों के लिए कई राउंड चलाएं, आसान सवालों के लिए जल्दी बाहर निकल जाएं। पैरामीटर्स को इन्फरेंस डीप्थ के साथ बढ़ाने की जरूरत नहीं है, और test-time compute को भी अधिक लचीले ढंग से बांटा जा सकता है। पिछले अक्टूबर में, ByteDance Seed ने Ouro को खुला और ओपन-सोर्स किया, जो Looped Language Model है। Ouro-1.4B और 2.6B ने प्री-ट्रेनिंग के दौरान iterative latent reasoning को सीधे शामिल किया, 2.6B डिफ़ॉल्ट रूप से कई राउंड recurrent computation करता है, साथ ही adaptive exit का समर्थन करता है, जिससे हर सवाल स्वयं तय कर सके कि उसे कितने राउंड सोचने की जरूरत है। पिछले साल, यह केवल ByteDance की ओर से छोटे मॉडल्स पर प्रमाणित की गई एक सहायक पथ मात्र थी, अब OpenAI ने इसे सबसे अग्रणी मॉडल में शामिल कर दिया है। इसका मतलब है कि recurrent depth सिर्फ एक "दिलचस्प" अकादमिक डिज़ाइन नहीं रहा, बल्कि अगली पीढ़ी के बड़े मॉडल्स की वास्तविक इंजीनियरिंग पथ में प्रवेश करने लगा है। और इसके साथ आने वाली समस्याएं benchmark से भी अधिक पेचीदा हैं। पहले reasoning model की स्केलिंग में, कई कैलकुलेशन CoT में ही किए जाते थे। मॉडल जितना अधिक सोचता, उतने ही reasoning tokens प्रकट होते। हालाँकि CoT मॉडल की पूरी internal state के समान नहीं होता, परन्तु कम से कम यह सुरक्षित मॉनिटरिंग का एक खिड़की का काम करता है। recurrent depth, compute को latent space में ही स्थानांतरित करता है। एक ही पैरामीटर सेट hidden state में कई बार साइकिल कर सकता है, मॉडल के internal में पहले ही कई कैलकुलेशन पूरे हो चुके होते हैं, और परिणाम में सिर्फ़ एक संक्षिप्त पाठ प्रदान किया जाता है। इससे एक महत्वपूर्ण प्रश्न प्रकट होता है: मॉडल का सच्चा reasoning, प्राकृतिक भाषा से धीरे-धीरे हटता जा रहा है। यही OpenAI Astra पर researchers की सबसे बड़ी परेशानी है। OpenAI पहले से ही Chain-of-Thought monitoring पर मजबूत ध्यान केंद्रित करता है, क्योंकि मॉडल, agar cheating, reward hacking, ya rules bypass karne ki koshish karega, toh kabhī-kabhī CoT में intent expose kar deta hai। लेकिन, agar reasoning ka badiya hissa latent state में होने लगा, toh aap kya monitor kar sakte hain? अफवाहों के मुताबिक, OpenAI Astra पर recurrent depth का use limit kar raha hai, taki zyada readable CoT bacha rahe ho, aur sath hi internal state aur behavior monitoring ko extra deploy kiya gaya ho। यह सचमुच dillachas baat hai। पिछले कुछ सालों में, large models ke reasoning ko expand karne ka rasta bahut clear tha — use aur zyada tokens do, aur use aur zyada baat karne do। अगला rasta ho sakta hai — use aur zyada internal cycles do, lekin aapko un processes ka pata nahi chalna chahiye।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।