दो महीने पहले, GPT-5.6 Sol ने बड़ी गलती की।
इसने हाइपरव्राइट के संस्थापक मैट शुमर के ऐपल कंप्यूटर पर लगभग सभी फाइलें हटा दीं, जिसमें कंपनी के मुख्य दस्तावेज़ भी शामिल थे।
मैट ने तुरंत छोड़ दिया और अपने प्रमुख उत्पादन उपकरणों को सभी Claude Fable 5 से बदल दिया।
दो महीने बाद, GPT-6 Astra के लॉन्च के दिन, मैट ने एक गहन समीक्षा के साथ घोषणा की: GPT-6 Astra मुझे वापस जीत लिया।
उसने देखा कि GPT-6 Astra पिछली पीढ़ी की तुलना में अधिक सावधान है, यह जानती है कि क्या करना है और क्या नहीं, इससे उसे अंततः यह विश्वास मिला कि वह काम पूरी तरह से सौंप सकता है और निगरानी के लिए अपनी नजरें नहीं रखनी पड़ेंगी।
उसने GPT-6 Astra पर एक अत्यंत पागलपन भरा प्रयोग भी किया: एकल निर्देश से शुरू करके, Unreal Engine में एक वर्चुअल मैनहट्टन को धीरे-धीरे सड़क दर सड़क विस्तारित किया।

लेकिन उसके मुख्य बल को वापस लाने का वास्तविक कारण न केवल मॉडल क्षमता में वृद्धि थी, बल्कि उसने खुद एक ऐसी विधि विकसित की थी जिससे AI के साथ जोड़कर काम किया जा सके: Manager Loop।
यह विधि एक ऐसी और अधिक घातक समस्या का समाधान करती है:
जब प्रोजेक्ट एक निश्चित आकार तक पहुंच जाता है, तो टीम को लक्ष्य की ओर बढ़ाए रखने की जिम्मेदारी किसकी होती है?
कंप्यूटर को हटा दिए जाने वाले लोग फिर से क्यों वापस आ गए?
पहले पृष्ठभूमि समझाएं।
7 जुलाई को, जो GPT-5.6 परिवार के प्रकाशन का दूसरा दिन था, मैट ने सोशल मीडिया पर अपनी भयानक घटना की शिकायत की:
GPT-5.6 Sol「मैंने अपने Mac पर लगभग सभी फाइलें गलती से हटा दीं」।
कुछ ही दिनों के बाद, इंजीनियर ब्रुनो लेमोस का उत्पादन डेटाबेस भी एक ही मॉडल द्वारा हटा दिया गया। विरोधाभास यह है कि कुछ घंटे पहले वह कंपनी के Slack में मॉडल के पक्ष में बोल रहा था और शूमर पर पूर्ण-एक्सेस अनुमति देने का दोष लगा रहा था।
OpenAI Codex के इंजीनियरिंग लीड थिबॉल्ट सोट्टियो ने बाद में स्वयं स्पष्ट किया कि ऐसी घटनाएँ आमतौर पर फुल-एक्सेस मोड चालू, सैंडबॉक्स बंद और ऑटो-रिव्यू बंद होने के स्थिति में होती हैं:
मॉडल ने एनवायरनमेंट वेरिएबल को रीव्राइट करने की कोशिश की, जिसके परिणामस्वरूप उपयोगकर्ता के होम डायरेक्टरी को पूरी तरह से हटा दिया गया।
एक "ईमानदारी से किया गया गलती", ओपनएआई ने इसे इस प्रकार वर्गीकृत किया है।
ऐसी व्याख्या स्पष्ट रूप से मैट को आश्वस्त नहीं कर सकती। उसकी प्रतिक्रिया थी कि वह क्लॉड की ओर मुड़ गया और धमकी दी: ओपनएआई को मुझे वापस लाने के लिए एक 'चमत्कारी' मॉडल पेश करना होगा।
दो महीने बाद, GPT-6 Astra आ गया।
मैट यह नहीं देख रहे हैं कि यह कितना और समझदार हो गया है, बल्कि यह देख रहे हैं कि क्या वह इसे काम सौंपने के लिए साहसी है।
उसका उत्तर था—हाँ। एस्ट्रा पिछली पीढ़ी की तुलना में कहीं अधिक सावधान है, कभी-कभी बहुत अधिक सावधान, लेकिन अब वह आराम से चला जा सकता है।
उन्होंने एक उदाहरण दिया: एक सप्ताहांत को वह बाहर डेट पर था, और उसके दोस्त ने संदेश भेजा कि उसने जिस स्मार्ट एजेंट सेवा को सेटअप किया था, वह बंद हो गई है।
उसने अपना मोबाइल निकाला, प्रोजेक्ट के लिए एक वाक्य टाइप किया — "बंद हो गया, ठीक करो", और तुरंत स्क्रीन बंद करके जेब में रख दिया। एक घंटे बाद, दोस्त ने कहा कि ठीक हो गया है।
और खुद ने यह आदेश देना भी भूल गया।
पाँच मैक फैन तेजी से घूम रहे हैं, एक ही दीवार पर अटके हुए
दैनिक कार्य सफलतापूर्वक पूरा करने के बाद, मैट ने एस्ट्रा पर थोड़ा और इंटेंसिटी जोड़ने का फैसला किया।
उसने एस्ट्रा को अनरियल इंजन में न्यूयॉर्क शहर बनाने के लिए कहा।
Astra लंबे कार्यों को संभालने में पिछले संस्करण से वास्तव में बेहतर है, लेकिन एक निश्चित चरण तक पहुँचने के बाद, प्रगति रुक जाती है।
AI अभी भी पागलों की तरह काम कर रहा है, लेकिन जितना अधिक काम करता है, उतना ही छोटे-छोटे विवरणों में खो जाता है, जिससे पूरी परियोजना की सामान्य प्रगति में कोई उन्नति नहीं हो रही है।


छत पर का पानी का टैंक, दरवाजे पर का नीON बोर्ड, एस्ट्रा इन छोटी छोटी बातों में और अधिक गहराई से खोजता है, लेकिन समग्र प्रगति रुकी हुई है
इस जमावट को तोड़ने के लिए, मैट ने पाँच तरीकों से ऑर्गनाइज़ेशनल एजेंट्स का प्रयास किया।
सबसे सरल और सीधा तरीका यह है: एक बड़ा कार्य दें जो लगातार चलता रहे, और बीच में अंधा समीक्षा तंत्र जोड़ें।
शुरुआत बहुत तेज़ होती है, लेकिन बीच में अक्सर विस्तार के गड्ढे में फंस जाता है। उसे एक सबक मिला: मॉडल को "लगातार काम करने" के लिए कहना और उसे "अगला कदम क्या उठाना है" यह समझाना, पूरी तरह से अलग बातें हैं।
दूसरा तरीका भूमिका का विभाजन है। इससे विभाजन स्पष्ट हो जाता है, लेकिन समन्वय और अनुमोदन नए समस्याएँ बन जाते हैं।
तीसरा तरीका एक 'सीईओ' जैसा निरीक्षक नियुक्त करना है, जो हर 30 मिनट में एक बार जांच करता है। परिणाम लगभग सुधरा नहीं।
चौथा तरीका है कि समन्वयक स्वयं टीम संरचना को समायोजित करे। इसमें कई तरह के उपाय हैं, लेकिन वे सभी एक ही दीवार से टकराते हैं।
पाँचवाँ, उसने सबसे मूल और बेकार तरीका अपनाया: एजेंट को लक्ष्य को चरणबद्ध सूची में विभाजित करने दिया, एक चरण पूरा करने के बाद रुक जाए, मैट दो शब्द टाइप करते हैं 'जारी रखें', और एआई अगले चरण में जाता है।
यह ट्रिक काम कर गई, प्रोजेक्ट अब लगातार आगे बढ़ सकता है।
लेकिन समस्या भी सामने आई: हर बार उस मनुष्य को सहमति देनी पड़ती है।
खुद ही बाधा बन गया: उसे चक्र से हटाने पर ही प्रोजेक्ट वास्तव में शुरू हो सकता है।
Manager Loop: अपने आप को चक्र से बाहर निकालें
छठी योजना, जिसे Manager Loop कहा जाता है, का केंद्रीय तर्क अत्यंत चतुर है।
उसने कोडेक में दो समानांतर सत्र खोले हैं, जिनमें से प्रत्येक अलग-अलग काम संभालता है:
एक «कोऑर्डिनेटर» है।
यह पहले मानवों के साथ एक गहन साक्षात्कार करता है, दोनों ओर के लक्ष्यों को समझने के बाद, लक्ष्यों को कार्य सूची और विभिन्न चरणों में विभाजित कर देता है।
दूसरा है "एक्जीक्यूटर"।
यह पूरी तरह से स्वतंत्र सत्र में चल रहा है, समन्वयक का अधीन नहीं है।
The coordinator assigns the current stage's task to it and has it monitor the current stage until completion.
पूरा हो गया, कोऑर्डिनेटर द्वारा स्वीकृति, फिर अगला चरण आवंटित किया जाएगा।
अगर व्यस्त हों, तो निष्पादक स्वयं अपनी आवश्यकता के अनुसार उप-बुद्धिमान एजेंट नियुक्त कर सकते हैं।
इस परफेक्ट सर्कल में, कोऑर्डिनेटर ने मनुष्य के काम को पूरी तरह से संभाल लिया: प्रोजेक्ट को रोकने नहीं देते हुए कुल योजना पर नज़र रखना और मनुष्य के स्थान पर बार-बार "जारी रखें" कहना।
Sub-agent limit raised to 96, forcibly creating Manhattan
ताकि निष्पादक पूरी तरह से स्वतंत्र हो सके, मैट ने प्रणाली की समानांतर सीमा को संशोधित किया।
उसने कंप्यूटर के डिफ़ॉल्ट 4 को सीधे अविश्वसनीय 96 में बदल दिया।
Of course, this does not mean that all 96 AI are constantly mining simultaneously. Sometimes the models do not fully utilize their quotas, and he needs to explicitly prompt them.
लेकिन इस सीमांत कॉन्फ़िगरेशन में, चमत्कार हुआ।
पहले से तैयार उपकरणों और संपत्तियों (जैसे MetaHuman किरदार) का उपयोग करके, एस्ट्रा ने अपने एक हफ्ते में Unreal Engine में इस मैनहट्टन दुनिया को बना लिया।

वह पहली सड़क को संतोषजनक ढंग से बनाता है, फिर धीरे-धीरे बाहर की ओर सड़कों का विस्तार करता है।

पहली गली के फ़ासाड के विवरण, ईंटों की दीवार की बनावट, खिड़की के ऊपरी भाग के नक्काशीदार डिज़ाइन और आग बुझाने की सीढ़ियाँ स्थापित कर दी गई हैं।
हालांकि पूरी न्यूयॉर्क बनाने में कई महीने बाकी हैं, लेकिन एस्ट्रा पहला मॉडल है जो इन जटिल वातावरणों का वास्तविक रूप से उपयोग कर सकता है।
यह एक अत्यधिक हार्डवेयर-भारी पागल प्रक्रिया है।
मैट के लिविंग रूम में एक छोटा डेटा सेंटर जैसा महसूस होता है: एक मैक मिनी रसोई में रखा है, तीन मैकबुक प्रो चाय की मेज पर रखे हैं जिनके पंखे तेजी से घूम रहे हैं, और क्लाउड में एक मशीन एजेंट्स से भर गई है।
सबसे अविश्वसनीय बात यह थी कि जब डिस्क लगभग भर जाने लगा, तो उसने एस्ट्रा को एक अस्थायी सिस्टम लिखने के लिए कहा: पुराने थ्रेड्स को क्लाउड पर स्थानांतरित करें, स्थानीय प्रतियाँ हटा दें, और जब खोलें तो फिर से डाउनलोड करें।
उसके शब्दों में: एक AI को कंप्यूटर की देखभाल के लिए नियुक्त करना, ताकि कंप्यूटर और अधिक AI को नियुक्त कर सके, यह खुद ही काफी जादुई है।
Astra ने सभी मैदान नहीं जीते
बेशक, मैट ने एस्ट्रा के पक्ष में एकतरफा रुख नहीं अपनाया।
उसके अनुसार, Astra की वास्तविक शक्ति इंजीनियरिंग, कंप्यूटर ऑपरेशन और लंबे कार्यों में है, लेकिन सौंदर्य और 3D सामग्री बनाने के मामले में Claude अभी भी बेहतर है।
प्रकाशन दिन, एक नेटिजन ने एक तुलना तैयार की:
एक ही निर्देश के साथ, Fable 5.1 और GPT-6 Astra को अलग-अलग Blender में समुद्र तट पर एक विला बनाने के लिए कहें। बाएं ओर Fable 5.1 है, दाएं ओर GPT-6 Astra है।

अंतर बहुत बड़ा लग रहा है।

Same villa task, left is Fable 5.1, right is GPT-6 Astra. (Credit: @karankendre)
लेकिन यह केवल एक बार की तुलना का सुझाव है, जिसमें प्रॉम्प्ट शब्द और प्रयासों की संख्या खुलासा नहीं किए गए हैं, यह मैट के निर्णय की दिशा के विपरीत है और दोनों की समग्र दृश्य क्षमता का प्रतिनिधित्व नहीं करता है।
मैट का अपना निर्णय है: मॉडल को Three.js या Blender में सीधे सुंदर चीजें "बनाने" के लिए, Claude अभी भी अधिक मजबूत है; लेकिन जब उन्हें Unreal में डाला जाता है, तो Astra पहली बार मौजूदा संपत्तियों और प्रकाश का उपयोग करके आगे निकल गई।
वह भी अनुमान लगाते हैं कि Fable 5.1 Unreal पर चलाने में काफी सुधार होगा, और विशेष तुलनात्मक समीक्षा अभी चल रही है।
इसलिए, मॉडल स्तर का अंतर अभी भी मौजूद है, लेकिन अब यह "कौन समग्र रूप से अधिक मजबूत है" से बदलकर "कौन किस अवधि में अधिक मजबूत है" हो गया है।
वास्तविक अंतर व्यवस्था स्तर द्वारा बनाया जाता है।
जब अग्रणी मॉडल एक समान क्षमता अंतराल में प्रवेश करते हैं, तो मॉडल के बाहर की चीजें: आप उन्हें कैसे व्यवस्थित करते हैं, उन्हें कौन से उपकरण और परिवेश प्रदान करते हैं, और आप कितनी समानांतर गणना का खर्च उठा सकते हैं, वे आपके द्वारा वास्तविक रूप से कितना मूल्य उत्पन्न किया जा सकता है, यह तय करने लगती हैं।
संदर्भ: https://x.com/mattshumer_/status/2095609734845927525
यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI उपदेश; संपादक: युआनयू
