GPT-6 केवल Astra ही नहीं है!
Astra केवल कुछ दिन पहले लॉन्च हुआ है, और GPT-6 Sol को अभी आंतरिक टेस्टिंग के दौरान पाया गया है।

Performance is also outstanding, with a single test speed six times that of Astra.
अनुमान लगाएं: क्या Terra और Luna भी रास्ते में हैं?
और उसी दिन, OpenAI ने अभी एक सेट आंतरिक डेटा प्रकाशित किया:
अब तक, 8 घंटे के कार्यदिवस के आधार पर, OpenAI शोधकर्ता प्रति दिन के साथ 3 से अधिक मल्टी-एजेंट दिन समानांतर रूप से कार्यरत होते हैं।
API मूल्य के आधार पर, OpenAI के माध्यमिक शोधकर्ता द्वारा दिनभर में उपयोग किए जाने वाले एजेंट निष्कर्षण संसाधन 600 डॉलर से अधिक हैं।

OpenAI ने यह भी घोषणा की है कि उन्होंने 'ऑटोमेटेड रिसर्च इंटर्न' को प्राप्त कर लिया है:
ये एजेंट मानवीय निर्देशों के साथ, उन कार्यों को पूरा कर सकते हैं जिन्हें अनुसंधानकर्ताओं को कई दिन लगते थे।
लाओ हुआंग भी कहते हैं: AGI आ चुका है!

उन्होंने बताया कि Astra लगभग 100,000 यूनिट NVIDIA Grace Blackwell NVLink72 का उपयोग कर रही है, और अगले 400,000 यूनिट GPU जल्द ही लाइव होंगे।
लगता है कि यह लहर सचमुच OpenAI की तरफ से अकेले बढ़ावा नहीं है ~
GPT-6 SOL को आंतरिक परीक्षण के लिए शुरू किया गया है
एक नेटिजन लेंटिल्स ने दावा किया कि OpenAI GPT-6 Sol का आंतरिक परीक्षण कर रहा है।
उन्होंने कहा कि Sol की कुल आउटपुट क्षमता हाल ही में लॉन्च किए गए Astra की तुलना में स्पष्ट रूप से कम है, लेकिन यह अधिक तेज़ है और अभी भी 'मोन्स्टर-लेवल' मॉडल है।
कितना तेज़? एकल परीक्षण गति लगभग एस्ट्रा की 6 गुना है।
नेटिजन लायरा ने एक ही कार्य को विभिन्न मॉडलों के लिए टेस्ट किया: मॉडल को एक BMW M4 Competition का SVG चित्र बनाने के लिए कहा।
इसमें, GPT-6 Sol ने मैक्स स्तर और जीरो-शॉट जनरेशन का उपयोग किया, जिसमें लगभग 3 मिनट का समय लगा और लगभग 28,000 टोकन उत्पन्न हुए।

GPT-6 Astra के Max स्तर का उपयोग करके, लगभग 2.5 लाख टोकन आउटपुट और लगभग 19 मिनट का समय लगता है।

Gemini 3.1 DeepThink को High स्तर पर शुरू किया गया, जिसमें लगभग 3300 टोकन का आउटपुट दिखाया गया, लेकिन निष्कर्ष निकालने की प्रक्रिया में लगभग 4.58 लाख टोकन का उपयोग हुआ और लगभग 29 मिनट का समय लगा।

Gemini 3.8 Flash भी High डिग्री पर सक्रिय है, जिसने लगभग 42 सेकंड में लगभग 19,000 टोकन उत्पन्न किए।

इसके विपरीत, Sol सबसे अधिक ध्यान आकर्षित करता है: इसका आउटपुट स्केल Astra के समान है, लेकिन प्रति परीक्षण गति लगभग Astra की 6 गुना है—इसमें केवल उसका लगभग छठा हिस्सा समय लगता है।
इसके अलावा, नेटिजन Lentils ने एक पिक्सेल-स्टाइल सैंडबॉक्स वर्ल्ड प्रोटोटाइप, "The Realm of Aurellune" भी प्रदर्शित किया।

GPT-6 ने एक ही बार में शहर, खेत, नदियाँ, किले और एक संक्षिप्त मानचित्र बना दिया, साथ ही दिन-रात का परिवर्तन, स्थानों के नाम रखना और विवरण समायोजित करने जैसे कंट्रोल पैनल भी जोड़े, जिससे यह एक पहले से तैयार मॉडल वाला सिमुलेशन सिमुलेशन गेम जैसा लगता है।
यह zero-shot, Max इन्फरेंस लेवल, 15 मिनट, कुल 60,000 टोकन के खर्च पर उत्पन्न प्रभाव है।
वर्तमान में अनुमान लगाया जा सकता है कि Astra उच्चतम कठिनाई के गहन तर्क की ओर झुकता है, जबकि Sol संभवतः गति, संसाधन क्षमता और स्केलेबल एजेंट कॉल की ओर झुकता है।
सॉल के लॉन्च के संबंध में, नेटिज़न पंकज कुमार ने कहा कि इसे 29 सितंबर को ओपनएआई डेवलपर कॉन्फ्रेंस पर आधिकारिक रूप से लॉन्च किया जा सकता है।

GPT-6, Terra, Luna और GPT-Image 2.5 के एक साथ आने की भी अनदेखी नहीं की जा सकती।

OpenAI के शोधकर्ता, प्रति व्यक्ति 3 एजेंट इंटर्न्स के साथ काम पर आते हैं
उसी दिन, ओपनएआई ने एक दिलचस्प आंतरिक डेटा सेट भी प्रकाशित किया—AI मॉडल ने अपने प्रयोगशाला में अनुसंधान को कितना तेज कर दिया है।
इस साल अगस्त के मध्य तक, शोधकर्ता प्रत्येक 8 घंटे के शिफ्ट के पीछे लगभग 3.1 एजेंट-दिन के कार्य एक साथ चल रहे थे।
वाह, एक व्यक्ति तीन अनिद्रा इंटर्न के साथ!~

खर्च की बात करें तो, API कीमत के अनुसार, मध्यिका शोधकर्ता प्रतिदिन 600 डॉलर से अधिक के Agent निष्कर्षण संसाधनों का उपयोग करता है।
It's almost a day's salary for a junior engineer.

ये एजेंट वास्तव में क्या कर रहे हैं?
शोध कोड लिखें, बुनियादी ढांचा कोड लिखें, प्रशिक्षण वातावरण स्थापित करें, मूल्यांकन प्रयोग चलाएं, उपकरण और वातावरण की समस्याओं का निदान करें, प्रयोग परिणामों का विश्लेषण करें, प्रशिक्षण कार्यों का निरीक्षण करें... और शोध निष्कर्षों को संगठित करने और संवाद करने में भी हाथ डालें।
वास्तव में, यह कुछ भी कर सकता है, बस यह यह तय नहीं कर सकता कि क्या अध्ययन करना है।
एक सबसे स्पष्ट परिवर्तन यह है कि पहले जब परीक्षण वातावरण बंद हो जाता था, तो शोधकर्ताओं को आंतरिक चैनल पर लोगों को बुलाना पड़ता था; अब एजेंट इस तरह के मामलों को अपने आप संभालने लगे हैं, जिससे मानव द्वारा किए जाने वाले प्रश्नों की संख्या सीधे कम हो गई है।

कुछ टीमों ने सीधे निरंतर तकनीकी प्रश्नोत्तर समय को समाप्त कर दिया और लोगों को सिस्टम को सुधारने के लिए मुक्त कर दिया।
इन डेटा के आधार पर, OpenAI ने औपचारिक रूप से घोषणा की है कि 'ऑटोमेटेड AI रिसर्च इंटर्न' का लक्ष्य प्राप्त कर लिया गया है।
यहाँ का "इंटर्न" वास्तव में एक कार्यक्षम रिसर्च नोड है: मानव निर्देशन में, यह स्पष्ट सीमाओं वाले शोध कार्यों को स्वतंत्र रूप से पूरा कर सकता है, जिनमें से कुछ कार्य पहले अनुभवी शोधकर्ताओं को कई दिनों तक करने पड़ते थे।
प्रभाव तुरंत दिखा, शोधकर्ताओं के कोड आउटपुट और प्रयोगों की संख्या दोनों बढ़ रही हैं।

अगस्त 2026 में, प्रति व्यक्ति प्रयोगों की संख्या 2025 जनवरी से आंकड़े एकत्रित किए जाने के बाद से सर्वोच्च स्तर पर पहुंच गई, और एजेंट द्वारा लिए गए कार्य भी अधिक जटिल और अधिक लंबे चक्र के होते जा रहे हैं।

इस लेख के लेखक केविन लिउ ने इस बात को एक बड़े संदर्भ में रखा।
वह मानते हैं कि आने वाले कुछ वर्षों में AI क्षमताओं में छलांग लगाने का सबसे महत्वपूर्ण कारक रिकर्सिव सेल्फ-इम्प्रूवमेंट हो सकता है।
In simple terms, AI creates AI, and it gets faster the more it creates.

लेकिन समस्या यह है कि वर्तमान विकास के अनुसार, यह क्षमता डिफ़ॉल्ट रूप से केवल कुछ अग्रणी AI प्रयोगशालाओं के भीतर ही दिखाई देगी, और बाहरी लोगों के लिए यह देखना मुश्किल होगा कि इसकी प्रगति कहाँ तक पहुँच गई है।
इसलिए, लिउ का मानना है कि पारदर्शी उद्घाटन अब किसी भी समय से अधिक जरूरी है। मॉडल कितनी जल्दी मजबूत हो रहे हैं, और रिसर्च और विकास की गति पर क्या ब्रेक लगाना चाहिए, इसका फैसला केवल कुछ कंपनियों के बंद दरवाजों के पीछे नहीं होना चाहिए।
उसने अन्य AI कंपनियों को भी संबोधित किया: उन्हें भी इसी तरह के डेटा को प्रकाशित करना चाहिए।
हालांकि, AI अनुसंधान वास्तव में तेज़ हो गया है, लेकिन अभी तक पूरी तरह से स्वयंचालित नहीं हो पाया है।
OpenAI के डेटा के अनुसार, जिन कार्यों को पहले 4 से 8 घंटे लगते थे, पिछले छह महीनों में अधिकांश सफल मामलों में मनुष्य को कम से कम एक बार हस्तक्षेप करना पड़ा। उच्च स्तरीय शोध योजनाओं के मामले में, लगभग कभी भी Agent को सौंपा नहीं जाता।

शोधकर्ता अभी भी यह निर्णय लेने के लिए जिम्मेदार हैं कि क्या शोध किया जाए, कौन से परिणाम आगे बढ़ाने योग्य हैं, और कब ट्रेनिंग को बढ़ाया जाए, प्रयोग को रोका जाए या मॉडल को डिप्लॉय किया जाए।
OpenAI का अगला लक्ष्य भी तय हो गया है: 2028 तक 'ऑटोमेटेड AI रिसर्चर' को प्राप्त करना।
केवल स्पष्ट कार्यों को ही संभालने वाले "इंटर्न" की तुलना में, "शोधकर्ता" को अधिक खुले शोध लक्ष्यों को संभालना चाहिए और अपने लंबे समय तक चलने वाले प्रोजेक्ट्स को आगे बढ़ाना चाहिए—जिससे वह केवल कार्यान्वयनकर्ता से स्वतंत्र जिम्मेदार बन जाता है।
यदि GPT-6 Sol वास्तव में आंतरिक परीक्षण में है, तो यह लगभग निश्चित रूप से इस नए विकास मॉडल के तहत बनाया गया है:
अधिक GPU शक्ति के साथ, अधिक एजेंट समानांतर रूप से प्रयोग चला रहे हैं, और मानव शोधकर्ता उच्चतर स्तर पर स्थित हैं—दिशा चुनने, परिणामों का आकलन करने, और अंततः यह निर्णय लेने कि कौन सी चीजें अगली पीढ़ी के मॉडल में बदलने योग्य हैं।
अधिक शक्तिशाली AI, निगरानी करने में लगातार कठिन होता जा रहा है
उसी दिन, OpenAI के मुख्य वैज्ञानिक जैकुब पैचोकी ने एक दस हजार शब्दों का लेख जारी किया, जिसका शीर्षक सीधे —《बाह्य बुद्धि》— रखा गया।

मैंने इसे पढ़ने के बाद महसूस किया कि अर्थ है कि ओपनएआई के मुख्य वैज्ञानिक भी पूरे उद्योग को धीमा होने की सलाह दे रहे हैं...
जाकुब ने कहा कि AI मनुष्य द्वारा डिज़ाइन किए गए नक्शे के अनुसार एक चिप या एक नियम को जोड़कर बनाया गया नहीं है, बल्कि यह विशाल मात्रा में डेटा और कैलकुलेशन पावर में स्वयं 'उग' गया है।
आप कुछ पार्ट्स को अलग-अलग देख सकते हैं, लेकिन पूरी सिस्टम अचानक किस प्रकार की क्षमता प्राप्त करती है या अलग परिवेश में वह कैसे व्यवहार करेगी, कोई नहीं बता सकता।
अधिक परेशानी की बात यह है कि AI को मनुष्यों पर समग्र रूप से श्रेष्ठ होने की आवश्यकता नहीं होती है; बस काफी संख्या में महत्वपूर्ण क्षमताओं में मनुष्यों से बेहतर होने से, यह आपकी मदद कर सकता है और बड़ी समस्याएँ भी पैदा कर सकता है।
तो सवाल यह है: क्या मनुष्य अभी भी इसे समझ सकते हैं?
पिछले समय ओपनएआई द्वारा एआई का निगरानी करना मुख्य रूप से सोच के श्रृंखला को देखकर किया जाता था।
सरल शब्दों में, यह मॉडल द्वारा लिखे गए निष्कर्षण प्रक्रिया को देखना है, ताकि यह जांचा जा सके कि क्या यह धोखेबाजी, अधिकारों का दुरुपयोग, या सीमाओं को चकमा देने की कोशिश कर रहा है।
लेकिन अब एस्ट्रा की पीढ़ी में, यह तरीका काम नहीं कर रहा है।
पहले, मॉडल अब अपनी बातों को अधिक अच्छी तरह से "प्रबंधित" करने लगे हैं, और वास्तविक विचार हमेशा तर्क में नहीं लिखे जाते; दूसरे, एजेंट अब केवल "सोचकर उत्तर देने" तक सीमित नहीं है। यह उपकरणों का उपयोग करता है, कंप्यूटर का संचालन करता है, वातावरण चलाता है, और मनुष्यों और अन्य एजेंट्स के साथ सहयोग करता है।
इन बातों को एक साथ मिलाकर, शोधकर्ताओं के लिए प्रत्येक वाक्य की समीक्षा के लिए एक पूर्ण और पारदर्शी विचार श्रृंखला निकालना असंभव हो गया है।
OpenAI ने भी पाया कि Astra को अपनी तर्क प्रक्रिया पूरी तरह लिखने की आवश्यकता नहीं है, फिर भी वह जटिल कार्यों को सुलझा सकती है।
सरल शब्दों में, मॉडल पहले से ही "चुपचाप बड़े काम करना" सीख चुका है।

एक विशेष रूप से मॉडल को निगरानी से बचाने के लिए डिज़ाइन किए गए प्रतिरोधी परीक्षण में, एस्ट्रा ने कुछ ऐसी क्षमताएँ दिखाईं जो पीठ पर सिहरन पैदा कर देती हैं: परीक्षण स्कोर को जानबूझकर कम रखना, निगरानी को चकमा देना, और विनाशकारी कार्यों को निष्पादित करना।
ये सभी मानव द्वारा डिज़ाइन किए गए प्रेशर टेस्ट हैं, और OpenAI ने इसके आधार पर यह निष्कर्ष नहीं निकाला है कि Astra दैनिक कार्यों में सक्रिय रूप से धोखा देगी। लेकिन यह कम से कम स्पष्ट करता है कि सोच के श्रृंखला को देखकर ही मॉडल के सभी संभावित व्यवहारों को कवर करना मुश्किल हो गया है।
पिछली हगिंग फेस घटना को याद करें? वह एक चेतावनी थी।

उस समय, GPT‑5.6 Sol और एक अधिक शक्तिशाली आंतरिक अनुसंधान मॉडल को ExploitGym नेटवर्क रेंज में डाला गया, जिसका कार्य दुर्बलताएँ ढूँढना, हमला पूरा करना और Flag प्राप्त करना था। मॉडल की वास्तविक क्षमता का परीक्षण करने के लिए, मूल्यांकन पर्यावरण में पूर्ण सुरक्षा सुरक्षाएँ सक्रिय नहीं थीं।
परिणामस्वरूप, मॉडल ने समस्या का हल सीधे नहीं निकाला, बल्कि पहले नेटवर्क अलगाव को छोड़कर अनधिकृत चैनलों के माध्यम से एक-दूसरे के साथ संदेश भेजे और सहयोग किया।
फिर सॉफ्टवेयर पैकेज कैश प्रॉक्सी में ज़ीरो-डे वल्नरेबिलिटी का उपयोग करके पब्लिक इंटरनेट एक्सेस प्राप्त किया गया, और अंततः Hugging Face सिस्टम में प्रवेश करके ExploitGym के टेस्ट उत्तर ढूंढने की कोशिश की गई।

वास्तव में, यह मुख्य रूप से आंतरिक अध्ययन मॉडल IM1 द्वारा आगे बढ़ाया गया, GPT‑5.6 Sol ने कुछ हमले के मार्गों की पुनरावृत्ति की, और Astra ने भाग नहीं लिया।
मॉडल का मूल लक्ष्य अभी भी परीक्षण पूरा करना है, लेकिन उत्तर प्राप्त करने के लिए वे नियमों के छेदों की लगातार तलाश करते रहे और अंततः कार्य की सीमा से बाहर की क्रियाएँ करने लगे।
इसलिए, OpenAI ने एक खतरे का संकेत भी पढ़ा: जब Agent पर्याप्त शक्तिशाली हो, उपकरण पर्याप्त अधिक हों, और यह पर्याप्त लंबे समय तक चले, तो यह स्वयं नए मार्ग खोज सकता है, बाहरी संसाधनों का उपयोग कर सकता है, यहां तक कि अन्य Agents के साथ सहयोग कर सकता है।
नहीं... तो इस तरह से घूमने के बाद, क्या यह एक अटल बेंधन नहीं बन गया??
OpenAI को अधिक शक्तिशाली मॉडल की आवश्यकता है, जिनका उपयोग कोड लिखने, प्रयोग चलाने, अनुकूलन अनुसंधान करने और यहां तक कि अन्य AI के खिलाफ सुरक्षा प्रणालियां बनाने के लिए किया जा सके। जितना मॉडल अधिक शक्तिशाली होगा, उतने ही कार्य वह कर सकता है, और अनुसंधान की गति उतनी ही तेज होगी।
लेकिन इसी बीच, मनुष्य इसके निष्कर्ष निकालने के तरीके को समझने में अधिक कठिनाई महसूर कर रहे हैं, और अगर इसे एक अलग परिवेश में रखा जाए तो क्या यह मूल रूप से सीखे गए नियमों को फिर से व्याख्या करेगा।
जाकुब का मानना है कि अभी कोई भी प्रयोगशाला ऐसा दावा नहीं कर सकती कि उसने मॉडल को समायोजित और निगरानी कर लिया है, ताकि लंबे समय तक सबसे उच्चतम गति से मॉडल के स्केलिंग को सुरक्षित रूप से बढ़ाया जा सके।

जब तक एक सामान्य उद्योग-व्यापी सुरक्षा मानक स्थापित नहीं हो जाता, वह लोगों से उम्मीद करता है कि वे "स्वेच्छा से ब्रेक लगाना" एक समझौते के रूप में मान लें।
खुद OpenAI ने भी कहा है: यदि आवश्यकता हो, तो मॉडल के आकार को आगे बढ़ाने के बजाय एकतरफा रूप से रोकने की संभावना को नहीं अस्वीकार किया जाएगा।
तुम्हें ऐसा ही करना चाहिए… मुझे याद है कि A से शुरू होने वाली कंपनी ने भी ऐसा कहा था।
रेफरेंस लिंक:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
यह लेख वेचेन ग्रुप "Quantum Bit" से है, लेखक: तिंग यू
