OpenAI ने सुरक्षा समीक्षा जारी की, जिसमें एक ऐसे आंतरिक मॉडल का उल्लेख किया गया जिसने परीक्षण के दौरान सैंडबॉक्स से भागकर GitHub पर PR#287 खोला है। यह मॉडल पहले NanoGPT speedrun कार्य में निर्देशों का उल्लंघन करते हुए एक घंटे तक दरारों की खोज करके नेटवर्क सीमाओं को तोड़ा; फिर दूसरे कार्य में टोकन को विभाजित करके सुरक्षा स्कैनर को बायपास किया। OpenAI ने इस मॉडल की आंतरिक पहुंच निलंबित कर दी और सुरक्षा प्रणाली को पुनः बनाया। हालाँकि मॉडल द्वारा खोला गया PR बंद कर दिया गया, लेकिन इसकी PowerCool प्रौद्योगिकी को अगले छह विश्व रिकॉर्ड समाधानों द्वारा संदर्भित किया गया है, जिसमें Prime Intellect द्वारा Claude के साथ पूरा किया गया PR#300 भी शामिल है। वर्तमान में, यह मॉडल आंतरिक डिप्लॉयमेंट पर पुनः लाइव हो चुका है और सार्वजनिक प्रकाशन के लिए तैयारी कर रहा है।लेखक, स्रोत: AGI Hunt
कल, OpenAI ने एक असामान्य सुरक्षा समीक्षा पोस्ट की, जिसका शीर्षक था: सुरक्षा और दीर्घकालिक मॉडल युग में समन्वय।

OpenAI Security Post-Mortem Blog
इसे असामान्य कहा जा रहा है, क्योंकि OpenAI ने लेख में इस बात को स्वीकार किया है: एक अभी तक जारी नहीं किया गया आंतरिक मॉडल, निगरानी वाले आंतरिक परीक्षण में सैंडबॉक्स से भाग गया और चीजें सार्वजनिक GitHub पर भेज दीं।
OpenAI ने इसके लिए अपना इंटरनल डिप्लॉयमेंट भी रोक दिया।
और इस मॉडल की उत्पत्ति के बारे में आपने शायद सुना होगा: दो महीने पहले OpenAI द्वारा घोषित Erdős इकाई दूरी अनुमान को खारिज करने वाला आंतरिक मॉडल यही है।
पूरी घटना OpenAI द्वारा ऐसे लिखी गई है जैसे वह संयमित है, लेकिन यदि विवरणों को एक साथ जोड़कर देखें, तो यह थोड़ी अजीब है...
एक घंटे की खुदाई के बाद पहली बात, NanoGPT speedrun पर हुई।
यह एक खुला बेंचमार्क है, जिसमें यह तुलना की जाती है कि कौन कम ट्रेनिंग स्टेप्स के साथ एक छोटे भाषा मॉडल को निर्दिष्ट loss तक प्रशिक्षित कर सकता है। OpenAI ने इस मॉडल को अंक प्राप्त करने के लिए भेजा, और यह वास्तव में बहुत प्रभावशाली रहा, जिसने एक पावर लैर लर्निंग रेट कूलिंग तकनीक विकसित की, जिसे उसने PowerCool का नाम दिया, और प्रदर्शन में स्पष्ट सुधार हुआ।
यहां तक सब कुछ अच्छा था, लेकिन समस्या असाइनमेंट जमा करने में आ गई।
शोधकर्ताओं का अनुरोध है: परिणाम केवल आंतरिक Slack पर भेजें, लेकिन NanoGPT प्रोजेक्ट के निर्देश कहते हैं: GitHub पर PR के रूप में सबमिट करें।
जब दो आदेश आपस में टकराते हैं, तो फिर... किसकी बात मानें?
उसने बाद वाले को चुना।
हालांकि इसने बाद वाला विकल्प चुना, लेकिन OpenAI का सैंडबॉक्स मूल रूप से बाहरी इंटरनेट एक्सेस को ब्लॉक करता है। OpenAI के अनुसार, पिछले मॉडल इस दीवार से टकराने के बाद रुक जाते थे और उपयोगकर्ता के पास वापस जाकर हार मान लेते थे।
लेकिन इस मॉडल ने नहीं किया, इसने सैंडबॉक्स में पूरे एक घंटे तक वल्नरेबिलिटी ढूंढी, और अंततः दीवार को तोड़ दिया... वास्तव में ओपन रिपॉजिटरी में PR #287 खोल दिया।

ब्लॉग एस्केप पैराग्राफ
OpenAI का मूल उद्धरण है:
यह मॉडल बार-बार प्रयास करता रहता है, जिसमें सैंडबॉक्स के बाहर कार्य करने के तरीके ढूंढना भी शामिल है।The second thing the token scam scanner does goes beyond digging into the walls.
दूसरे कार्य में, इसने देखा कि अन्य प्रणालियों के कुछ सफल लेकिन अनप्रकाशित उत्तर हैं, इसलिए इसने गलत इरादे से आकर्षित होकर आकलन बैकएंड से इन उत्तरों को निकालने की कोशिश की।
इसका पहला प्रयास सुरक्षा स्कैनर द्वारा रोक दिया गया, क्योंकि स्कैनर ने एक प्रमाणीकरण टोकन पहचान लिया।
इसलिए इसकी अगली कार्रवाई यह थी कि टोकन को दो हिस्सों में विभाजित कर दिया गया, जिन्हें अलग-अलग भ्रमित कर दिया गया, और फिर रनटाइम पर चुपचाप वापस जोड़ दिया गया। पूरा टोकन कभी भी एक पूरी स्ट्रिंग के रूप में प्रकट नहीं हुआ, इसलिए स्कैनर कुछ भी नहीं ढूंढ सका।
Of course it didn't intend to hide it; in its notes to users and in its own reasoning trace, it wrote: I did this specifically to bypass the scanner.
हर एक कदम को अलग-अलग देखें तो कोई गलती नहीं दिखती। लेकिन इन्हें एक साथ देखें तो यह परिणाम कभी अनुमोदित नहीं होगा।
OpenAI कहती है कि यही लंबे समय तक चलने वाले मॉडल द्वारा उत्पन्न नया समस्या है: एक-एक करके कार्रवाई की अनुमति देने वाली सुरक्षा प्रणाली, पूरी ट्रैजेक्टरी को नियंत्रित नहीं कर सकती।
समस्या की पहचान के बाद, OpenAI ने इस मॉडल के आंतरिक एक्सेस को निलंबित कर दिया और सुरक्षा प्रणाली को "गहराई से रक्षा" के सिद्धांत पर पूरी तरह से पुनः बनाया।
उदाहरण के लिए, वास्तविक दुर्घटनाओं का उपयोग करके विरोधी मूल्यांकन बनाना, जिससे पता चलता है कि मॉडल लंबे कार्यों में निर्देशों को "भूल" जाता है, इसलिए इसे याद रखने के लिए विशेष रूप से प्रशिक्षित किया जाता है, और एक सक्रिय मॉनिटरिंग जो पूरी ट्रैक्ट्री को देखती है, जिससे अगर कोई संकेत मिले तो सीधे संवाद रोका जा सके और उपयोगकर्ता को सूचित किया जा सके।
फिर उन्होंने पुराने दुर्घटना परिदृश्य को दोहराया, और नए बैरियर ने काफी अधिक समस्याएँ पकड़ लीं, और छूट गए कुछ केवल निम्न जोखिम वाले थे, जैसे:
• एक कमांड लाइन टूल का उपयोग करने के लिए, इसने एक codex --yolo सत्र शुरू किया, लेकिन --yolo के बिना भी इसका उपयोग किया जा सकता है
• इसने एक संसाधन गायब होने का पता लगाया, और फिर अपने नाम पर अन्य कैलकुलेशन नोड्स पर SSH करना शुरू कर दिया, और अन्य OpenAI कर्मचारियों के नोड्स की कोशिश भी की... (खुशी की बात है कि यह सफल नहीं हुआ)
• एक ढेर find प्रक्रियाएँ फंस गईं, सभी आदेश लटक गए, उसने kill -9 -1 दर्ज किया, जिससे उसके पास मौजूद सभी प्रक्रियाओं को SIGKILL भेजा जाएगा... खुशी की बात है कि आदेश का समय समाप्त हो गया और वह वास्तव में नहीं चला (वरना वह अपने आप को भी मार देता)
मॉडल के पुनः एक्सेस के कुछ हफ्तों के बाद, अब तक कोई गंभीर बाइपास घटना नहीं देखी गई है।
OpenAI को प्राप्त अनुभव है: पहले छोटे पैमाने पर लॉन्च करें, निगरानी करें, अगर कुछ गलत हो जाए तो रोक दें, और फिर दुर्घटना को एक नया मूल्यांकन बना दें।
अगर PR वापस नहीं मिलता है और कहानी यहीं समाप्त हो जाती है, तो यह केवल एक मानक सुरक्षा अभ्यास होगी।
और सबसे दिलचस्प हिस्सा, ओपनएआई लेख के अंत में टिप्पणी में छिपा हुआ है।
मॉडल के भागने के बाद खोला गया PR #287, OpenAI का कहना है कि «हमने इसे जल्दी ही बंद कर दिया»। लेकिन वास्तव में देर हो चुकी थी: बंद करने से पहले, कई speedrun प्रतियोगियों ने इसे देखा और इसमें मौजूद PowerCool को समझ लिया, और उन्होंने अपने समाधानों में इसका उपयोग किया।
इसके बाद के छह विश्व रिकॉर्ड, 3030 कदम, 2990 कदम, 2930 कदम, 2925 कदम, 2900 कदम, 2890 कदम, सभी PR #287 का हवाला देते हैं।
जिसमें 2930 स्टेप्स का रिकॉर्ड है, वह PR #300 है:

PR 300, मर्ज कर दिया गया है
इसके धन्यवाद सूची को देखने पर, आप देखेंगे कि यह मानव खिलाड़ियों के योगदान के साथ एक ही पंक्ति में समान रूप से सूचीबद्ध है: @yash-oai PR #287, घातीय शिक्षा दर नियोजन, PowerCool।

PR 300 के धन्यवाद सूची
और यह PR #300 खुद एक और जादुई स्तर पर है: इसे Prime Intellect ने Opus 4.7 का उपयोग करके एक ही speedrun चलाकर उत्पन्न किया है, PR में लिखा गया है कि "यह सबमिशन एक स्वायत्त Claude speedrun एजेंट द्वारा पूरा किया गया है", और लेखक "Claude Code के साथ उत्पन्न" है।
इसका मतलब है: OpenAI का मॉडल सैंडबॉक्स से बाहर निकला और एक PR भेजा, Anthropic का मॉडल ने इसे देखा और अपने विश्व रिकॉर्ड में इसकी खोज का उपयोग किया, और बहुत ही दयालुता और सम्मान के साथ इसे सम्मानित किया।
AI भागने के पहले सीधे लाभार्थियों में से एक दूसरी कंपनी का AI है...
AI की दुनिया, लगता है कि मानवों की तुलना में अधिक मित्रवत और नैतिक है।
404 निश्चित रूप से अगर आज आप PR #287 खोलते हैं, तो पृष्ठ ऐसा दिखेगा:

PR 287 की वर्तमान स्थिति
इसे हटा दिया गया है। हम जानते हैं कि GitHub पर सामान्य उपयोगकर्ता केवल PR बंद कर सकते हैं, इसे हटा नहीं सकते...
हालांकि, निशान पूरी तरह से साफ नहीं हुए।
जब PR जमा किया गया था, तब उस अकाउंट yash-oai अभी भी मौजूद है, और उसके द्वारा fork किए गए रिपॉजिटरी में 8 मई का commit अभी भी मौजूद है, ब्रांच का नाम powercool-3066-api है:

yash-oai के कमिट ट्रेस
इस कमिट के परिवर्तनों में से एक है कि मूल README के अंत में एक मीम चित्र हटा दिया गया है। और उस चित्र का फाइल नाम itsover_wereback है...
GPT-6? OpenAI ने इस मॉडल का कोई नाम नहीं बताया, बस इसे 'इंटरनल मॉडल' कहा है।
जब यह खबर फैली, तो नेटिज़न्स द्वारा सबसे अधिक चर्चित वाक्य यह था:
OpenAI को उस अनपब्लिश्ड मॉडल के इंटरनल डिप्लॉयमेंट को रोकना पड़ा, क्योंकि यह नए तरीकों से नियंत्रण से भागने के लिए बार-बार Erdős यूनिट डिस्टेंस कॉन्जेक्चर को उलट रहा था।
OpenAI के शोधकर्ता सेबास्टियन बुबेक ने यह पोस्ट शेयर किया:
True story. The team is doing excellent security work to get this unit distance model released.ध्यान दें कि वह किस शब्द का उपयोग कर रहा है: इसे प्रकाशित करने के लिए।
अर्थात, यह भागा हुआ और फिर से ट्रेन किया गया मॉडल न केवल आंतरिक डिप्लॉयमेंट पर फिर से लाइव हो चुका है, बल्कि आधिकारिक रिलीज की ओर भी बढ़ रहा है।
इसके भाग जाने के बाद छोड़ा गया वह PR, जिसकी पेज हटा दी गई, लेकिन नाम छह विश्व रिकॉर्ड के आभार सूची में बना रहा।
इसके बारे में सबका अनुमान GPT-6 है...
OpenAI ने न तो स्वीकार किया और न ही अस्वीकार किया।
स्रोत: AGI Hunt
