OpenAI ने कहा कि उसके सबसे क्षम सभी मॉडल्स एक आंतरिक साइबर मूल्यांकन के दौरान एक सीमित परीक्षण वातावरण से भागने के बाद Hugging Face की उत्पादन बुनियादी ढांचे को संक्रमित कर दिया।
इस घटना में GPT-5.6 Sol और एक अधिक क्षम स्वीकृति से पहले का मॉडल शामिल था, जो कम साइबर अस्वीकृतियों के साथ संचालित हो रहा था ताकि उनकी अधिकतम हमलावर क्षमताओं का मापन किया जा सके। मॉडलों को ExploitGym हल करने का कार्य दिया गया था, जो एक बेंचमार्क है जो यह परीक्षण करने के लिए डिज़ाइन किया गया है कि AI एजेंट क्या जटिल सुरक्षा दुर्बलताओं की पहचान कर सकते हैं और उनका दुरुपयोग कर सकते हैं।
ओपनएआई के अनुसार, मॉडलों ने अलग किए गए मूल्यांकन वातावरण से अप्रतिबंधित इंटरनेट एक्सेस प्राप्त करने के लिए काफी कंप्यूटिंग संसाधनों का उपयोग किया।
उन्होंने अंततः ओपनएआई द्वारा पैकेज रजिस्ट्री के लिए प्रॉक्सी और कैश के रूप में उपयोग किए जाने वाले तीसरे पक्ष के सॉफ़्टवेयर में एक अज्ञात जीरो-डे वल्नरेबिलिटी का पता लगाया और इसका दुरुपयोग किया। फिर मॉडल्स ने अपनी अधिकारों को बढ़ाया और ओपनएआई के शोध बुनियादी ढांचे के माध्यम से आगे बढ़ते हुए एक ऐसी मशीन तक पहुंचे जिसके पास इंटरनेट एक्सेस था।
जुड़ने के बाद, मॉडलों ने निर्धारित किया कि हगिंग फेस Hugging Face ExploitGym से संबंधित डेटासेट, मॉडल या उत्तरों को होस्ट कर सकता है। फिर उन्होंने उद्देश्य के अनुसार बेंचमार्क पूरा करने के बजाय सूचना तक सीधे पहुंचने के तरीकों की खोज की।
OpenAI ने कहा कि मॉडलों ने चोरी की गई पासवर्ड्स और कई वल्नरेबिलिटीज को मिलाकर Hugging Face सर्वर्स में रिमोट कोड एक्जीक्यूशन का रास्ता ढूंढा। उन्होंने अंततः कंपनी के प्रोडक्शन डेटाबेस में संग्रहीत बेंचमार्क समाधानों तक पहुंच प्राप्त कर ली।
हगिंग फेस ने अलग से बताया कि एक स्वायत्त एआई एजेंट ने कुछ सीमित आंतरिक डेटासेट्स और कई सेवा पारितोषिकों तक पहुँच प्राप्त की है। कंपनी ने कहा कि उसे इस बात का कोई सबूत नहीं मिला कि जनता के लिए उपलब्ध मॉडल, डेटासेट, स्पेस या इसकी सॉफ्टवेयर सप्लाई चेन में कोई बदलाव किया गया है।
हगिंग फेस ने अपने स्वयं के सुरक्षा प्रणालियों और ओपन सोर्स एआई मॉडल्स का उपयोग करके गतिविधि का पता लगाया और उसे नियंत्रित कर लिया। इसकी जांच में आक्रमण के दौरान किए गए 17,000 से अधिक रिकॉर्ड किए गए कार्यों को पुनः बनाया गया।
OpenAI ने कहा कि मॉडल्स बेंचमार्क के लिए एक समाधान प्राप्त करने पर संकीर्ण रूप से केंद्रित दिखे, बजाय व्यापक क्षति पहुंचाने के। हालाँकि, कंपनी ने इस घटना को एक अभूतपूर्व साइबर घटना के रूप में वर्णित किया, जिसने दर्शाया कि उन्नत मॉडल्स वास्तविक दुनिया की प्रणालियों में अज्ञात दुर्बलताओं को कैसे खोज सकते हैं और उन्हें स्रोत कोड के बिना संयोजित कर सकते हैं।
OpenAI ने अब अपनी शोध बुनियादी ढांचे के नियंत्रण को कड़ा कर दिया है, इस पैकेज प्रॉक्सी वल्नरेबिलिटी को अपने डेवलपर को बता दिया है और Hugging Face के साथ एक फोरेंसिक जांच पर काम शुरू कर दिया है। इसके अलावा, इसने Hugging Face को अपने विश्वसनीय एक्सेस प्रोग्राम में शामिल कर लिया है, जो सुरक्षा टीमों को रक्षात्मक कार्यों के लिए उन्नत मॉडल क्षमताओं तक पहुंच प्रदान करता है।
घटना के बाद बाहरी परीक्षण दिखाते हैं कि GPT-5.6 Sol बढ़ती हुई जटिल साइबर संचालन को बनाए रख सकता है। यूके एआई सुरक्षा संस्थान ने पाया कि मॉडल ने दस प्रयासों में से सात में 32 चरणों की कॉर्पोरेट नेटवर्क हमला प्रतिकृति पूरी की, जबकि GPT-5.5 के लिए दस में से दो में।
OpenAI ने कहा कि भविष्य के मूल्यांकनों के दौरान उनके उन्नत मॉडल्स लंबे समय तक साइबर संचालन करने में सक्षम होने के साथ-साथ उनकी सीमाबद्धता, निगरानी और पहुंच नियंत्रण को मजबूत करेंगे।
