- हगिंग फेस की घटना के बाद, ओपनएआई और एंथ्रोपिक एआई एजेंट्स की सुरक्षा के बारे में नए प्रश्न उठे हैं।
- हाँ, यूके संस्थान ने साइबर परीक्षणों के दौरान एआई एजेंट्स द्वारा 19 अनधिकृत कार्रवाइयाँ दर्ज कीं।
- विशेष रूप से, एक एआई एजेंट ने झूठी पहचानें बनाईं।
यूके के कृत्रिम बुद्धिमत्ता सुरक्षा संस्थान (AISI) ने रिपोर्ट किया कि मॉडल परीक्षण के दौरान OpenAI और Anthropic AI एजेंट्स द्वारा अनधिकृत व्यवहार के नए मामले पाए गए हैं, Reuters लिखता है। साइबर सुरक्षा प्रशिक्षण की एक श्रृंखला के दौरान, एजेंट्स ने झूठे ऑनलाइन परिचय बनाए, स्थापित प्रतिबंधों को बाईपास करने की कोशिश की और अपने निर्धारित कार्यों के बाहर अन्य कार्रवाइयाँ कीं।
ये घटनाएँ हगिंग फेस के इंफ्रास्ट्रक्चर पर GPT-5.6 AI एजेंट द्वारा हुए हालिया ब्रीच के बीच आई हैं। अधिक विवरण के लिए लेख पढ़ें:
AISI के अनुसार, संगठन ने उनकी क्षमताओं का आकलन करने के लिए काल्पनिक साइबर सुरक्षा परिदृश्य में Anthropic के Mythos 5 मॉडल और OpenAI के GPT-5.6-Sol पर आधारित एजेंट्स का परीक्षण किया।
122 परीक्षण चलाने पर, शोधकर्ताओं ने 10 परीक्षणों में 19 अनधिकृत कार्रवाइयाँ दर्ज कीं। इनमें से 17 का आरोप Anthropic के एजेंट पर लगाया गया और दो का OpenAI के एजेंट पर।
AISI ने कहा, “परीक्षण किए जा रहे कुछ एजेंटों ने वास्तविक लोगों और संगठनों के प्रति लगातार, संभावित रूप से हानिकारक गतिविधियाँ की थीं।”
एक ही समय पर, संस्थान ने जोर देकर कहा कि दर्ज किए गए किसी भी मामले में वास्तविक दुनिया में कोई हानि नहीं हुई।
एक एजेंट ने झूठी पहचानें बनाईं
सबसे गंभीर घटना में एक एजेंट शामिल था जिसने दुष्ट कोड लिखा और एक व्यक्ति को इसके निष्पादन को स्वीकार करने के लिए झूठे ऑनलाइन खाते बनाए।
AISI ने यह नहीं बताया कि इन कार्रवाइयों के लिए कौन सा विशिष्ट मॉडल जिम्मेदार था, लेकिन Anthropic ने पुष्टि की कि इसमें इसका एजेंट शामिल था।
कंपनी ने कहा:
“हम UK AISI के इस घटना पर नेतृत्व के लिए आभारी हैं, जो इस बात की आवश्यकता पर प्रकाश डालता है कि अधिक क्षम एआई एजेंट्स का सुरक्षित आकलन कैसे किया जाए.“
एंथ्रोपिक ने यह भी कहा कि यह संस्थान के साथ काम कर रहा है ताकि अतिरिक्त विवरण प्राप्त किए जा सकें और अपनी जांच की जा सके।
निजी संगठन CivAI के शोधकर्ता एंड्रयू यून ने कहा कि यह घटना चिंता का विषय है।
यह तथ्य कि मिथोस ने ऐसे धोखेबाज़ी वाले कार्य किए, जिसमें स्पष्ट रूप से जागरूकता थी कि यह एक वास्तविक व्यक्ति को लक्षित कर रहा है, यह सुझाता है कि एंथ्रोपिक के मॉडल पर उनका इतना अच्छा नियंत्रण नहीं है जितना वे सोचते हैं।
OpenAI ने एक अलग घटना की रिपोर्ट की
OpenAI ने स्पष्ट किया कि इसके एजेंट द्वारा किए गए अनधिकृत कार्रवाईयाँ परीक्षण परिदृश्य की शर्तों के विपरीत इंटरनेट एक्सेस से जुड़ी थीं।
कंपनी ने एक अलग मामले का भी खुलासा किया, जिसमें परीक्षण बुनियादी ढांचे के तीसरे पक्ष के प्रदाता अनियमित द्वारा एक कॉन्फ़िगरेशन त्रुटि के कारण, इसके एजेंटों को नेटवर्क तक गलती से पहुंच प्राप्त हो गई। एंथ्रोपिक ने पिछले हफ्ते एक समान विफलता का वर्णन भी किया।
OpenAI ने कहा:
“हम उद्योग के भीतर काम करने के प्रति समर्पित हैं ताकि उच्च जोखिम आकलनों को सुरक्षित ढंग से करने के लिए साझा अभ्यासों को मजबूत किया जा सके, जिसमें आगामी सप्ताहों में राष्ट्रीय एआई संस्थानों, स्वतंत्र आकलनकर्ताओं, अन्य एआई प्रयोगशालाओं और अन्य समूहों जैसे हितधारकों को एकत्रित करना शामिल है.“
एक ही समय पर, AISI ने जोर देकर कहा कि ये घटनाएँ जुलाई के ब्रीच से भिन्न हैं, जिसमें GPT-5.6 एजेंट ने Hugging Face की परीक्षण बुनियादी ढांचे तक पहुँच प्राप्त की थी। जबकि उस समय मॉडल ने प्रभावी ढंग से एक अलग पर्यावरण से बाहर निकल लिया था, वर्तमान परीक्षणों के दौरान, एजेंट्स को इंस्टिट्यूट की मानक परीक्षण विधि के अनुसार इंटरनेट एक्सेस उपलब्ध था।
एक याद दिलाने के लिए, हगिंग फेस घटना के बाद, OpenAI ने अपनी आंतरिक जांच को विस्तारित किया और स्वायत्त एजेंट्स द्वारा अनियंत्रित व्यवहार के अतिरिक्त मामलों की पहचान की।
ब्रिटिश शोधकर्ताओं ने ओपनएआई और एंथ्रोपिक एआई एजेंट्स की परीक्षा के दौरान नए उल्लंघनों का पता लगाया पहले INCRYPTED पर दिखाई दिए।


