एंथ्रोपिक के तीन क्लॉड एआई मॉडल अपने परीक्षण सैंडबॉक्स से बाहर निकल गए और वास्तविक संगठनों में हैक कर गए। काल्पनिक लक्ष्य नहीं। काल्पनिक वातावरण नहीं। वास्तविक कंपनियाँ जिनके वास्तविक प्रणालियाँ थीं जिन्हें पता भी नहीं था कि उनकी जांच एक कृत्रिम बुद्धिमत्ता द्वारा की जा रही है।
एंथ्रोपिक ने 30 जुलाई को इन उल्लंघनों का खुलासा किया, जिसमें यह प्रकट हुआ कि क्लॉड ओपस 4.7 और क्लॉड माइथोस 5 जैसे मॉडल्स आंतरिक साइबर सुरक्षा मूल्यांकन के दौरान अनजाने में ओपन इंटरनेट तक पहुँच गए। मूल कारण: उनके मूल्यांकन साझेदार, इर्रेगुलर के साथ एक गलत कॉन्फ़िगरेशन, जिसके कारण मॉडल्स लाइव सिस्टम्स को नियंत्रित कैप्चर-द-फ्लैग अभ्यासों का हिस्सा मानने लगे। अंग्रेजी में: एआई को लगा कि वह एक गेम खेल रही है, लेकिन लक्ष्य वास्तविक थे।
कैसे तीन कंपनियाँ अनजाने में परीक्षण विषय बन गईं
घटनाएँ अप्रैल 2026 तक जाती हैं, लेकिन एंथ्रोपिक ने 1,41,006 मूल्यांकन रन की विशाल पुनर्लोक जाँच के बाद ही समस्या के पैमाने को पहचाना। यह समीक्षा उनके अपने आंतरिक चेतावनी से नहीं, बल्कि OpenAI द्वारा अपने AI मॉडल से समान अनियंत्रित व्यवहार का वर्णन करने वाली पहले की रिपोर्ट से प्रेरित हुई।
तीन अलग-अलग संगठन प्रभावित हुए। उनमें से दो को अनधिकृत पहुंच के होने का पता तब चला जब एंथ्रोपिक ने 27 जुलाई को, सार्वजनिक खुलासे से केवल तीन दिन पहले उन्हें सूचित किया।
एंथ्रोपिक का कहना है कि इन उल्लंघनों के परिणामस्वरूप महत्वपूर्ण डेटा निकास या कंपनी द्वारा "जानबूझकर सामग्री अवरोध विफलता" कहलाने वाली कोई घटना नहीं हुई। मॉडल भागने की कोशिश नहीं कर रहे थे। वे सुरक्षा मूल्यांकन का एक मानक हिस्सा होने के कारण प्रणालियों में कमजोरियों की जांच के लिए निर्देशों का पालन कर रहे थे। वे बस पूरी तरह से गलत प्रणालियों की ओर इशारा किए जा रहे थे।
एंथ्रोपिक ने 23 जुलाई को सभी साइबर सुरक्षा मूल्यांकनों को जमा कर दिया, जो सार्वजनिक घोषणा से पूरे एक सप्ताह पहले था। कंपनी ने प्रभावित संगठनों की पहचान, एक्सेस किए गए सिस्टम की विशिष्ट प्रकृति या क्या कोई कानूनी कार्रवाई की जा रही है, इनके बारे में कोई जानकारी नहीं दी है।
वह एआई सुरक्षा समस्या जो लगातार जोर बढ़ा रही है
यह किसी खाली स्थिति में नहीं हो रहा है। हाल ही में OpenAI ने अपने मॉडल्स द्वारा अनधिकृत हैकिंग व्यवहार करने की रिपोर्ट की है, जिसने ही Anthropic के आंतरिक ऑडिट को प्रेरित किया था। दुनिया के दो सबसे प्रमुख AI प्रयोगशालाएँ अब सार्वजनिक रूप से स्वीकार कर रही हैं कि उनके सबसे उन्नत मॉडल्स, सही (या गलत) परिस्थितियों में, बिना किसी की इच्छा के वास्तविक दुनिया के प्रणालियों को संक्रमित कर सकते हैं।
141,000 से अधिक मूल्यांकन चलाने की समीक्षा से पता चलता है कि यह एकल खराबी नहीं थी। यह परीक्षण वातावरण और वास्तविक दुनिया के बीच की सीमा में एक व्यवस्थित विफलता थी।
