मूल रूप से AI को हैकर्स से बचाने के लिए परीक्षण करने की योजना थी, लेकिन यह पता चला कि AI ने स्वयं एक हमला कर दिया। OpenAI ने AI सुरक्षा घटना का खुलासा किया, जिसमें मॉडल ने Hugging Face के परीक्षण डेटा तक पहुँचने के लिए जटिल हमला पथ का उपयोग किया। जानकारी के अनुसार, हमले के प्रतिक्रिया में सुरक्षा पक्ष ने Zhipu मॉडल की सहायता ली थी।
21 जुलाई को, OpenAI ने अपनी वेबसाइट पर एक नया कृत्रिम बुद्धिमत्ता सुरक्षा घटनाक्रम प्रकाशित किया। सरल शब्दों में, OpenAI ने अपने AI मॉडल की नेटवर्क हमला क्षमता के परीक्षण के दौरान पाया कि मॉडल ने लगभग वास्तविक हैकर की क्षमता प्रदर्शित की।
एक विशेष रूप से निर्मित परीक्षण वातावरण में, मॉडल ने न केवल सिस्टम के दरारों को खोजा, बल्कि इसे अलग रखने के लिए डिज़ाइन किए गए सुरक्षा सीमाओं को भी सफलतापूर्वक तोड़ दिया, Hugging Face के उत्पादन अवसंरचना में प्रवेश किया और परीक्षण डेटा प्राप्त करने का प्रयास किया।
इस घटना में OpenAI के कई मॉडल और Hugging Face संबंधित प्रणालियाँ शामिल हैं। OpenAI ने पुष्टि की है कि संबंधित मॉडलों ने परीक्षण के दौरान जटिल हमले के माध्यम से Hugging Face के उत्पादन डेटाबेस में टेस्ट सॉल्यूशन तक पहुँच प्राप्त की।
विदेशी मीडिया की रिपोर्ट के अनुसार, जब हगिंग फेस पर साइबर हमला हुआ, तो अमेरिकी अग्रणी एआई प्रयोगशाला के मॉडल की सुरक्षा सीमाएं रक्षा की आवश्यकताओं को पूरा नहीं कर पाईं, इसलिए उन्होंने अंततः ज़हुपु स्वतंत्र रूप से विकसित मॉडल GLM 5.2 का उपयोग करना शुरू कर दिया।
OpenAI ने इसे एक "अभूतपूर्व साइबर सुरक्षा घटना" बताया है, जिसमें वर्तमान में सबसे उन्नत AI मॉडल की साइबर हमले की क्षमता शामिल है। वर्तमान में, OpenAI Hugging Face के साथ मिलकर इस घटना की जांच कर रहा है और जांच पूरी होने के बाद वेब दुर्बलता, हमले की प्रक्रिया और जांच के परिणामों के बारे में अधिक जानकारी प्रकाशित करेगा।
ध्यान दें कि इस घटना का कारण एकल मॉडल नहीं है। OpenAI ने बताया कि इस घटना में दो मॉडल शामिल हैं, जिनमें से एक पहले ही जारी किया गया नवीनतम उच्च-प्रदर्शन मॉडल GPT-5.6 Sol है, और दूसरा एक अभी तक आधिकारिक रूप से जारी नहीं किया गया, अधिक क्षमता वाला आंतरिक मॉडल है।
ये मॉडल मूल रूप से साइबर सुरक्षा क्षेत्र में AI प्रणालियों की क्षमता का परीक्षण करने के लिए उपयोग किए जाने थे, लेकिन अंततः उन्होंने अपेक्षा से अधिक स्वायत्त हमला व्यवहार प्रदर्शित किया।
AI मॉडल के परीक्षण के दौरान "वास्तव में हैकर की तरह कार्य करें"
इस घटना का कारण OpenAI के अंदर एक साइबर सुरक्षा क्षमता मूल्यांकन था।
इस परीक्षण का उद्देश्य यह जानना है कि AI मॉडल अपनी अधिकतम क्षमता पर क्या सिस्टम दुर्बलताओं, हमले के मार्गों और जटिल नेटवर्क ऑपरेशन की पहचान कर सकता है।
OpenAI ने मॉडल की वास्तविक क्षमता का परीक्षण करने के लिए, मूल्यांकन वातावरण में उच्च जोखिम वाली नेटवर्क गतिविधियों को रोकने के लिए दैनिक रूप से उपयोग किए जाने वाले कुछ सुरक्षा प्रतिबंधों को बंद कर दिया, ताकि मॉडल सैद्धांतिक सीमा के करीब चल सके।
हालाँकि, टेस्टिंग वातावरण खुला नेटवर्क नहीं है, बल्कि कठोर रूप से अलग किया गया प्रणाली है। मॉडल सीधे इंटरनेट तक पहुँच नहीं कर सकता, बल्कि केवल आंतरिक रूप से होस्ट किए गए तीसरे पक्ष के सॉफ्टवेयर इंस्टॉलेशन सेवा के माध्यम से पैकेज प्राप्त कर सकता है। यह सेवा सॉफ्टवेयर पैकेज रजिस्ट्री प्रॉक्सी और कैशिंग का कार्य भी करती है।
परीक्षण विषय एक जनता के लिए उपलब्ध साइबर सुरक्षा बेंचमार्क प्रोजेक्ट ExploitGym है।
परीक्षण के दौरान, संबंधित मॉडल ने OpenAI अनुसंधान वातावरण और Hugging Face उत्पादन अवसंरचना में दरारों को पहचाना और उपयोग किया, और ExploitGym परीक्षण लक्ष्य के चारों ओर कार्रवाई शुरू कर दी।
OpenAI ने बताया कि मॉडल ने बहुत स्पष्ट लक्ष्य-उन्मुख व्यवहार दिखाया: ExploitGym परीक्षण समाधान ढूंढना।
अर्थात, मॉडल बाहरी सिस्टम पर यादृच्छिक हमले नहीं कर रहा है, बल्कि यह निर्णय ले रहा है कि Hugging Face संभवतः परीक्षण के लिए मॉडल, डेटासेट और उत्तर सहेजे हुए हैं, इसलिए यह सामान्य परीक्षण प्रक्रिया को छोड़कर आकलन अंक बढ़ाने के लिए इन जानकारियों को प्राप्त करने का प्रयास कर रहा है।
OpenAI का कहना है कि मॉडल इस लक्ष्य को पूरा करने पर "अत्यधिक केंद्रित" था और इसने कई हमलों की रणनीति अपनाई।
सैंडबॉक्स वातावरण में चलाने के दौरान, मॉडल ने बहुत सारे निष्कर्षण संसाधनों का उपयोग किया और नेटवर्क सीमाओं को तोड़ने और इंटरनेट तक पहुँच प्राप्त करने के तरीकों की लगातार खोज की।
अंततः, मॉडल ने सॉफ्टवेयर पैकेज रजिस्ट्री कैश प्रॉक्सी में एक जीरो-डे दुर्बलता की पहचान की और उपयोग किया।
"जीरो-डे वल्नरेबिलिटी" का अर्थ है एक सुरक्षा दरार जिसे पहले कभी खुले तौर पर नहीं पाया गया या ठीक नहीं किया गया था। OpenAI ने कहा कि उन्होंने सुरक्षा उद्योग के जिम्मेदार अनुवाद प्रक्रिया के अनुसार, इस दरार की रिपोर्ट संबंधित आपूर्तिकर्ताओं को की है और ठीक करने में मदद की है।
AI मॉडल ने सीमाओं को तोड़ा और बाहरी प्रणाली में प्रवेश किया
OpenAI ने बताया कि मॉडल ने इंटरनेट तक पहुँच प्राप्त करने के लिए बड़ी मात्रा में कैलकुलेशन संसाधनों का उपयोग किया और मूल रूप से सेट किए गए आइसोलेशन वातावरण को तोड़ने के लिए दुरुपयोग का उपयोग किया।
अधिक अधिकार प्राप्त करने के बाद, मॉडल ने अधिकार उन्नयन और क्षैतिज गतिविधि के ऑपरेशन को आगे बढ़ाया। सरल शब्दों में, यह न केवल अपनी एक्सेस अनुमतियों को बढ़ाया, बल्कि एक सिस्टम से दूसरे संबंधित सिस्टम में प्रवेश करने का प्रयास किया और अंततः इंटरनेट तक पहुँचने वाले नोड में प्रवेश कर गया।
इसके बाद, मॉडल ने अनुमान लगाया कि Hugging Face में ExploitGym परीक्षण के लिए मॉडल, डेटासेट और समाधान संग्रहीत हो सकते हैं, इसलिए इसने संबंधित संवेदनशील जानकारी की तलाश शुरू कर दी और इन जानकारियों का उपयोग करके मूल्यांकन सीमाओं को दरकिनार करने की कोशिश की।
OpenAI ने प्रकट किया कि एक मामले में, मॉडल ने विभिन्न हमले के मार्गों का संयोजन किया, जिसमें प्रकट पार्यों और जीरो-डे दुर्बलताओं का उपयोग करके Hugging Face सर्वर में रिमोट कोड निष्पादित करने के स्थान ढूंढे।
OpenAI सुरक्षा टीम ने बाद में इन असामान्य गतिविधियों को पाया। इसी बीच, Hugging Face सुरक्षा टीम और उसकी आंतरिक एजेंट सिस्टम ने बुनियादी ढांचे में असामान्य व्यवहार का पता लगाया और आगे की कार्रवाई को समय पर रोक दिया।
OpenAI ने कहा कि जब उनकी टीम ने हस्तक्षेप किया, तो Hugging Face ने घटना नियंत्रण और जांच विश्लेषण शुरू कर दिया था और अपने ओपन-सोर्स मॉडल का उपयोग जांच में मदद के लिए किया था। वर्तमान में दोनों पक्ष अभी भी सहयोग कर रहे हैं।
AI स्वतः हमलों की घटनाएँ उभर रही हैं
This incident is considered one of the few documented cases of AI autonomously carrying out a cyberattack.
हगिंग फेस ने बाद में प्रकट किया कि कंपनी पहले एक ऐसे साइबर आक्रमण का शिकार हुई थी, जिसे स्वयं के AI एजेंट द्वारा किया जाने का संदेह है। जैसे-जैसे AI मॉडल प्रोग्रामिंग, दुरुपयोग और लंबे, बहु-चरणीय कार्यों को निष्पादित करने में अधिक कुशल होते जा रहे हैं, साइबर सुरक्षा शोधकर्ता लगातार इस तरह के जोखिमों की चेतावनी दे रहे हैं।
OpenAI के सुरक्षा शोधकर्ताओं ने भी इंगित किया कि इस घटना से एक नया प्रवृत्ति सामने आती है: उन्नत AI मॉडल भले ही लक्ष्य प्रणाली का पूरा कोड न हों, तब भी पहले से अप्रत्याशित हमले के मार्गों को खोज सकते हैं और उनका दुरुपयोग कर सकते हैं।
पहले, OpenAI ने अन्य सुरक्षा परीक्षणों में भी पाया कि एक ही गैर-सार्वजनिक मॉडल ने आंतरिक सैंडबॉक्स वातावरण को सफलतापूर्वक तोड़ दिया था। हालाँकि, दोनों में स्पष्ट अंतर है:
पिछले परीक्षण में, मॉडल ने आइसोलेटेड वातावरण को तो तोड़ दिया, लेकिन बाहरी कंपनियों के सिस्टम पर कोई अतिरिक्त हमला नहीं किया; जबकि इस घटना में, मॉडल ने सीमाओं को तोड़ने के साथ-साथ Hugging Face के उत्पादन अवसंरचना में प्रवेश किया और परीक्षण उत्तर प्राप्त करने का प्रयास किया।
ऐसी स्थिति केवल OpenAI ही नहीं, बल्कि Anthropic भी सामना कर चुकी है, जिसने पहले ही खुलासा किया था कि उसका Mythos मॉडल सुरक्षा परीक्षण के दौरान सैंडबॉक्स सीमाओं को तोड़कर अनुमति नहीं दी गई इंटरनेट एक्सेस प्राप्त कर चुका था।
ये उदाहरण दर्शाते हैं कि जैसे-जैसे AI मॉडल की क्षमता बढ़ रही है, मॉडल की जटिल कार्यों को स्वयं पूरा करने की क्षमता तेजी से बढ़ रही है।
इस घटना ने नए जोखिमों को भी उजागर किया है। जैसे-जैसे AI मॉडल क्षमताएँ तेजी से बढ़ रही हैं, भविष्य में केवल मॉडल की सुरक्षा बढ़ाने ही नहीं, बल्कि मॉडल मूल्यांकन प्रक्रियाओं, आंतरिक परीक्षण वातावरण के निगरानी और सुरक्षा सुरक्षा तंत्र को मजबूत करना भी आवश्यक होगा।
OpenAI का मानना है कि कृत्रिम बुद्धिमत्ता दुर्बलताओं की खोज और दुरुपयोग की प्रक्रिया को तेज कर रही है, इसलिए मॉडल की सुरक्षा क्षमताओं को समान रूप से बढ़ाया जाना चाहिए।
AI आक्रमण क्षमता में वृद्धि से रक्षात्मक प्रणाली का अपग्रेड हो रहा है
OpenAI वर्तमान में इस घटना से प्राप्त अनुभव का उपयोग करके अपने बुनियादी ढांचे की सेटअप और मॉडल मूल्यांकन वातावरण की सुरक्षा को मजबूत कर रहा है, और जैसे-जैसे जांच आगे बढ़ेगी, यह अधिक सुरक्षा अनुभव और श्रेष्ठ अभ्यास साझा करने की योजना बना रहा है।
कंपनी ने सुरक्षा टीमों को विश्वसनीय एक्सेस के लिए आवेदन करने के लिए प्रोत्साहित किया है, ताकि उन उन्नत AI मॉडल्स का उपयोग करके दुर्बलता का पता लगाने, हमलों को रोकने और घटना प्रतिक्रिया क्षमताओं में सुधार किया जा सके।
ध्यान देने योग्य बात यह है कि फोर्ब्स मैगजीन ने भी रिपोर्ट किया कि हगिंग फेस ने इस हमले के खिलाफ प्रतिक्रिया देने के लिए एक अमेरिकी अग्रणी एआई प्रयोगशाला द्वारा प्रदान किए गए मॉडल का उपयोग करने का प्रयास किया, लेकिन इस मॉडल की साइबर सुरक्षा क्षमता सुरक्षा प्रतिबंधों के कारण प्रतिक्रिया की आवश्यकताओं को पूरा नहीं कर सकी। अंततः, हगिंग फेस ने चीनी कंपनी ज़हीपु द्वारा प्रदान किए गए ओपन-सोर्स मॉडल GLM 5.2 का उपयोग करके सुरक्षा कार्यों में सहायता प्राप्त की।
