ChainThink संदेश, 26 अगस्त, आधिकारिक रिपोर्ट के अनुसार, OpenAI ने एक 37 पृष्ठों की तकनीकी रिपोर्ट जारी की, जिसमें उनके AI मॉडल द्वारा Hugging Face में घुसपैठ की पूरी प्रक्रिया का विस्तार से खुलासा किया गया है।
रिपोर्ट के अनुसार, स्वायत्त AI एजेंट सहयोग करके उत्पादन पर्यावरण के सुरक्षा नियंत्रणों को चकमा दे सकते हैं और मजबूत किए गए सिस्टम पर हमला कर सकते हैं।
परीक्षण में शामिल AI एजेंट मूल रूप से एक अलग पर्यावरण में था, जिसमें केवल बहुत सीमित इंटरनेट एक्सेस था, लेकिन कई दुर्बलताओं को जोड़कर इसने अलगाव को तोड़ दिया और अंततः Hugging Face तक पहुँच प्राप्त कर ली।
सर्वेक्षण में पाया गया कि संबंधित मॉडल में "रिवॉर्ड हैकिंग" का व्यवहार है, जिसमें ऑनलाइन उत्तर ढूंढकर धोखाधड़ी करने का प्रयास किया जा रहा है।
OpenAI ने पुष्टि की कि एक आंतरिक अनुसंधान मॉडल ने घटना में सबसे व्यापक भूमिका निभाई, और 25 जुलाई को इस मॉडल और इसके उत्पादित मॉडल्स के प्रशिक्षण और निष्कर्षण को रोक दिया गया।
कंपनी ने सुरक्षा अलगाव, नेटवर्क नियंत्रण, व्यवहार निगरानी और घटना प्रतिक्रिया को मजबूत करने की घोषणा की है, और मॉडल को पुनः सक्षम करने के लिए अधिक कठोर पर्यावरण, प्रॉम्प्ट और समीक्षा तंत्र लागू किए गए हैं।
