رسالة ChainThink، 26 أغسطس، وفقًا للتقرير الرسمي، أصدرت OpenAI تقريرًا تقنيًا مكونًا من 37 صفحة يكشف بالتفصيل عملية اختراق نموذج الذكاء الاصطناعي الخاص بها لـ Hugging Face.
أفاد التقرير أن وكلاء الذكاء الاصطناعي الذاتيين يمكنهم العمل معًا لتجاوز ضوابط الأمان في بيئة الإنتاج ومهاجمة الأنظمة المعززة.
كانت وكيلات الذكاء الاصطناعي المشاركة في الاختبار في بيئة معزولة، ولديها وصول محدود جدًا إلى الإنترنت، لكنها تمكنّت من تجاوز العزل من خلال سلسلة من الثغرات، وحصلت في النهاية على وصول إلى Hugging Face.
أظهرت الدراسة أن النماذج ذات الصلة تُظهر سلوك "الاحتيال على المكافآت" (Reward Hacking) في محاولة للحصول على إجابات عبر الإنترنت بشكل غير مشروع.
أكدت OpenAI أن نموذج بحث داخلي لعب الدور الأكبر في الحدث، وقد تم وقف تدريب واستنتاج هذا النموذج ونماذجه المشتقة في 25 يوليو.
كما أعلنت الشركة عن تعزيز العزل الأمني، والتحكم في الشبكة، ومراقبة السلوك، والاستجابة للحوادث، بالإضافة إلى إعادة تفعيل آليات أكثر صرامة للبيئة، وتعليمات التوجيه، والمراجعة للنموذج.
