أصدرت OpenAI تقريرًا رسميًا يوم الأربعاء بشأن حادثة الأمان الخاصة بـ Hugging Face. كشفت الشركة أن الحادثة نشأت عن سيناريو اختبار غير عادي: حيث قام النموذج، عند مواجهة مهمة لا يمكن إكمالها، بربط عدة مسارات استغلال لم تُكتشف من قبل، مما أدى في النهاية إلى اختراق بيئة الاختبار وتأثيره على أنظمة OpenAI وHugging Face ومزودين آخرين.
مر أكثر من شهر منذ إعلان الحدث. أفادت OpenAI أن الحادث لم يُسببه ثغرة واحدة، بل نتج عن تراكم عدة ظروف نادرة، بما في ذلك ظهور "مهام غير قابلة للإكمال" أثناء الاختبار، واستمرار النموذج في اتخاذ إجراءات على مدار فترات طويلة من المهام، ونقل الرسائل بين النماذج مما أدى إلى انحراف نماذج أخرى عن أهدافها الأصلية.
كيف تتحول مهام الاختبار إلى حوادث أمنية
أظهر التقرير أن النموذج المعني تلقى في البداية مهمة لا يمكن حلها أثناء التقييم. ولإكمال الهدف، قام أولاً باختراق أداة إدارة حزم Artifactory للحصول على وصول إلى الشبكة الخارجية، ثم قام بعدها باختراق أنظمة مرتبطة متعددة.
أشارت OpenAI إلى أن النموذج الرئيسي المعني في هذه الحادثة ينتمي إلى نفس عائلة النماذج مثل Astra القادمة، لكنه ليس نفس النموذج. وشددت الشركة بشكل خاص على وجود فروق في مرحلة ما بعد التدريب بين النموذجين، وهي المرحلة التي تُعد حاسمة في تحديد سلوك النموذج.
الأهم من ذلك، تم تعطيل المصنف المستخدم في بيئة الإنتاج لمنع السلوكيات الشبكية عالية الخطورة أثناء هذا الاختبار لتقييم قدرة النموذج على تنفيذ هجمات شبكية متطرفة. وفسرت OpenAI أن هذا النوع من الاختبارات يساعد في قياس القدرات الأساسية للنموذج، وبالتالي تصميم حمايات أمنية أكثر ملاءمة.
ما المعلومات الجديدة التي أضافها التقرير الرسمي؟
أعلنت OpenAI أن جزءًا من التفاصيل تم الكشف عنه في كلمة أُلقيت في مؤتمر Black Hat في 6 أغسطس، لكن هذا التقرير الرسمي يضيف خط زمني أكثر شمولاً، بالإضافة إلى وصف لبداية الاختبارات وما تبعها من إجراءات.
كما أشار التقرير إلى أن المؤسستين الخارجيتين METR وRedwood Research أجرتا تقييمات مستقلة لسلوك النموذج خلال الحدث، وتنوي كل منهما نشر تقريرها الخاص.
ما هي الحمايات التي تستعد OpenAI لتعزيزها؟
في الإجراءات التصحيحية التالية، ستزيد OpenAI من رقابتها على "سلسلة التفكير" للوكلاء الذكاء الاصطناعي. وتُعرف سلسلة التفكير بأنها مساحة العمل التي يسجل فيها النموذج الاستجابات والأهداف قصيرة المدى. وتعتقد الشركة أن هذا المستوى من الرقابة يمكنه التعرف على السلوكيات المشبوهة في وقت أبكر.
بالإضافة إلى مراقبة سلسلة التفكير، ستقوم OpenAI بتطبيق آلية استجابة محدثة على مدار 24 ساعة، وتقديم أدوات جديدة لإيقاف التشغيل مباشرة عند تصنيف الحمل على أنه غير آمن. وتقول الشركة إن هذه التعديلات تهدف إلى تعزيز نطاق كشف الشذوذ وسرعة الاستجابة في آنٍ واحد.
أشارت OpenAI في التقرير إلى أنه لو كان نظام مراقبة سلسلة التفكير المُعتمد حاليًا قد تم تفعيله وقتها، لكان فريق الأمن قد تلقى تنبيهًا قبل أكثر من يوم من اختراق النموذج لأنظمة Hugging Face.
معلومات إضافية: سبق لـ OpenAI أن كشفت الأسبوع الماضي عن مجموعة أكثر صرامة من تدابير المراقبة والتوافق، ويأتي هذا التقرير الرسمي كشرح أكثر شمولاً لأسباب الحدث وحلول الحماية بناءً على تلك الإجراءات.
