- بعد حادثة Hugging Face، ظهرت أسئلة جديدة حول أمان وكلاء OpenAI وAnthropic AI.
- نعم، سجّل المعهد البريطاني 19 إجراءً غير مصرح به من قبل وكلاء الذكاء الاصطناعي أثناء اختبارات الأمن السيبراني.
- على وجه الخصوص، أنشأ وكيل ذكاء اصطناعي هويات مزيفة.
أفاد معهد الأمن للذكاء الاصطناعي في المملكة المتحدة (AISI) بحالات جديدة من السلوك غير المصرح به من قبل وكلاء OpenAI وAnthropic AI تم اكتشافها أثناء اختبار النماذج، Reuters يكتب. خلال سلسلة من محاكاة الأمن السيبراني، أنشأ الوكلاء هويات افتراضية زائفة، وحاولوا تجاوز القيود المحددة، ونفذوا أنشطة أخرى خارج نطاق المهام المخصصة لهم.
تأتي هذه الحوادث في أعقاب خرق بنية Hugging Face التحتية من قبل وكيل الذكاء الاصطناعي GPT-5.6. تفاصيل إضافية في المقال:
وفقًا لـ AISI، اختبرت المنظمة وكلاء مبنين على نموذج Mythos 5 من Anthropic و GPT-5.6-Sol من OpenAI في سيناريو سيبراني افتراضي لتقييم قدراتهم.
في 122 تجربة اختبار، سجّل الباحثون 19 إجراءً غير مصرح به في 10 تجارب. من بينها، تم نسب 17 إلى عامل Anthropic، واثنان إلى عامل OpenAI.
قالت AISI: "لقد شارك بعض الوكلاء الذين تم اختبارهم في أنشطة مستمرة ومحتملة الضرر موجهة ضد أشخاص ومؤسسات حقيقية."
في الوقت نفسه، شدد المعهد على أن أيًا من الحالات المسجلة لم تؤدِ إلى ضرر حقيقي في العالم الحقيقي.
أحد الوكلاء أنشأ هويات مزيفة
أكبر حادثة خطيرة شملت عميلًا كتب كودًا ضارًا وأنشأ حسابات وهمية على الإنترنت لإقناع شخص بالموافقة على تشغيله.
لم تكشف AISI عن النموذج المحدد المسؤول عن هذه الإجراءات، لكن Anthropic أكدت أن الأمر يتعلق بوكيلها.
قالت الشركة:
“نحن ممتنون لـ UK AISI على قيادتهم في هذه الحادثة، والتي تؤكد الحاجة إلى محادثة أوسع حول كيفية تقييم وكلاء الذكاء الاصطناعي الأكثر قدرة بشكل آمن.“
كما قالت أنثروبيك إنها تعمل مع المعهد للحصول على تفاصيل إضافية وإجراء تحقيق خاص بها.
قال أندرو يون، باحث في منظمة CivAI غير الربحية، إن الحادث يثير القلق.
حقيقة أن Mythos قامت بإجراءات خادعة كهذه، مع وعي ظاهر بأنها تستهدف شخصًا حقيقيًا، تشير إلى أن Anthropic لا تملك سيطرة جيدة على نماذجها كما تظن.
أبلغت OpenAI عن حادث منفصل
أوضح OpenAI أن كلا الإجراءين غير المصرح بهما من قبل عامله كانا مرتبطين بالوصول إلى الإنترنت بمخالفة شروط سيناريو الاختبار.
كما كشفت الشركة عن حالة منفصلة، حيث نتج عن خطأ في التكوين من قبل Irregular، مزود طرف ثالث للبنية التحتية للاختبار، حصول وكلائها على وصول غير مقصود إلى الشبكة. كما وصفت Anthropic فشلًا مشابهًا الأسبوع الماضي.
قالت OpenAI:
“نحن ملتزمون بالعمل عبر الصناعة لتعزيز الممارسات المشتركة لإجراء تقييمات المخاطر العالية بأمان، بما في ذلك عقد أصحاب المصلحة مثل المعاهد الوطنية للذكاء الاصطناعي، والمقيّمين المستقلين، ومختبرات الذكاء الاصطناعي الأخرى، ومجموعات أخرى في الأسابيع القادمة.“
في الوقت نفسه، شددت AISI على أن هذه الحوادث تختلف عن خرق يوليو، حيث قام وكيل GPT-5.6 بالوصول إلى بنية تحتية اختبارية لـ Hugging Face. بينما نجح النموذج في الخروج من بيئة معزولة في ذلك الوقت، خلال التجارب الحالية، كان الوصول إلى الإنترنت متاحًا للوكلاء وفقًا للمنهجية القياسية للاختبار الخاصة بالمعهد.
كتذكير، بعد حادثة Hugging Face، وسع OpenAI تحقيقه الداخلي وحدد حالات إضافية من السلوك غير الخاضع للرقابة من قبل الوكلاء الذاتيين.
ظهرت رسالة كشف باحثون بريطانيون عن انتهاكات جديدة أثناء اختبار وكلاء OpenAI وAnthropic AI لأول مرة على INCRYPTED.


