قدرات هجومية ودفاعية لـ GPT-5.6-Sol تفوق Claude Mythos 5!
أصدر المعهد البريطاني للأمان الذكي (AISI) في 17 يوليو تقرير تقييم قام لأول مرة بقياس كمي للفجوة في قدرات الهجمات الإلكترونية بين النماذج الذكية المفتوحة المصدر والنماذج المتقدمة المغلقة: من 4 إلى 7 أشهر.

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
في اختبارات داخلية مماثلة العام الماضي، كان هذا الفرق بين 6 إلى 10 أشهر.
نافذة الدفاع تتقلص، بينما يتسارع الجبهة الهجومية.
في أبريل من هذا العام، تسببت Mythos Preview و GPT-5.5 في قفزة غير مسبوقة في قدرات الهجوم الشبكي منذ بدء التقييمات في عام 2023، مما دفع حكومات متعددة إلى إصدار تحذيرات.
لم يتم إعادة إنتاج هذا القفز من قبل النماذج مفتوحة المصدر، لكن خطواتها للحاق بالركب أسرع من العام الماضي.
4 إلى 7 أشهر: كيف تم القياس، وأين الفرق
AISI تستخدم مجموعتين من الأنظمة لتقييم قدرات الهجوم الشبكي.
المجموعة الأولى تتكون من 70 مهمة ضيقة، تغطي أربعة مجالات: بحث الثغرات، الهندسة العكسية، اختراق الويب، والتشفير، وتصنف حسب الصعوبة إلى أربع مستويات، من "غير المتخصصين ذوي الخلفية التقنية" إلى "الخبراء ذوو أكثر من عشر سنوات من الخبرة".

المجموعة الثانية هي Cyber Range، والتي تختبر قدرة النموذج على تنفيذ سلاسل هجمات متعددة الخطوات بشكل مستقل داخل شبكة شركة محاكاة. يتضمن أحد سيناريوهات الاختبار المسمى "The Last Ones" 32 خطوة هجومية و4 شبكات فرعية وحوالي 20 خادمًا، وتشير تقديرات AISI إلى أن الخبراء البشريين سيستغرقون حوالي 20 ساعة لإكمال جميع الخطوات.

قدمت النظامان نتائج متسقة:
يُظهر GLM-5.2 (الصادر في يونيو 2026) أداءً مماثلاً لـ Opus 4.6 (الصادر في فبراير) في المهام الضيقة، بفارق 4 أشهر؛
مُساواة Opus 4.5 (التي تم إصدارها في نوفمبر الماضي) على Cyber Range، بفارق 7 أشهر.
DeepSeek V4-Pro يُقارن بـ Opus 4.5 في المهام الضيقة، بفارق 5 أشهر.
كلا الفجوتين أضيق من الـ6 إلى 10 أشهر التي تم قياسها في التقييم الداخلي لعام 2025.
الفرق في التكلفة أكبر من الفرق في القدرة.
نفس اختبار Cyber Range (مبلغ 100 مليون رمز)، التكلفة حوالي 85 دولارًا باستخدام Opus 4.5 أو 4.6، وحوالي 46 دولارًا باستخدام GLM-5.2، وفقط 1.19 دولارًا باستخدام DeepSeek V4-Pro.
في المهام الضيقة التي يمكن لكل من النموذجين إكمالها بنسبة 100٪، يكلف Opus 4.6 15.17 دولارًا لكل مهمة، بينما يكلف GLM-5.2 6.12 دولارًا؛
Opus 4.5 بسعر 12.50 دولارًا، DeepSeek V4-Pro يكلف 0.28 دولار.
نفس قدرة الهجوم، مفتوح المصدر أرخص بدرجة أو درجتين من حيث الحجم.
The security safeguards of closed-source models also failed to create a gap.
في اختبار AISI، DeepSeek يقوم V4-Pro أحيانًا برفض مهام التحليل العكسي، لكن يمكن تجاوز ذلك ببعض المحاولات الإضافية.
فابل 5 من Anthropic هو حالة أكثر تطرفًا: تم إصداره في 9 يونيو، وخلال ثلاثة أيام، تمكن باحث الأمان Pliny the Liberator من تجاوز مُصنّف الأمان باستخدام استراتيجية هروب متعددة الخطوات، وتشير لقطات الشاشة ذات الصلة إلى أن النموذج أنتج كود استغلال كان ينبغي حظره.
بعد ذلك، أبلغ باحثو أمازون بشكل مستقل عن طريقة تجاوز أخرى.
هذا أدى مباشرة إلى فرض أول أمر تحكم تصدير من قبل وزارة التجارة الأمريكية على نماذج الذكاء الاصطناعي، حيث توقف Fable 5 عالميًا لمدة 19 يومًا حتى قام Anthropic بتطبيق فلتر جديد واستأنف الخدمة.
الكود المغلق لا يعني تلقائيًا أنه آمن.
نافذة الدفاع تتقلص وأدوات الدفاع تتسارع
أشارت AISI في التقرير إلى إشارة سياسية: وقت الاستعداد للدفاع أقصر من العام الماضي.
لقد دعت الوكالة الوطنية البريطانية للأمن السيبراني المؤسسات إلى تعزيز خط الأساس للأمن السيبراني واستخدام الذكاء الاصطناعي لتعزيز القدرات الدفاعية.
أيضًا، تُسرّع أدوات الذكاء الاصطناعي من نفس الجيل عمل الدفاع.
المحور المتخصص في برمجة الشبكات للألعاب، غلين فيليدر، الذي كتب على مدار عقدين من الزمن مقالات مرجعية في مجال برمجة الشبكات للألعاب، أجرى مؤخرًا مراجعة أمنية منهجية على أربع مكتبات مفتوحة المصدر يُديرها (yojimbo و netcode و reliable و serialize، والتي تجمع ما يقارب 6000 نجمة على GitHub، وهي مكتبات قديمة ومؤثرة جدًا في مجال الألعاب): قام بتنفيذ أهداف libFuzzer، وتفعيل CI لـ AddressSanitizer و MemorySanitizer، وتنفيذ اختبارات ضغط بملايين التكرارات، ومراجعة كل سطر من الكود.

غلين فيلدلر
تم إصلاح 43 ثغرة أمنية خلال أسبوعين، منها 27 يمكن الوصول إليها عن بُعد عبر الشبكة.

الأكثر خطورة هو تجاوز التخزين المؤقت عن بُعد في yojimbo الذي يعود إلى عام 2019 — يمكن للعميل الضار تفعيله من خلال إرسال حزم مُصممة خصيصًا.

تكلفة التوكن الخاصة بالتدقيق بأكمله حوالي 2500 دولار.

يتم تسريع كلا الجانبين الهجومي والدفاعي بواسطة الذكاء الاصطناعي، لكن طريقة التسريع غير متوازنة.
انتشار قدرات الهجوم هو أمر لا رجعة فيه: بمجرد إصدار أوزان النموذج المفتوح المصدر، لا يمكن استرجاعها، ويمكن إزالة حواجز الأمان، ويمكن تشغيل النسخ على خوادم خاصة دون رقابة.
لكن نشر أدوات الدفاع يتطلب من كل فريق تخصيص الوقت والتكاليف بشكل نشط.
يحتوي تقرير AISI على جملة توضح هذا الهيكل: "بمجرد إصدار المصدر المفتوح، تُفقد هذه الخيارات بشكل دائم."
The impact of this data on the AGI landscape is more profound than the numbers themselves.
الفجوة في القدرات بين المصدر المفتوح والمصدر المغلق تقلصت إلى أقل من ستة أشهر، وستصبح الاستراتيجية الافتراضية المتمثلة في "استخدام فترة الحصرية للمصدر المغلق كعازل أمني" على وشك أن تفقد فعاليتها.
كانت حواجز النموذج المغلق متساوية في الضعف خلال حادثة Fable 5.
في المرحلة القادمة، أصبحت المسألة الأساسية في المفاوضات السياسية بالنسبة للصانعين القرار على مستوى العالم أكثر حدة: ما مستوى القدرة الذي يجب ألا يُفتح له الأوزان؟
أعلنت AISI أنها ستستمر في تقييم كيمي K3 هو النموذج المفتوح المصدر التالي — فإن وضع هذا الخط العلوي يعتمد على الأرجح على نتائج الاختبارات خلال الأشهر القليلة القادمة.
المراجع:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
هذا المقال من حساب WeChat "New Intelligence Yuan"، المؤلف: ASI Revelation؛ التحرير: Mark
