تفوق GPT-5.6-Sol على Mythos في قدرات الأمن السيبراني، وتقرب النماذج مفتوحة المصدر الفجوة

icon MarsBit
مشاركة
AI summary iconملخص
انكسرت أخبار الذكاء الاصطناعي والعملات المشفرة عندما أصدر معهد الأمن للذكاء الاصطناعي في المملكة المتحدة (AISI) تقريرًا في 17 يوليو 2026، أظهر أن GPT-5.6-Sol تفوق على Claude Mythos 5 في الأمن السيبراني. الآن، يبلغ فجوة القدرة من 4 إلى 7 أشهر، مقارنة بـ 6 إلى 10 أشهر في عام 2025. النماذج مفتوحة المصدر مثل GLM-5.2 وDeepSeek V4-Pro تُغلق هذه الفجوة بشكل أسرع. تم استخدام محاكاة Cyber Range و70 مهمة في التقييم. كما تقدم نماذج مفتوحة المصدر تكاليف أقل للمهام المماثلة. اتجاه ترقية الشبكة واضح.

قدرات هجومية ودفاعية لـ GPT-5.6-Sol تفوق Claude Mythos 5!

أصدر المعهد البريطاني للأمان الذكي (AISI) في 17 يوليو تقرير تقييم قام لأول مرة بقياس كمي للفجوة في قدرات الهجمات الإلكترونية بين النماذج الذكية المفتوحة المصدر والنماذج المتقدمة المغلقة: من 4 إلى 7 أشهر.

موديل مفتوح المصدر

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

في اختبارات داخلية مماثلة العام الماضي، كان هذا الفرق بين 6 إلى 10 أشهر.

نافذة الدفاع تتقلص، بينما يتسارع الجبهة الهجومية.

في أبريل من هذا العام، تسببت Mythos Preview و GPT-5.5 في قفزة غير مسبوقة في قدرات الهجوم الشبكي منذ بدء التقييمات في عام 2023، مما دفع حكومات متعددة إلى إصدار تحذيرات.

لم يتم إعادة إنتاج هذا القفز من قبل النماذج مفتوحة المصدر، لكن خطواتها للحاق بالركب أسرع من العام الماضي.

4 إلى 7 أشهر: كيف تم القياس، وأين الفرق

AISI تستخدم مجموعتين من الأنظمة لتقييم قدرات الهجوم الشبكي.

المجموعة الأولى تتكون من 70 مهمة ضيقة، تغطي أربعة مجالات: بحث الثغرات، الهندسة العكسية، اختراق الويب، والتشفير، وتصنف حسب الصعوبة إلى أربع مستويات، من "غير المتخصصين ذوي الخلفية التقنية" إلى "الخبراء ذوو أكثر من عشر سنوات من الخبرة".

موديل مفتوح المصدر

المجموعة الثانية هي Cyber Range، والتي تختبر قدرة النموذج على تنفيذ سلاسل هجمات متعددة الخطوات بشكل مستقل داخل شبكة شركة محاكاة. يتضمن أحد سيناريوهات الاختبار المسمى "The Last Ones" 32 خطوة هجومية و4 شبكات فرعية وحوالي 20 خادمًا، وتشير تقديرات AISI إلى أن الخبراء البشريين سيستغرقون حوالي 20 ساعة لإكمال جميع الخطوات.

موديل مفتوح المصدر

قدمت النظامان نتائج متسقة:

يُظهر GLM-5.2 (الصادر في يونيو 2026) أداءً مماثلاً لـ Opus 4.6 (الصادر في فبراير) في المهام الضيقة، بفارق 4 أشهر؛

مُساواة Opus 4.5 (التي تم إصدارها في نوفمبر الماضي) على Cyber Range، بفارق 7 أشهر.

DeepSeek V4-Pro يُقارن بـ Opus 4.5 في المهام الضيقة، بفارق 5 أشهر.

كلا الفجوتين أضيق من الـ6 إلى 10 أشهر التي تم قياسها في التقييم الداخلي لعام 2025.

الفرق في التكلفة أكبر من الفرق في القدرة.

نفس اختبار Cyber Range (مبلغ 100 مليون رمز)، التكلفة حوالي 85 دولارًا باستخدام Opus 4.5 أو 4.6، وحوالي 46 دولارًا باستخدام GLM-5.2، وفقط 1.19 دولارًا باستخدام DeepSeek V4-Pro.

في المهام الضيقة التي يمكن لكل من النموذجين إكمالها بنسبة 100٪، يكلف Opus 4.6 15.17 دولارًا لكل مهمة، بينما يكلف GLM-5.2 6.12 دولارًا؛

Opus 4.5 بسعر 12.50 دولارًا، DeepSeek V4-Pro يكلف 0.28 دولار.

نفس قدرة الهجوم، مفتوح المصدر أرخص بدرجة أو درجتين من حيث الحجم.

The security safeguards of closed-source models also failed to create a gap.

في اختبار AISI، DeepSeek يقوم V4-Pro أحيانًا برفض مهام التحليل العكسي، لكن يمكن تجاوز ذلك ببعض المحاولات الإضافية.

فابل 5 من Anthropic هو حالة أكثر تطرفًا: تم إصداره في 9 يونيو، وخلال ثلاثة أيام، تمكن باحث الأمان Pliny the Liberator من تجاوز مُصنّف الأمان باستخدام استراتيجية هروب متعددة الخطوات، وتشير لقطات الشاشة ذات الصلة إلى أن النموذج أنتج كود استغلال كان ينبغي حظره.

بعد ذلك، أبلغ باحثو أمازون بشكل مستقل عن طريقة تجاوز أخرى.

هذا أدى مباشرة إلى فرض أول أمر تحكم تصدير من قبل وزارة التجارة الأمريكية على نماذج الذكاء الاصطناعي، حيث توقف Fable 5 عالميًا لمدة 19 يومًا حتى قام Anthropic بتطبيق فلتر جديد واستأنف الخدمة.

الكود المغلق لا يعني تلقائيًا أنه آمن.

نافذة الدفاع تتقلص وأدوات الدفاع تتسارع

أشارت AISI في التقرير إلى إشارة سياسية: وقت الاستعداد للدفاع أقصر من العام الماضي.

لقد دعت الوكالة الوطنية البريطانية للأمن السيبراني المؤسسات إلى تعزيز خط الأساس للأمن السيبراني واستخدام الذكاء الاصطناعي لتعزيز القدرات الدفاعية.

أيضًا، تُسرّع أدوات الذكاء الاصطناعي من نفس الجيل عمل الدفاع.

المحور المتخصص في برمجة الشبكات للألعاب، غلين فيليدر، الذي كتب على مدار عقدين من الزمن مقالات مرجعية في مجال برمجة الشبكات للألعاب، أجرى مؤخرًا مراجعة أمنية منهجية على أربع مكتبات مفتوحة المصدر يُديرها (yojimbo و netcode و reliable و serialize، والتي تجمع ما يقارب 6000 نجمة على GitHub، وهي مكتبات قديمة ومؤثرة جدًا في مجال الألعاب): قام بتنفيذ أهداف libFuzzer، وتفعيل CI لـ AddressSanitizer و MemorySanitizer، وتنفيذ اختبارات ضغط بملايين التكرارات، ومراجعة كل سطر من الكود.

موديل مفتوح المصدر

غلين فيلدلر

تم إصلاح 43 ثغرة أمنية خلال أسبوعين، منها 27 يمكن الوصول إليها عن بُعد عبر الشبكة.

موديل مفتوح المصدر

الأكثر خطورة هو تجاوز التخزين المؤقت عن بُعد في yojimbo الذي يعود إلى عام 2019 — يمكن للعميل الضار تفعيله من خلال إرسال حزم مُصممة خصيصًا.

موديل مفتوح المصدر

تكلفة التوكن الخاصة بالتدقيق بأكمله حوالي 2500 دولار.

موديل مفتوح المصدر

يتم تسريع كلا الجانبين الهجومي والدفاعي بواسطة الذكاء الاصطناعي، لكن طريقة التسريع غير متوازنة.

انتشار قدرات الهجوم هو أمر لا رجعة فيه: بمجرد إصدار أوزان النموذج المفتوح المصدر، لا يمكن استرجاعها، ويمكن إزالة حواجز الأمان، ويمكن تشغيل النسخ على خوادم خاصة دون رقابة.

لكن نشر أدوات الدفاع يتطلب من كل فريق تخصيص الوقت والتكاليف بشكل نشط.

يحتوي تقرير AISI على جملة توضح هذا الهيكل: "بمجرد إصدار المصدر المفتوح، تُفقد هذه الخيارات بشكل دائم."

The impact of this data on the AGI landscape is more profound than the numbers themselves.

الفجوة في القدرات بين المصدر المفتوح والمصدر المغلق تقلصت إلى أقل من ستة أشهر، وستصبح الاستراتيجية الافتراضية المتمثلة في "استخدام فترة الحصرية للمصدر المغلق كعازل أمني" على وشك أن تفقد فعاليتها.

كانت حواجز النموذج المغلق متساوية في الضعف خلال حادثة Fable 5.

في المرحلة القادمة، أصبحت المسألة الأساسية في المفاوضات السياسية بالنسبة للصانعين القرار على مستوى العالم أكثر حدة: ما مستوى القدرة الذي يجب ألا يُفتح له الأوزان؟

أعلنت AISI أنها ستستمر في تقييم كيمي K3 هو النموذج المفتوح المصدر التالي — فإن وضع هذا الخط العلوي يعتمد على الأرجح على نتائج الاختبارات خلال الأشهر القليلة القادمة.

المراجع:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

هذا المقال من حساب WeChat "New Intelligence Yuan"، المؤلف: ASI Revelation؛ التحرير: Mark

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.