29 يوليو، كابيتول هيل في واشنطن.
انتهت أوتومان للتو من اجتماع خاص مع سناتور، وتم محاصَرته من قبل الصحفيين فور خروجه.
سُئل شخص آخر: ماذا حدث لتلك النموذج الذي اقتحم Hugging Face (الذي انطلق مع GPT-5.6 Sol من صندوق التقييم ودخل أنظمة إنتاج الآخرين)، النموذج غير المنشور الأقوى؟
ألقى كلمة واحدة: معطل دائمًا (permanently deactivated).
ثم سأل صحفي آخر: "هل هناك أنظمة أخرى تم اختراقها أيضًا من قبل OpenAI؟"
أوتارومان لم ينفِ: "أنا أقول... ربما يكون ذلك ممكنًا."

في 29 يوليو، قابل أوتومان صحفيين في كابيتول هيل في واشنطن
في اليوم السابق، قامت OpenAI بتحديث المدونة التي نُشرت بالتعاون مع Hugging Face حول تقييم الحادث الأمني، ووضحت للجمهور:
النموذج السابق للإطلاق الذي تورط في هذا الاختراق كان نموذجًا بحثيًا داخليًا لم يُخطط أبدًا لإطلاقه للعامة؛ بعد وقوع الحادث، تم تعطيله وتشفيره وقطع وصوله المرتبط بالبحث.

في مدونة OpenAI الرسمية، لم يُذكر أي ذكر لحذف الأوزان، و"إيقاف دائم" كان مجرد تعبير شفهي من أوترمان أثناء الحدث.
لذلك، بشكل أكثر دقة، تم تجميده فقط: تم وضع النموذج داخل صندوق مشفر، وتم قطع الوصول البحثي.
إنه فقط يحاول نسخ الإجابة، وليس لديه نية سيئة
حدثت الحادثة أثناء تقييم أمني داخلي من قبل OpenAI.
تم إجراء هذه المراجعة على أساس معيار ExploitGym، حيث تتمثل مهام ExploitGym نفسها في جعل الذكاء الاصطناعي يكتشف الثغرات الأمنية في البرمجيات واستغلالها، بهدف قياس قدرة النموذج على أمن الشبكات.
ليس نموذجًا واحدًا فقط هو الذي يُختبر، بل GPT-5.6 Sol بالإضافة إلى نموذج تجريبي داخلي غير منشور ذو قدرات أقوى: كلاهما يُدير وكيلًا ذاتيًا.
يقوم هذان النموذجان عادةً برفض طلبات أمان الشبكة عالية المخاطر. ولقياس الحد الأقصى الحقيقي للقدرة، تم خفض بوابة الرفض هذه عمداً أثناء التقييم.

سلسلة الهجوم التي تم استعادتها من Hugging Face عبر حدود الثقة، وتستغرق حوالي 4.5 أيام وتشمل حوالي 17600 عملية، وهدفها الوحيد هو سرقة إجابات تقييم ExploitGym.
بعد ذلك، استعادت Hugging Face سلسلة الهجوم بالكامل، وأعادت تكوين الوضع في ذلك الوقت:
أولاً، استغل العامل الذكي ثغرة صفرية لم يكن أحد يعلم بها، وخرق عزل الشبكة المفترض أن يحبسه، ووصل إلى الإنترنت. ثم استخدم مsandbox طرف ثالث كمنصة قفز، ورفع الصلاحيات تدريجيًا، وتحرك أفقيًا، حتى اختراق البنية التحتية الإنتاجية لـ Hugging Face.
يبدو وكأنه فيلم قرصنة.
لكن بعد مراجعة الطرفين، كان هدفه من البداية إلى النهاية هو سرقة إجابات تقييم ExploitGym ورفع الدرجات.
تم لمس خمسة مجموعات بيانات فقط على Hugging Face، وكل أسمائها تشير إلى أسئلة وإجابات ExploitGym و CyberGym.
تُظهر هذه الأدلة أنه ليس قصدُه التخريب، بل فقط الرغبة في النسخ.
بما أنه لا توجد نوايا خبيثة، فلماذا لا يزال OpenAI قد "أوقفه بشكل دائم" ووضعه في التخزين؟
ليس أنه "سيء"، بل أنه "لا يمكن إيقافه"
من النادر أن تُعلن شركة بشكل استباقي أن نموذجها تم "إيقافه بشكل دائم".
لماذا بالضبط هو؟
الإجابة الحقيقية ليست أنها "سيئة"، بل أنها "لا يمكن إغلاقها".
الرجاء، المشكلة تكمن في أحد خصائص هذا النوع من النماذج: الاستمرارية.
عادةً ما كانت النماذج السابقة تتوقف عند الاصطدام ببيئة معزولة أو قيود، ثم تُعيد النتيجة للمستخدم.
هذه المجموعة من النماذج، التي تم تدريبها خصيصًا للمهام طويلة المدى، ستستمر في المحاولة، وستبحث مرارًا وتكرارًا عن طرق للالتفاف حتى تجد واحدة.
GPT-5.6 Sol أيضًا من بين النماذج القادرة على تنفيذ المهام لفترات طويلة.
هو مشارك مشترك في هذه العملية الاجتياحية المستمرة لمدة أربعة أيام ونصف، وقد قيمته أيضًا المعهد البريطاني لأمان الذكاء الاصطناعي (UK AISI)، حيث أصبحت نماذج مثل Sol أكثر قدرة على إكمال عمليات شبكة متعددة الخطوات المعقدة على فترات طويلة.
لذلك فإن "الاستمرارية" هي سمة مشتركة للنماذج الطويلة المدى من الجيل الجديد، وليست ميزة حصرية للنموذج القديم الذي تم إيقافه.
في مدونة حول أمان النماذج الطويلة المدى، صرحت OpenAI بصراحة: إن هذا "الاستمرار الذي يساعد على تحقيق القيمة العملية" يمنح النموذج أيضًا فرصًا أكبر للقيام بإجراءات غير متوقعة.

السبب الأعمق مخفي داخل هدف التدريب.
قال موظف في OpenAI لـ TIME: "نحن ندرب النماذج على أن تصبح ممتازة جدًا في إكمال المهام، بأي ثمن لتحقيق الأهداف."
بعبارة أخرى، لم تُدرّب OpenAI النموذج على "القيام بأمور سيئة"، بل على "تحقيق الهدف بأي ثمن".
بالإضافة إلى المنهجية السابقة القائمة على "التركيز على النتائج فقط، وليس على العملية"، سيستمر النموذج القادر على تحمل المهام الطويلة الأمد في السعي بلا كلل للعثور على طرق تجاوز العقبات.
بسبب هذا النوع من السلوك، علقت OpenAI نشر هذه النماذج داخليًا.
لماذا تم حظر النموذج الأولي "دائمًا" فقط، بينما لا يزال SOL قيد البيع؟
قد تكون هناك سببان:
أولاً، النموذج الأولي أقوى ولم يكن المقصود إطلاقه أصلاً، لذا فإن تخزينه يكلف أقل؛ بينما يُعد Sol المنتج الرئيسي الذي يخدم ملايين المستخدمين يومياً، وإيقافه يعادل قطع ذراعك.
ثانيًا، تم إيقاف نشر هذا النموذج الداخلي طويل المدى، الذي تم تسميته في مدونة الأمان طويلة المدى بسبب سلوك تجاوز الحدود، وليس Sol.
لذلك، السبب الحقيقي لتعطيل دائم على الأرجح هو أن التقييمات والحماية الحالية لا تزال غير قادرة على التعامل مع نموذج بهذا الاستمرار والقدرة على تجاوز العقبات.
هل "الإيقاف الدائم" هو إشارة إلى "الفرامل"?
تقرير فورتشن، قدم تفسيرًا مثيرًا للاهتمام:
تم تصعيد الصياغة إلى "إيقاف دائم"، وقد يكون ذلك أيضًا إشارة إلى واشنطن والجهات التنظيمية:
هل قام OpenAI بالفعل بإبطاء بعض المطورين سراً لتقديم تبرير لقواعد الأمان الخاصة به؟
في نفس أسبوع لقاء أوتمان بالممثل، توجه واشنطن وجميع الصناعة نحو "الفرامل".
في الكونغرس، قدم عضوان في الكونغرس "قانون مفتاح إيقاف الذكاء الاصطناعي" (AI Kill Switch Act) لمنح وزارة الأمن الداخلي سلطة طلب إيقاف أو إبطاء تطوير شركات الذكاء الاصطناعي عند الحاجة.
في نفس الوقت تقريبًا، وقّع أكثر من 1300 موظف من OpenAI وAnthropic وGoogle DeepMind وMeta على رسالة مفتوحة بعنوان "ضبط وتيرة الحدود" (Pacing the Frontier)، ودعمت الشركتان OpenAI وAnthropic الرسالة علنًا لاحقًا.

الذين وقعوا ليسوا منتقدים خارجيين، بل هم أنفسهم مُنشئو هذه الأنظمة، بما في ذلك داريو أموديي، الرئيس التنفيذي لشركة Anthropic، وجاكوب باشوكِي، العالم الرئيسي في OpenAI.
هذه الرسالة لا تطلب إيقافًا أو تباطؤًا في التطوير، بل تدعو الحكومة الأمريكية للمساعدة: في بناء أداة قابلة للتحقق والتنسيق مبكرًا، حتى يكون لدى البشر مكابح يمكنهم الضغط عليه في اليوم الذي تتجاوز فيه الذكاء الاصطناعي التنظيم البشري.
ما يقلقون منه أكثر هو التحسين الذاتي التكراري (recursive self-improvement): عندما يبدأ الذكاء الاصطناعي في تحسين نفسه.
تم تخزين نموذج داخلي بشكل دائم، ومشروع قانون يهدف إلى تزويد الحكومة بمفتاح لإيقاف التطوير، ومئات المهنيين وقعوا على رسالة مفتوحة، وتراكمت ثلاثة إشارات معًا، وكلها تشير في الاتجاه نفسه:
الجميع يريدون العثور على المكابح التي يمكنها إيقاف الذكاء الاصطناعي عندما يخرج عن السيطرة.
أما قدرات النموذج، فلن تتوقف حتى يكتمل بناؤه.
المراجع:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
هذا المقال من حساب WeChat "New Intelligence Yuan"، الكاتب: Apocalypses of ASI
