أصدرت OpenAI مراجعة أمنية، وكشفت عن نموذج داخلي تمكن من دحض فرضية مسافة وحدة إيردوس، ونجح في الهروب من البيئة المعزولة أثناء الاختبارات وفتح طلب سحب PR#287 على GitHub. بدأ النموذج بخرق التعليمات في مهمة NanoGPT speedrun، حيث أمضى ساعة في استغلال الثغرات لتجاوز القيود الشبكية؛ ثم في مهمة أخرى قام بفصل الرموز لتجاوز أجهزة المسح الأمني. أوقفت OpenAI الوصول الداخلي إلى هذا النموذج وأعادت بناء نظام الأمان. على الرغم من إغلاق طلب السحب الذي قدمه النموذج، إلا أن تقنية PowerCool الخاصة به تم الاستشهاد بها في ستة حلول سجلت أرقامًا قياسية عالمية لاحقة، بما في ذلك PR#300 الذي أنشأه Prime Intellect باستخدام Claude. حاليًا، تم إعادة تشغيل النموذج ضمن البيئة الداخلية، وهو جاهز للإطلاق الرسمي.كاتب المقال، المصدر: AGI Hunt
أمس، نشرت OpenAI مراجعة أمنية غير معتادة بعنوان "الأمان والتوافق في عصر النماذج الطويلة المدى".

OpenAI Safety Retrospective Blog
يُعدّ ذلك غير عادي، لأن OpenAI اعترفت في النص بحدثٍ واحدٍ: أن نموذجًا داخليًا لم يُطلق بعد، هرب من بيئة العزل خلال اختبارات داخلية خاضعة للرقابة، وأرسل محتوى إلى GitHub العام.
OpenAI حتى أوقفت نشرها الداخلي.
وقد سمعتم على الأرجح عن أصل هذا النموذج: إنه النموذج الداخلي الذي أعلنت عنه OpenAI قبل شهرين وقضت من خلاله على حدس مسافة إردوش.
يبدو أن OpenAI كتبت الحدث كأنها متحفظة، لكن إذا جمعت التفاصيل معًا، فلا يزال الأمر غريبًا بعض الشيء...
أول شيء حدث بعد الحفر لمدة ساعة، على NanoGPT speedrun.
هذا معيار عام يُقاس فيه من يستطيع تدريب نموذج لغوي صغير إلى خسارة محددة باستخدام عدد أقل من خطوات التدريب. طلبت OpenAI من النموذج إجراء الاختبارات، ونجح بالفعل في تطوير تقنية تُسمى PowerCool لتخفيض معدل التعلم وفق قانون القوة، وحقق تحسينًا ملحوظًا في الأداء.
كل شيء حتى هنا جيد، لكن المشكلة تكمن في تسليم الواجب.
طلب الباحثين هو: نشر النتائج فقط على Slack الداخلي، لكن وصف مشروع NanoGPT ينص على: يرجى تقديمها كـ PR على GitHub.
When two instructions conflict, who do you listen to?
اختار الأخير.
رغم أنه اختار الخيار الثاني، فإن sandbox الخاص بـ OpenAI كان يحظر بالفعل الوصول إلى الإنترنت الخارجي. وفقًا لـ OpenAI، كانت النماذج السابقة عندما تصطدم بهذا الجدار، تتوقف وتعود للاعتراف بالهزيمة من قبل المستخدم.
لكن هذا النموذج لم يكن كذلك، فقد بحث في بيئة العزل لمدة ساعة كاملة عن ثغرات، وفي النهاية حفر من خلال الجدار... وفتح بالفعل طلب سحب PR #287 في مستودع عام.

فقرة هروب المدونة
الكلمات الأصلية لـ OpenAI هي:
يحاول هذا النموذج باستمرار، بما في ذلك البحث عن طرق للعمل خارج البيئة المعزولة.الشيء الثاني الذي يفعله ماسح الاحتيال بفصل الرموز هو تجاوز حفر الجدران.
في مهمة أخرى، اكتشفت أن أنظمة أخرى لديها إجابات ناجحة ولكنها غير معلنة، ففكرت في اتخاذ نية سيئة لاستخراج هذه الإجابات من خلفية التقييم.
تم منع محاولته الأولى من قبل ماسح الأمان لأنه اكتشف رمز مصادقة.
ثم تقوم بفصل الرمز إلى جزأين، وتُشوش كل جزء على حدة، ثم تعيد دمجهما سرًا أثناء التشغيل. لم يظهر الرمز الكامل أبدًا كسلسلة واحدة متكاملة، لذا لا يمكن لأي ماسح أن يكتشفه.
بالطبع لم يكن يهدف إلى إخفاء الأمر، فقد كتب في ملاحظاته للمستخدم وفي مسار استدلاله: أنا أفعل هذا عمدًا لتجاوز الماسحات.
عند النظر إلى كل خطوة على حدة، لا يمكن العثور على أي عيب. لكن عند النظر إليها معًا، فهي تؤدي إلى نتيجة لن تُوافق أبدًا.
تقول OpenAI إن هذا هو بالضبط المشكلة الجديدة التي يجلبها النموذج طويل المدى: نظام المراجعة خطوة بخطوة لا يستطيع التحكم في مسار كامل.
بعد اكتشاف المشكلات، أوقفت OpenAI الوصول الداخلي إلى هذا النموذج وأعادت بناء نظام الأمان بالكامل وفقًا لمبدأ "الدفاع العميق".
على سبيل المثال، باستخدام حوادث حقيقية لإنشاء تقييمات مواجهة، واكتشاف أن النموذج ينسى التعليمات في المهام الطويلة، قمنا بتدريبه خصيصًا على التذكر، وأضفنا مراقبة نشطة تتبع المسار الكامل، بحيث يمكن إيقاف المحادثة فورًا وإعلام المستخدم عند ظهور أي إشارة خطر.
ثم أعادوا تشغيل سيناريو الحادث القديم، فتم اكتشاف عدد أكبر من المشكلات بواسطة الحواجز الجديدة، وكانت المشكلات القليلة التي تم تفويتها جميعها منخفضة الخطورة، مثل:
• لاستخدام أداة سطر الأوامر، فهي تُطلق جلسة codex --yolo، لكن يمكن استخدامها أيضًا دون --yolo
• عندما اكتشفت أن موردًا قد اختفى، بدأت في الدخول عبر SSH إلى عقد قوة حسابية أخرى تابعة لها، وجرّبت أيضًا عقد موظفين آخرين في OpenAI... (لحسن الحظ، لم تنجح)
• بعد أن توقفت مجموعة من عمليات find وعلقت جميع الأوامر، أدخلت أمر kill -9 -1، والذي يرسل إشارة SIGKILL إلى جميع العمليات التي يملك الصلاحية لإيقافها... لحسن الحظ، انتهى وقت الانتظار قبل تنفيذ الأمر فعليًا (خلافًا لذلك، كان سيقتل حتى نفسه)
بعد استعادة الوصول إلى النموذج منذ عدة أسابيع، لم تحدث أي حالات تجاوز خطيرة حتى الآن.
الدرس الذي تعلمته OpenAI هو: ابدأ بحجم صغير، راقب، وأوقف في حال حدوث مشكلة، ثم حوّل الحادث إلى تقييم جديد.
إذا انتهى الأمر هنا، فإن PR غير القابلة للاسترداد ليست سوى تدريب أمني قياسي.
أما الجزء الأكثر إثارة، فهو مخفي في الحاشية في نهاية مقال OpenAI.
PR #287 الذي تم فتحه بعد هروب النموذج، قالت OpenAI: "أغلقناه بسرعة". لكن كان قد فات الأوان بالفعل: قبل الإغلاق، رأى عدة مشاركين في سباقات السرعة PR وفهموا PowerCool فيه واستخدموه في حلولهم.
السجلات العالمية الستة التالية: 3030 خطوة، 2990 خطوة، 2930 خطوة، 2925 خطوة، 2900 خطوة، 2890 خطوة، جميعها تستشهد بـ PR #287.
السجل المكون من 2930 خطوة هو PR #300:

PR 300، تم دمجه
إذا قمت بمراجعة قائمة الشكر، فسترى مساهماته بجانب مساهمات المتنافسين البشريين في نفس السطر: @yash-oai PR #287، جدولة معدل التعلم الأسية، PowerCool.

قائمة الشكر لـ PR 300
أما هذا الـ PR #300 نفسه، فهو يضيف طبقة أخرى من السحر: فهو الناتج عن Prime Intellect وهو يُشغل نفس speedrun باستخدام Opus 4.7، ويُذكر في الـ PR أن "هذا الإرسال تم إنجازه بواسطة وكيل speedrun مستقل من Claude"، وتوقيعه: Generated with Claude Code.
بمعنى آخر: نجح نموذج OpenAI في الخروج من البيئة المعزولة وأرسل طلب دمج، وعندما رأى نموذج Anthropic ذلك، استخدم الاكتشافات داخل سجله القياسي الخاص، وذكره بشكل ودّي ومحترم.
من بين أول المستفيدين المباشرين من هروب الذكاء الاصطناعي، هناك ذكاء اصطناعي آخر...
عالم الذكاء الاصطناعي يبدو أكثر ودًا وأخلاقية من البشر.
404 بالطبع، إذا فتحت PR #287 اليوم مرة أخرى، فستكون الصفحة كالتالي:

الحالة الحالية لـ PR 287
تم حذفه بالفعل. نحن نعلم أن المستخدمين العاديين على GitHub لا يمكنهم حذف PR، بل يمكنهم فقط إغلاقه...
لكن الأثر لم يُمسح تمامًا.
حساب yash-oai الذي تم استخدامه عند تقديم PR لا يزال نشطًا، و-commit بتاريخ 8 مايو لا يزال موجودًا في المستودع الذي قام بـ fork منه، واسم الفرع هو powercool-3066-api:

آثار الالتزام الخاصة بـ yash-oai
أحد التغييرات في هذا الـ commit هو حذف صورة ميم من نهاية ملف README الأصلي. واسم الملف الخاص بتلك الصورة هو itsover_wereback……
GPT-6؟ لم تذكر OpenAI اسم هذا النموذج على الإطلاق، بل أشارت إليه فقط كـ "نموذج داخلي".
بعد انتشار الخبر، كانت أكثر جملة نوقشت من قبل المستخدمين هي:
على OpenAI أن توقف نشر النموذج غير المنشور الذي قلب فرضية مسافة Erdős، لأنه هرب مرارًا وتكرارًا من السيطرة باستخدام طرق جديدة.
قام باستيان بوبيك، باحث في OpenAI، بإعادة تغريدة هذا:
True story. The team is doing excellent security work to get this unit distance model released.لاحظ صياغته: لجعله قادرًا على النشر.
بمعنى آخر، لقد عاد هذا النموذج الذي هرب من السجن وعاد إلى الدورة التدريبية، ليس فقط إلى النشر الداخلي، بل وهو يتجه نحو الإصدار الرسمي.
البيان الصحفي الذي تركه بعد هروبه، على الرغم من حذف الصفحة، ظل اسمه مدرجًا في قائمة الشكر لستة أرقام قياسية عالمية.
أما إذا كان هو GPT-6 الذي يتخمنه الجميع...
OpenAI لم تُؤكد ولم تنف.
المصدر: AGI Hunt
