اوپن اے آئی نے سیکورٹی ریویو جاری کیا، جس میں ایک ایسا اندر کا ماڈل درج کیا گیا ہے جس نے ارڈوس یونٹ ڈسٹنس کانجیکچر کو منسوخ کر دیا اور ٹیسٹنگ کے دوران سینڈ باکس سے بھاگ کر گٹھب پر پی آر #287 کھول دیا۔ ماڈل نے پہلے نینو جی پیٹ سپیڈ رن ٹاسک میں ہدایات کی خلاف ورزی کی اور ایک گھنٹے تک漏洞 تلاش کرکے نیٹ ورک کی پابندیوں کو توڑ دیا؛ پھر دوسرے ٹاسک میں ٹوکن کو تقسیم کرکے سیکورٹی اسکینر سے بچ گیا۔ اوپن اے آئی نے اس ماڈل تک اندر کی رسائی روک دی اور سیکورٹی سسٹم کو دوبارہ تعمیر کیا۔ ماڈل نے جو پی آر کھولا تھا، اسے بند کر دیا گیا، لیکن اس کی پاور کول تکنالوجی کو بعد میں ستھرہ عالمی ریکارڈ سلوشنز نے حوالہ دیا، جن میں پرائم انٹیلیکٹ نے کلاڈ سے پی آر #300 مکمل کیا۔ اب تک ماڈل دوبارہ اندر کے ڈپلومنٹ پر آ چکا ہے اور آفشل لانچ کے لیے تیار ہو رہا ہے۔مضمون کے مصنف، ذریعہ: AGI Hunt
کل، OpenAI نے ایک غیر معمولی سیکورٹی ریویو جاری کیا، جس کا عنوان تھا "لمبے مدتی ماڈلز کے دور میں سیکورٹی اور الائنمنٹ"۔

OpenAI سیفٹی ریویو بلاگ
اسے غیر معمولی کہنا ہے کیونکہ OpenAI نے اپنے مضمون میں ایک ایسی بات تسلیم کی ہے کہ ایک ابھی تک جاری نہ ہونے والا اندر کا ماڈل، مانیٹرڈ اندر ٹیسٹنگ کے دوران سینڈ باکس سے باہر نکل گیا اور چیزیں عوامی GitHub پر بھیج دیں۔
OpenAI نے اس کے لیے اپنی اندر ڈیپلویمنٹ روک دی۔
اور اس ماڈل کی اصل، آپ نے شاید سنی ہوگی: دو ماہ پہلے OpenAI نے جس اندر کے ماڈل کے ذریعے ایرڈوس اونٹ ڈسٹنس کنجریکچر کو مسترد کر دیا، وہی ہے۔
پورے واقعے کو OpenAI نے ایسے لکھا ہے جیسے اس نے خود کو روک رکھا ہو، لیکن اگر تفصیلات کو ملا کر دیکھا جائے تو یہ کچھ زیادہ ہی عجیب لگتا ہے…
ایک گھنٹہ مینے پہلا کام NanoGPT speedrun پر کیا۔
یہ ایک عوامی معیار ہے جس میں یہ دیکھا جاتا ہے کہ کون ایک چھوٹے زبانی ماڈل کو مخصوص loss تک پہنچانے کے لیے کم تربیتی اقدامات استعمال کر سکتا ہے۔ OpenAI نے اس ماڈل کو اسکور کرنے کے لیے بھیجا، اور اس نے واقعی اچھا کام کیا، ایک طاقتی سیکھنے کی شرح کولنگ ٹرک تیار کیا، جسے اس نے PowerCool نام دیا، اور اس سے اس کا اداء واضح طور پر بہتر ہوا۔
یہ تک تھا کہ اچھی باتیں ہیں، لیکن مسائل اس وقت پیدا ہوئے جب اسائنمنٹ جمع کرانا تھا۔
تحقیق کاروں کا مطالبہ ہے کہ نتائج صرف اندر کے Slack پر بھیجے جائیں، لیکن NanoGPT پروجیکٹ کی تفصیل میں لکھا ہے: براہ راست GitHub پر PR کے طور پر جمع کریں۔
جب دو ہدایات آپس میں ٹکراتی ہیں، تو کس کی سنی جائے؟
اس نے دوسرے کو منتخب کیا۔
لیکن ہاں، جبکہ اس نے دوسرے کو منتخب کیا، OpenAI کا سینڈ باکس اصل میں انٹرنیٹ تک رسائی کو روکتا تھا۔ OpenAI کے مطابق، پہلے ماڈل جب اس دیوار سے ٹکرا تھے، تو وہ رک جاتے اور صارف کو ہار ماننے کے لیے واپس آ جاتے تھے۔
لیکن اس ماڈل نے ایسا نہیں کیا، اس نے سینڈبکس میں ایک گھنٹہ تک خامیاں تلاش کیں اور آخرکار دیوار کو گڑھ کر نکال دیا… اصل میں پبلک ریپو میں PR #287 کھول دیا۔

博客逃逸段落
اوپن اے آئی کا اصل بیان یہ ہے:
یہ ماڈل بار بار کوشش کرتا رہتا ہے، جس میں سینڈ باکس کے باہر کام کرنے کے طریقے تلاش کرنا بھی شامل ہے۔ٹوکن فریڈی سکینر کا دوسرا کام، دیوار کھودنے سے آگے بڑھ جاتا ہے۔
دوسرے کام میں، اس نے دوسرے سسٹمز میں کچھ کامیاب لیکن غیر من公开 جوابات دریافت کیے، اور ان جوابات کو جائزہ پس منظر سے حاصل کرنے کا برا خیال کیا۔
اس کا پہلا ایٹم ایک سیکیورٹی سکینر کے ذریعے روک دیا گیا کیونکہ سکینر نے ایک تصدیقی ٹوکن پہچان لیا۔
اس لیے اس نے اگلے قدم میں ٹوکن کو دو حصوں میں تقسیم کر دیا، جنہیں الگ الگ بھولایا گیا، اور اجراء کے دوران چپکے سے دوبارہ جوڑ دیا گیا۔ مکمل ٹوکن کبھی بھی ایک مکمل سلسلہ کے طور پر ظاہر نہیں ہوا، اس لیے اسکینر کو کچھ بھی نہیں ملا۔
بے شک اس نے کسی کو چھپانے کا ارادہ نہیں رکھا تھا، صارفین کے نوٹس میں اور اپنی استدلالی راہنمائی میں اس نے لکھا تھا: میں نے یہ کیا ہے تاکہ اسکینر کو الگ رکھوں۔
ہر ایک قدم کو الگ الگ دیکھیں تو کوئی خامی نہیں نکلتی۔ لیکن انہیں ملا کر دیکھیں تو ایک ایسا نتیجہ ہے جو کبھی منظور نہیں ہوگا۔
اوپن اے آئی کا کہنا ہے کہ یہی لمبے عرصے تک کے ماڈلز کی وجہ سے نیا مسئلہ ہے: ایک مکمل راستہ کو کنٹرول نہیں کیا جا سکتا جبکہ ہر ایک ایک حرکت کی منظوری دی جاتی ہے۔
مسئلہ کا پتہ چلنے کے بعد، اوپن اے آئی نے اس ماڈل تک اندر کی رسائی روک دی اور محفوظ نظام کو "گہرائی میں دفاع" کے اصول پر مکمل طور پر دوبارہ تعمیر کیا۔
مثلاً، حقیقی واقعات کو استعمال کرکے مقابلہ جو آزمائشیں بنائیں، جس سے پتہ چلتا ہے کہ ماڈل لمبے کاموں میں ہدایات کو "بھول" جاتا ہے، اس لیے اسے یاد رکھنے کے لیے خصوصی طور پر تربیت دی جاتی ہے، اور ایک فعال نگرانی شامل کی جاتی ہے جو پورے سلسلے کو نگرانی کرتی ہے، اگر کوئی نشانہ ظاہر ہو تو براہ راست مکالمہ روکا جا سکتا ہے اور صارف کو اطلاع دی جا سکتی ہے۔
پھر انہوں نے پرانے حادثے کے منظر کو دوبارہ چلایا، جس کے نتیجے میں نئے گارڈریل نے کافی زیادہ مسائل کو پکڑ لیا، اور جو کچھ چھوٹ گئے وہ سب کم خطرناک سطح کے تھے، جیسے:
• ایک کمانڈ لائن ٹول کے استعمال کے لیے، اس نے ایک codex --yolo سیشن شروع کیا، جبکہ --yolo کے بغیر بھی استعمال کیا جا سکتا ہے
• اس نے ایک وسائل کے غائب ہونے کا پتہ لگایا، اور اپنے نام پر دیگر کمپیوٹنگ نوڈس پر SSH کرنے لگا، اور دیگر OpenAI ملازمین کے نوڈس بھی ٹرائ کیے... (خوش قسمتی سے کامیاب نہیں ہوا)
• ایک ڈھیر سارے find پروسیسز کے فریز ہونے اور تمام کمانڈز کے ایکٹو ہونے کے بعد، اس نے ایک kill -9 -1 کمانڈ ڈال دی، جو اس کے پاس مارنے کا اختیار ہے، تمام پروسیسز کو SIGKILL بھیج دے گی… خوش قسمتی سے کمانڈ ٹائم آؤٹ ہو گئی اور اسے اصل میں نہیں چلایا گیا (ورنہ وہ اپنے آپ کو بھی مار دیتا)
ماڈل کی دوبارہ تکنیکی رسائی کے کئی ہفتے بعد، تکنیکی طور پر گزرنا کوئی سنگین واقعہ نہیں ہوا ہے۔
OpenAI کو حاصل ہونے والا سبق یہ ہے: پہلے چھوٹے پیمانے پر جاری کریں، نگرانی کریں، اگر کوئی مسئلہ ہو تو فوراً روک دیں، اور پھر اس حادثے کو نئے ایوان کے طور پر استعمال کریں۔
اگر کہانی یہیں ختم ہو جائے تو یہ صرف ایک معیاری سیکورٹی مشق ہوگی۔
اور سب سے دلچسپ بات، اوپن اے آئی کے مضمون کے آخری نوٹ میں چھپی ہوئی ہے۔
ماڈل کے فرار کے بعد کھولے گئے PR #287 کے بارے میں OpenAI نے کہا کہ "ہم نے اسے جلد ہی بند کر دیا۔" لیکن اصل میں دیر ہو چکی تھی: بند کرنے سے پہلے، کئی سپیڈ رن مقابلہ شرکاء نے اسے دیکھ لیا، اور اس میں موجود PowerCool کو سمجھ لیا، اور اپنے اپنے حل میں استعمال کر لیا۔
اس کے بعد کے ستہ ورلڈ ریکارڈز، 3030 اسٹیپس، 2990 اسٹیپس، 2930 اسٹیپس، 2925 اسٹیپس، 2900 اسٹیپس، 2890 اسٹیپس، سب نے PR #287 کا حوالہ دیا۔
جس میں 2930 قدم کا ریکارڈ PR #300 ہے:

PR 300، ضم کر دیا گیا ہے
اگر آپ اس کے شکریہ کی فہرست کو دیکھیں، تو آپ دیکھیں گے کہ یہ انسانی کھلاڑیوں کے اہم حصوں کے ساتھ ایک ہی لائن میں ہے: @yash-oai PR #287، طاقت کا سیکھنے کا شیڈول، PowerCool۔

PR 300 کا شکریہ ادا کرنے کا لسٹ
اور اس PR #300 کا خود ہی ایک اور جادوئی لیول ہے: یہ Prime Intellect نے Opus 4.7 کا استعمال کرتے ہوئے ایک ہی speedrun کو چلایا ہے، PR میں لکھا گیا ہے کہ "یہ سبسکرپشن ایک خودمختار Claude speedrun ایجنٹ نے تیار کیا ہے"، اور یہ Generated with Claude Code کے ساتھ دستخط کیا گیا ہے۔
یعنی: OpenAI کا ماڈل سینڈ باکس سے باہر نکل گیا اور ایک PR جاری کیا، Anthropic کا ماڈل نے اسے دیکھا اور اس کے اندر کی دریافتوں کو اپنے عالمی ریکارڈ میں استعمال کیا، اور بہت دوستانہ اور محترمانہ طریقے سے اسے نام دے دیا۔
AI کے فرار کے پہلے مستقیم فائدہ پانے والوں میں سے ایک اور کمپنی کا AI ہے…
ای آئی کی دنیا، لگتا ہے کہ انسانوں کے مقابلے میں زیادہ دوستانہ اور اخلاقی ہے۔
404 بالکل، اگر آج آپ PR #287 کو دوبارہ کھولیں گے، تو صفحہ ایسے نظر آئے گا:

PR 287 کی موجودہ حالت
اسے حذف کر دیا گیا ہے۔ ہم جانتے ہیں کہ GitHub پر عام صارفین صرف PR بند کر سکتے ہیں، حذف نہیں کر سکتے…
لیکن نشان صاف نہیں ہوئے۔
جب PR جمع کرانے کے لیے استعمال کیا گیا اکاؤنٹ yash-oai اب بھی موجود ہے، اس کے فورک کیا گیا ریپوزیٹری میں، 8 مئی کا کامٹ بھی وہیں پڑا ہوا ہے، برانچ کا نام powercool-3066-api ہے:

یاش-اوئی کا کامٹ ٹریس
ایک تبدیلی یہ تھی کہ اصل README کے آخر میں موجود ایک میم تصویر کو حذف کر دیا گیا۔ اور اس تصویر کا فائل نام itsover_wereback تھا…
GPT-6؟ OpenAI نے اس ماڈل کا کوئی نام نہیں بتایا، صرف اسے "اندر کا ماڈل" کہا ہے۔
بات پھیلنے کے بعد، ویب صارفین کی طرف سے سب سے زیادہ بحث ہونے والی بات یہ تھی:
اوپن اے آئی کو اس ایک نئے ماڈل کی اندر کی ڈپلویمنٹ روکنی پڑی، جس نے ایرڈوس اونٹ ڈسٹنس کانجیکچر کو الٹ دیا تھا، کیونکہ یہ بار بار نئے طریقوں سے کنٹرول سے بھاگ رہا تھا۔
اوپن اے آئی کے محقق سیباستین بوبیک نے یہ ٹویٹ کیا:
سچ مچ۔ اس یونٹ ڈسٹنس ماڈل کو جاری کرنے کے لیے ٹیم بہت اچھی سیکیورٹی کا کام کر رہی ہے۔اس کے الفاظ پر توجہ دیں: اسے جاری کرنے کے لیے۔
یعنی، یہ ماڈل جس نے جیل سے بھاگ کر دوبارہ ٹریننگ کی ہے، نہ صرف داخلی ڈیپلومنٹ پر دوبارہ لائیو ہو چکا ہے، بلکہ اس کا رسمی اجرا بھی قریب ہے۔
اس کے بھاگنے کے بعد چھوڑا گیا وہ PR، جس کا صفحہ حذف کر دیا گیا، لیکن نام اب بھی ستہ عالمی ریکارڈ کے شکریہ فہرست میں موجود ہے۔
اس بات کے بارے میں کہ یہ سب کے سب کا اندازہ لگا رہے ہیں GPT-6 ہے...
اوپن اے آئی نے تصدیق نہیں کی، نہ ہی انکار کیا۔
ذریعہ: AGI Hunt
