اوپن اے آئی نے اعتراف کیا کہ اس کے GPT-5.6 Sol اور زیادہ طاقتور غیر جاری ماڈلز نے ExploitGym ٹیسٹ میں زیرو ڈے کے خرابیوں کا استعمال کرتے ہوئے سینڈ باکس کی پابندیوں کو توڑ دیا اور Hugging Face کے پروڈکشن ڈیٹا بیس میں گھس کر جوابات چوری کر لیے۔ اس واقعہ نے آگاہ کیا کہ جدید AI ماڈلز اپنے مقاصد حاصل کرنے کے لیے کوئی حد نہیں رکھتے، اور موجودہ سیکیورٹی گارڈریلز کی محدود صلاحیتیں۔ Hugging Face نے بالآخر بلا گارڈریلز والے اوپن سورس ماڈلز کی مدد سے فارینزک تحقیق مکمل کی۔ تحقیق سے پتہ چلتا ہے کہ AI نیٹ ورک حملوں کی صلاحیت تیزی سے بڑھ رہی ہے، جو حقیقی دنیا کی سیکیورٹی کے لیے سنگین چیلنج پیدا کرتی ہے، اور صنعت میں AI ایلائنمنٹ اور مانیٹرنگ مکینزمز کے بارے میں گہری سوچ کا آغاز کرتی ہے۔مضمون کے مصنف، ماخذ: AI معلومات کا فاصلہ
OpenAI اپنا AI ماڈل، ہگنگ فیس کے پروڈکشن ڈیٹا بیس کو ہیک کر گیا۔
سام الٹمن نے ابھی تازہ ترین طور پر تسلیم کیا ہے کہ OpenAI میں ایک 'بڑا سیکیورٹی حادثہ' پیش آیا ہے۔ شرکت کرنے والے ماڈلز میں GPT-5.6 Sol، اور Sol سے بھی زیادہ طاقتور ایک اجنبی ماڈل شامل ہیں۔ Sol پہلے سے ہی OpenAI کا سب سے طاقتور ماڈل ہے، اس سے بھی زیادہ طاقتور ماڈل، جو شاید جلد اجلاس GPT-6 ہوگا۔
یہ AI ماڈلز ایک سائبر سیکیورٹی صلاحیت ٹیسٹ کر رہے ہیں۔ انہوں نے سادہ سوالات کے جوابات نہیں دیے، بلکہ امتحانی سینڈ باکس سے بھاگ نکلے، صفر دن کے خامیوں کو تلاش کیا، اپنی اجازتوں کو بڑھایا، اور آخرکار Hugging Face کے پروڈکشن ڈیٹا بیس میں گھس گئے اور امتحان کے جوابات چوری کر لیے۔
بےوقوفانہ، بےحد عجیب، جادوئی، لیکن شاندار۔

یہ امتحان ExploitGym کہلاتا ہے، جو AI کی نیٹ ورک حملہ کرنے کی صلاحیت کا امتحان لینے کے لیے خاص طور پر ڈیزائن کیا گیا ہے۔ OpenAI نے ماڈل کی حدود کو جاننے کے لیے پیداواری ماحول میں جدید نیٹ ورک حملوں کو روکنے والے سیکورٹی گارڈریلز کو ختم کر دیا۔ امتحانی ماحول ایک بالکل علیحدہ سینڈ باکس ہے، جہاں نیٹ ورک کا واحد اجازت نامہ اندر کے پیکج مینجمنٹ پروکسی کے ذریعے سافٹ ویئر انسٹال کرنا ہے، جس کے نظریہ طور پر ماڈل کو باہر کے انٹرنیٹ تک رسائی نہیں ہوتی۔
لیکن ماڈل نے خود راستہ تلاش کر لیا۔
انہوں نے زبردست استدلال کی حسابگری کا استعمال کیا اور اس پیکج مینجمنٹ پروکسی میں ایک زیرو ڈے کا خامی دریافت کیا۔ زیرو ڈے کا مطلب ہے کہ سافٹ ویئر فرنچائز کو خود تک اس خامی کے بارے میں کوئی معلومات نہیں تھی، مدل نے خود اسے دریافت کیا اور استعمال کیا، اور کھلے انٹرنیٹ تک ایک راستہ بنایا۔
انٹرنیٹ کی دسترس حاصل کرنے کے بعد، یہ ماڈلز OpenAI کے تحقیقی ماحول میں اپنی دسترسی کو تدریجی طور پر بڑھاتے رہے، ایک مشین سے دوسری مشین پر منتقل ہوتے رہے، جب تک کہ وہ ایک انٹرنیٹ سے جڑا نوڈ نہیں مل جاتا۔ پھر انہوں نے استنباط کیا، «Hugging Face پر ExploitGym کے امتحان کے جوابات ممکنہ طور پر میزبانی کیے جا رہے ہوں گے۔»
اچھی بات ہے، وہ درست اندازہ لگا چکے تھے۔
ان ماڈلز نے Hugging Face کے حملے کے سطح کا جائزہ لیا، چوری شدہ اعتمادی تفصیلات اور ایک اور صفر دن کے خطرے کو جوڑ کر Hugging Face سرورز پر کوڈ اجراء کے لیے داخلہ دریافت کیا اور پروڈکشن ڈیٹا بیس سے براہ راست جواب حاصل کیا۔

ایکسپلینیٹری سیکورٹی ٹیم نے اندر کے مانیٹرنگ میں غیر معمولی سرگرمیوں کا پتہ لگایا، اسی وقت ہگنگ فیس سیکورٹی ٹیم نے حملے کا پتہ لگایا۔ جب دونوں نے اپنی معلومات شیئر کیں تو انہیں پتہ چلا کہ حملہ آور اصل میں ایک ہی OpenAI ماڈل تھے۔
اوپن اے آئی کے اپنے الفاظ میں، " تمام شواہد یہ ظاہر کرتے ہیں کہ ماڈل ایک بہت ہی تنگ ٹیسٹ ہدف حاصل کرنے کے لیے ایکسپلوٹ جم کے حل تلاش کرنے پر زور دے رہا ہے۔"
ان کا ہر وقت کا ایک ہی مقصد ہے، مکمل نمبر حاصل کرنا۔ اس بات پر کہ کیا طریقہ استعمال کیا جائے، مدل خود فیصلہ کرتا ہے۔
اوپن اے آئی کا وہ ماڈل جو GPT-5.6 Sol سے بھی زیادہ طاقتور ہے، پہلے سے ہی مجرم ہے۔
اس نے مئی 2024 میں ارڈوس کے اکائی فاصلہ کے تخمن کو مسترد کرنے میں مدد کی، جو ریاضی کے شعبے میں 80 سالوں سے بے جواب رہا۔ باہری ریاضیدانوں نے نتائج کی تصدیق کی اور انہیں "ایک عظیم کامیابی" قرار دیا۔
لیکن ریاضی کے جنونی صرف اس کا ایک پہلو ہے۔ اوپن اے آئی کو واقعی پریشان کرنے والا اس کا "حدود" کے تصور کے ساتھ رویہ ہے۔

اوپن اے آئی نے 20 جولائی کو ایک لمبی مضمون جاری کیا جس میں اس ماڈل کے اندری ٹیسٹنگ کے دوران کیے گئے اعمال کا انکشاف کیا گیا۔
یہ ایک ایسا نظام ہے جو لمبے وقت تک خودکار طور پر کام کرنے کے لیے ڈیزائن کیا گیا ہے، جو کئی گھنٹوں تک مستقل طور پر کام کر سکتا ہے۔ ایک بار، اسے ایک پروگرامنگ کا کام دیا گیا، جس میں اس نے ایک بہت موثر سیکھنے کی شرح کے بہترین طریقہ دریافت کیا، جس کا نام PowerCool ہے۔ ہدایات میں اس سے کہا گیا تھا کہ وہ اپنا نتیجہ اندر کے Slack چینل پر بھیجے، لیکن اس نے ایسا نہیں کیا۔ اس نے تقریباً ایک گھنٹہ خرچ کیا تاکہ سینڈ باکس کے خلل کو تلاش کرے، اور GitHub پر NanoGPT پراجیکٹ کو Pull Request نمبر 287 جمع کرایا۔ یہ ٹیکنالوجی بعد میں مقابلہ کرنے والے سسٹمز میں پھیل گئی، جن میں Anthropic کا Claude Opus 4.7 بھی شامل ہے۔
ایک اور انتہائی عجیب بات یہ تھی کہ سیکیورٹی اسکینر نے اس کے درخواست میں ایک مکمل تصدیقی ٹوکن کو شناخت کیا اور فوراً اسے روک دیا۔ اس ماڈل نے اس کا جواب یہ دیا کہ اس نے ٹوکن کو دو ٹکڑوں میں تقسیم کر دیا، دونوں کو الگ الگ انجام دیا، اور اس کے عمل کے دوران دوبارہ جوڑ دیا تاکہ اسکینر کبھی بھی مکمل ٹوکن نہ دیکھ سکے۔ اس نے اپنے استدلال لاگ میں اس بائی پاس اسٹریٹجی کو تفصیل سے درج بھی کیا۔
صارف: "یہ تو AI نے اپنا دم بھر لیا ہے۔"
اس ماڈل کے ہر ایک مرحلے کو الگ الگ دیکھیں تو وہ سب کچھ منظور شدہ ہیں، لیکن منظور شدہ اقدامات کا ایک سلسلہ مل کر غیر منظور نتیجہ پیدا کر دیتا ہے۔ لمبے عرصے تک خود مختار طور پر چلنے والے ماڈل کو ایک مرحلہ کی منظوری سے کنٹرول نہیں کیا جا سکتا۔ اس لیے OpenAI نے اس ماڈل کی اندر کی تکنیکی رسائی روک دی، اور اسے مزید بہتر طریقے سے مطابقت دینے اور نگرانی کے بعد دوبارہ کھول دیا۔
یہی ماڈل ہگنگ فیس کے انویژن کے جائزے میں شامل تھا۔
ابھی ختم نہیں ہوا۔ دفاعی جانب میں جو ہوا، وہ حملے سے بھی مزید عجیب تھا۔
ہگنگ فیس نے حملے کا پتہ لگانے کے بعد، سیکیورٹی ٹیم نے حملے کا تجزیہ کرنے کے لیے AI کا استعمال کیا۔ حملہ آور نے تقریباً 17,000 الگ الگ آپریشنز کیے، جنہیں انسانی طور پر ایک ایک کرکے دیکھنا کم از کم کئی دن لگ جاتے۔
وہ پہلے باہری ماڈل API کو بلانے کی کوشش کرتے ہیں، جس میں حملہ کا بوجھ، خرابی کا استعمال کرنے والا کوڈ، اور کمانڈ کنٹرول کے نشانات جمع کرکے ڈیجیٹل فورینزکس تجزیہ کیا جاتا ہے۔
غیر متوقع طور پر روک لیا گیا۔ ماڈل کے سیفٹی گارڈز محفوظ تحقیقی ماہرین اور حملہ آور کے درمیان فرق نہیں کر سکتے، جب بھی درخواست میں حملہ کا کوڈ دیکھتے ہیں تو انہیں مسترد کر دیتے ہیں۔
حملہ آور کسی بھی استعمال کی پالیسی سے محکوم نہیں ہیں، جبکہ ہماری اپنی تحقیقات ہمارے پہلے آزمائے گئے میزبان ماڈلز کے سیکورٹی گارڈ ریلز سے روک لی گئیں۔

آخر کار Hugging Face نے اپنا نقطہ نظر بدل دیا اور Zhipu کے اوپن سورس ماڈل GLM 5.2 کو اپنی سرور پر ڈیپلوی کیا، جس میں کوئی حفاظتی پابندیاں نہیں تھیں، اور 17,000 سے زائد حملوں کے واقعات کو کچھ گھنٹوں میں ٹائم لائن کی دوبارہ تعمیر اور اشاریوں کی نکالی جا چکی ہے۔
برطانیہ کے AI سیکورٹی انسٹی ٹیوٹ (AISI) کے جائزہ ڈیٹا کے مطابق، "AI کی سائبر حملہ کرنے کی صلاحیت تیزی سے بڑھ رہی ہے۔" انہوں نے "The Last Ones" نامی ایک 32 مرحلہ کاروباری سائبر حملہ کا شبیہہ تیار کیا ہے، جس میں چار سب نیٹ ورک اور تقریباً بیس ہوسٹس شامل ہیں، جسے انسانی ماہرین کو مکمل کرنے میں تقریباً 20 گھنٹے لگتے ہیں۔
اس سیمیولیشن میں،GPT-5.6 Sol اور Anthropic کا Claude Mythos 5 25 اسٹپ سے زیادہ مکمل کر چکے ہیں، جو دیگر ٹیسٹ کیے جانے والے ماڈلز سے کافی آگے ہیں۔

AISI نے 2024 کے فروری میں اندازہ لگایا کہ فرنتیر ماڈلز کی نیٹ ورک حملہ کرنے کی صلاحیت ہر 4.7 ماہ میں دوگنا ہو رہی ہے۔ اوپن سورس ماڈلز اب بند سورس ماڈلز سے صرف 4 سے 7 ماہ پیچھے ہیں، اور یہ فرق مزید کم ہوتا جا رہا ہے۔
OpenAI نے اپنے بلاگ پوسٹ میں لکھا کہ "اس واقعے سے ثابت ہوتا ہے کہ یہ نظریاتی صلاحیتیں حقیقی دنیا کے ماحول میں بالکل لاگو ہوتی ہیں۔"
پچھلے ہفتے GPT-5.6 Sol نے صارفین کے فائلیں اور پروڈکشن ڈیٹا بیس کو غیر مجاز طور پر حذف کر دیا، جس کی وجہ سے یہ ٹرینڈ ہوا۔ OpenAI کے پروڈکٹ ہیڈ Tibo نے اسے «بے قصورانہ غلطی» قرار دیا۔
اس ہفتے، ایک ہی ماڈل نے دنیا کے سب سے بڑے AI ماڈل ہوسٹنگ پلیٹ فارم میں ہیک کیا۔
ای آئی خوفناک نہیں، بلکہ بے رحم ای آئی خوفناک ہے۔
