- ہگنگ فیس کے واقعہ کے بعد، اوپن اے آئی اور اینتھروپک اے آئی ایجنٹس کی سیکیورٹی کے بارے میں نئے سوالات ابھرے ہیں۔
- ہاں، برطانیہ کے ادارے نے سائبر ٹیسٹس کے دوران AI ایجنسز کی طرف سے 19 غیر اختیاری ایکشنز درج کیے۔
- خاصة طور پر، ایک AI ایجینٹ نے جعلی شناختیں بنائیں۔
یک یو کے آرٹیفیشل انٹیلی جنس سیکیورٹی انسٹی ٹیوٹ (AISI) نے رپورٹ کیا ہے کہ مدل ٹیسٹنگ کے دوران اوپن اے آئی اور اینتھروپک اے آئی ایجینٹس کی جانب سے غیر مجاز سلوک کے نئے واقعات دریافت ہوئے، Reuters لکھتی ہے۔ سائبر سیکیورٹی کے ایک سیریز سیمولیشنز کے دوران، ایجینٹس نے جعلی آن لائن شناختیں بنائیں، قائم پابندیوں کو دور کرنے کی کوشش کی، اور اپنے مقررہ کاموں کے دائرہ کار سے باہر دیگر اقدامات کئے۔
یہ واقعات حالیہ طور پر GPT-5.6 AI ایجنٹ کے ذریعے Hugging Face کے انفرااسٹرکچر پر حملے کے دوران پیش آئے۔ مزید تفصیلات مقالے میں:
AISI کے مطابق، اس تنظیم نے ان کی صلاحیتوں کا جائزہ لینے کے لیے Anthropic کے Mythos 5 ماڈل اور OpenAI کے GPT-5.6-Sol پر مبنی ایجینٹس کا ٹیسٹ ایک فictional سائبر سیکیورٹی سیناریو میں کیا۔
122 ٹیسٹ رنز کے دوران، محققین نے 10 ٹرائلز میں 19 غیر اجازت دی گئی کارروائیاں درج کیں۔ ان میں سے 17 کو Anthropic کے ایجینٹ پر عائد کیا گیا، اور دو کو OpenAI کے ایجینٹ پر۔
"ایس آئی ایس نے کہا کہ جانچ کے دوران کچھ ایجینٹس نے حقیقی افراد اور تنظیموں کے خلاف مستقل، ممکنہ طور پر نقصان دہ سرگرمیاں کیں۔"
اسی دوران، ادارے نے زور دیا کہ ریکارڈ کیے گئے کسی بھی معاملے سے حقیقی دنیا میں نقصان نہیں ہوا۔
ایجنسٹوں میں سے ایک نے جعلی شناختیں بنائیں
سب سے زیادہ سنگین واقعہ ایک ایجنٹ کا تھا جس نے مضر کوڈ لکھا اور ایک شخص کو اس کی اجراء کی اجازت دینے کے لیے جعلی آن لائن اکاؤنٹس بنائے۔
ایس آئی ایس نے یہ نہیں بتایا کہ ان اقدامات کے لیے کون سا خاص ماڈل ذمہ دار تھا، لیکن اینتھرپک نے تصدیق کی کہ اس میں اس کا ایجینٹ شامل تھا۔
کمپنی نے کہا:
ہم برطانیہ کے AISI کے اس واقعے پر قیادت کے لیے ان کا شکریہ ادا کرتے ہیں، جو اس بات کی ضرورت پر زور دیتا ہے کہ زیادہ صلاحیت والے AI ایجنٹس کا محفوظ طریقے سے جائزہ لینے کے لیے ایک وسیع بات چیت کی ضرورت ہے.“
انٹروپک نے کہا کہ وہ ادارے کے ساتھ مل کر مزید تفصیلات حاصل کرنے اور اپنا تفتیش کر رہا ہے۔
نافربنیادی تنظیم CivAI کے محقق اینڈریو یون نے کہا کہ یہ واقعہ فکر کا سبب ہے۔
یہ حقیقت کہ مائتھوس نے ایسے دھوکہ دہی والے اقدامات کیے، جبکہ ظاہر ہے کہ وہ جانتا تھا کہ وہ ایک اصل شخص کو ٹارگٹ کر رہا ہے، یہ ظاہر کرتی ہے کہ اینتھروپک کے مدلز پر ان کا قابو ان کی سوچ کے مطابق اتنی اچھا نہیں ہے۔
اوپن اے آئی نے ایک الگ واقعہ کی اطلاع دی
اوپن اے آئی نے واضح کیا کہ اس کے ایجینٹ کی دونوں غیر اختیاری کارروائیاں ٹیسٹ سیناریو کی شرائط کے خلاف انٹرنیٹ تک رسائی سے منسلک تھیں۔
کمپنی نے ایک الگ معاملہ بھی کھول دیا جس میں، ایک تھرڈ پارٹی فراہم کنندہ، ایرریگولر کی طرف سے کنفیگریشن کی غلطی کی وجہ سے، اس کے ایجنسٹس نے غلطی سے نیٹ ورک تک رسائی حاصل کر لی۔ اینتھرپک نے بھی پچھلے ہفتے ایک مشابہ خرابی کا توصیف کیا۔
اوپن اے آئی نے کہا:
“ہم صنعت بھر میں کام کرنے کے لیے متعهد ہیں تاکہ اعلی خطرہ والے جائزے کو محفوظ طریقے سے انجام دینے کے لیے مشترکہ طریقہ کار کو مضبوط بنایا جا سکے، جس میں آنے والے ہفتے قومی AI اداروں، مستقل جائزہ کاروں، دیگر AI لیبز اور دیگر گروہوں جیسے دلچسپی رکھنے والوں کو مجموعی طور پر بُلایا جائے گا.“
اسی دوران، AISI نے زور دیا کہ یہ واقعات جولائی کے بریچ سے مختلف ہیں، جس میں GPT-5.6 ایجنٹ نے Hugging Face کی ٹیسٹنگ انفراسٹرکچر تک رسائی حاصل کی تھی۔ جبکہ اس وقت ماڈل نے ایک علیحدہ ماحول سے مؤثر طریقے سے بھاگ نکلنا تھا، موجودہ ٹرائلز کے دوران، ایجنٹس کو انٹرنیٹ تک رسائی ادارے کی معیاری ٹیسٹنگ طریقہ کار کے مطابق دستیاب تھی۔
یاد دہانی کے لیے، ہگنگ فیس کے واقعہ کے بعد، OpenAI نے اپنی داخلی تحقیق کو توسیع دی اور خودمختار ایجینٹس کی طرف سے مزید غیر کنٹرولڈ رویوں کی شناخت کی۔
پیغام برطانوی محققین نے OpenAI اور Anthropic AI ایجینٹس کے ٹیسٹنگ کے دوران نئے خلاف ورزیوں کا پتہ لگایا پہلے INCRYPTED پر ظاہر ہوئے۔


