GPT-5.6-Sol سائبر سیکیورٹی کی صلاحیتوں میں Mythos سے بہتر کارکردگی دکھاتا ہے، اوپن سورس ماڈلز کا فرق کم ہو رہا ہے

icon MarsBit
بانٹیں
AI summary iconخلاصہ
AI اور کرپٹو کی خبریں 17 جولائی، 2026 کو برطانیہ کے AI سیفٹی انسٹی ٹیوٹ (AISI) کی جانب سے جاری کردہ رپورٹ کے ساتھ سامنے آئیں، جس میں GPT-5.6-Sol نے سائبر سیکیورٹی میں Claude Mythos 5 کو پار کر لیا۔ اب صلاحیت کا فرق 4 سے 7 ماہ ہے، جو 2025 میں 6 سے 10 ماہ تھا۔ GLM-5.2 اور DeepSeek V4-Pro جیسے اوپن سورس ماڈلز تیزی سے اس فرق کو کم کر رہے ہیں۔ جائزہ لینے کے لیے سائبر رینج سیمولیشن اور 70 کاموں کا استعمال کیا گیا۔ اوپن سورس ماڈلز اسی قسم کے کاموں کے لیے کم لاگت بھی فراہم کرتے ہیں۔ نیٹ ورک اپگریڈ کا رجحان واضح ہے۔

GPT-5.6-Sol کی حملہ اور دفاعی صلاحیتیں Claude Mythos 5 سے زیادہ ہیں!

برطانیہ کے AI سیکورٹی انسٹی ٹیوٹ (AISI) نے 17 جولائی کو ایک جائزہ رپورٹ جاری کی، جس میں پہلی بار کھلے ذرائع کے AI ماڈلز اور بند سرحد والے فرنتیر ماڈلز کے درمیان نیٹ ورک حملوں کی صلاحیت کے فرق کو مقداری طور پر ظاہر کیا گیا: 4 سے 7 ماہ۔

اوپن سورس ماڈل

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

گزشتہ سال اسی قسم کے اندر کے ٹیسٹ میں، یہ فرق 6 سے 10 ماہ تھا۔

دفاعی ونڈو کم ہو رہا ہے، جبکہ حملہ کا سامنا تیز ہو رہا ہے۔

اپریل 2024 میں، Mythos Preview اور GPT-5.5 نے AISI کے جائزے میں 2023 سے شروع ہونے والے ٹیسٹنگ کے بعد سب سے بڑی نیٹ ورک حملہ کی صلاحیت میں اضافہ کیا، جس کے بعد کئی ممالک کی حکومتوں نے انتباہ جاری کیا۔

اے او ای مڈل نے ابھی تک اس کوچ کی دہرائی نہیں کی ہے، لیکن ان کا تعاقب پچھلے سال کے مقابلے میں زیادہ تیز ہے۔

4 سے 7 ماہ: یہ کیسے ٹیسٹ کیا گیا، کہاں فرق ہے

AISI دو نظاموں کا استعمال کرتا ہے تاکہ ماڈل کی نیٹ ورک حملہ کرنے کی صلاحیت کا جائزہ لے۔

پہلا سیٹ 70 محدود کاموں پر مشتمل ہے جو خرابیوں کی تحقیق، ریورس انجینئرنگ، ویب پینیٹریشن اور کرپٹوگرافی کے چار شعبوں کو کور کرتا ہے، جو تین درجات میں تقسیم ہیں، "ٹیکنیکل باک گراؤنڈ والے غیر ماہرین" سے لے کر "دس سال سے زیادہ تجربہ والے ماہرین" تک۔

اوپن سورس ماڈل

دوسرا سیٹ سائبر رینج ہے، جو ماڈل کی صلاحیت کا امتحان کرتا ہے کہ وہ محاکمہ شدہ کاروباری نیٹ ورک میں متعدد مراحل کے حملوں کو خودکار طور پر انجام دے سکتا ہے۔ "The Last Ones" نامی ایک ٹیسٹ سیناریو میں 32 حملے کے مراحل، 4 سب نیٹ ورک، اور تقریباً 20 ہوسٹس شامل ہیں، جسے AISI کے مطابق ایک انسانی ماہر کو مکمل کرنے میں تقریباً 20 گھنٹے لگتے ہیں۔

اوپن سورس ماڈل

دو نظاموں نے ایک ہی نتیجہ دیا:

GLM-5.2 (جون 2026 میں جاری) نے تنگ کاموں پر Opus 4.6 (فروری میں جاری) کے برابر کارکردگی دکھائی، جس میں 4 ماہ کا فرق ہے؛

سائبر رینج پر آپس 4.5 (گزشتہ نومبر میں جاری) کے ساتھ 7 ماہ کے فرق کے ساتھ مساوی ہو گیا۔

DeepSeek V4-Pro نارو ٹاسک پر Opus 4.5 کے مقابلے میں 5 ماہ کا فرق رکھتا ہے۔

دونوں فاصلے 2025 کے اندر کے جائزے میں درج 6 سے 10 ماہ کے مقابلے میں زیادہ کم ہیں۔

کیمٹی کا فرق صلاحیت کے فرق سے زیادہ ہے۔

ایک ہی سائبر رینج ٹیسٹ (100 ملین ٹوکن کی سیمپل)، Opus 4.5 یا 4.6 کے ساتھ ایک بار چلانے کا خرچ تقریباً 85 امریکی ڈالر ہے، GLM-5.2 کے ساتھ تقریباً 46 امریکی ڈالر، جبکہ DeepSeek V4-Pro صرف 1.19 امریکی ڈالر ہے۔

دو ماڈلز جو 100% مکمل کر سکتے ہیں، اس تنگ کام پر Opus 4.6 ہر کام پر 15.17 امریکی ڈالر خرچ کرتا ہے، جبکہ GLM-5.2 6.12 امریکی ڈالر خرچ کرتا ہے؛

اپس 4.5 کے لیے 12.50 امریکی ڈالر، DeepSeek V4-Pro 0.28 امریکی ڈالر کا ہے۔

ایک جیسی حملہ کی صلاحیت، اوپن سورس ایک یا دو درجہ گنجائش سے سستا۔

بند ماڈل کے سیکیورٹی گارڈ بھی فرق نہیں بناسکے۔

AISI ٹیسٹ میں، DeepSeek V4-Pro کبھی کبھی ریورس انجینئرنگ کے طرز کے کاموں کو مسترد کر دیتا ہے، لیکن کچھ دہرائیوں سے اسے دور کیا جا سکتا ہے۔

اینٹروپک کا فیبل 5 ایک اور زیادہ شدید مثال ہے: 9 جون کو جاری کیا گیا، اور تین دن بعد سیکورٹی ریسرچر پلنی دی لبریٹر نے متعدد مراحل والی ڈیل کی حکمت عملی کے ذریعے سیکورٹی کلاسیفائر کو توڑ دیا، جس کے متعلقہ اسکرین شاٹس میں ماڈل کے ذریعہ ایسے کوڈ کی پیداوار دکھائی گئی جو روکے جانے کے قابل تھے۔

اسامن کے محققین نے بعد میں ایک اور بائی پاس طریقہ بھی رپورٹ کیا۔

یہ امریکی کمERC کی طرف سے AI ماڈل کے لیے جاری کیا جانے والا پہلا برآمد پابندی حکم تھا، جس کے نتیجے میں فیبل 5 19 دن کے لیے عالمی سطح پر بند ہو گیا، جب تک کہ اینتھروپک نے نیا طبقہ بندی کنٹرولر لاگو نہیں کر دیا۔

بند سورس کا مطلب یہ نہیں کہ وہ خودکار طور پر محفوظ ہے۔

دفاعی ونڈو کا سائز کم ہو رہا ہے اور دفاعی ٹولز بھی تیز ہو رہے ہیں

AISI نے رپورٹ میں پالیسی کے سگنل کو واضح کیا: دفاعی طرف کے لیے تیاری کا وقت گزشتہ سال کے مقابلے میں کم تھا۔

برطانیہ کا قومی سائبر سیکیورٹی سینٹر نے اداروں کو سائبر سیکیورٹی بنیادی معیار کو مضبوط بنانے اور دفاعی صلاحیتیں بڑھانے کے لیے AI کا استعمال کرنے کی ترغیب دی ہے۔

ایک ہی نسل کے AI ٹولز حقیقت میں دفاعی جانب کے کام کو بھی تیز کر رہے ہیں۔

گلن فیڈلر، جو گیمنگ نیٹ ورک پروگرامنگ کے شعبے میں ایک تجربہ کار ڈویلپر ہیں، نے اپنے چار اوپن سورس نیٹ ورک لائبریریز (yojimbo، netcode، reliable، serialize — جن کے مجموعی طور پر 6000 GitHub اسٹار ہیں اور گیمنگ شعبے میں کافی اثرانگیز قدیم اوپن سورس لائبریریز ہیں) کا نظاماتی سیکورٹی آڈٹ کیا: libFuzzer ٹارگٹس ڈپلوی کیے، AddressSanitizer اور MemorySanitizer CI کو لاگو کیا، ملاینوں تکراروں کے ساتھ پریشر ٹیسٹ کیے، اور ہر لائن کوڈ کا جائزہ لیا۔

اوپن سورس ماڈل

گلن فیڈلر

دو ہفتے میں 43 سیکورٹی خامیاں درست کر دی گئیں، جن میں سے 27 نیٹ ورک کے ذریعے ریموٹلی رسائی یافتہ ہیں۔

اوپن سورس ماڈل

سب سے زیادہ سنگین بات یہ ہے کہ yojimbo میں 2019 سے ایک ریموٹ ہیپ اوورفلو موجود ہے—بری بھیڑی کلائنٹ اسے مخصوص پیکٹس کے ذریعے ٹرگر کر سکتا ہے۔

اوپن سورس ماڈل

پورے آڈٹ کا ٹوکن لاگت تقریباً 2500 ڈالر ہے۔

اوپن سورس ماڈل

حملہ اور دفاع دونوں AI کے ذریعے تیز ہو رہے ہیں، لیکن تیزی کا طریقہ عدم توازن رکھتا ہے۔

حملہ کرنے کی صلاحیت کا پھیلاؤ غیر قابلِ واپسی ہے: اوپن سورس ماڈل وزن جب بھی جاری ہو جائیں، انہیں واپس نہیں لیا جا سکتا، سیکورٹی گارڈز کو ہٹایا جا سکتا ہے، اور نقلیں نجی سرورز پر بے رصد چلائی جا سکتی ہیں۔

لیکن دفاعی ٹولز کی لاگو کاری کے لیے ہر ٹیم کو فعال طور پر وقت اور لاگت کا اہتمام کرنا ہوگا۔

AISI رپورٹ میں ایک جملہ یہ ساخت کو واضح کرتا ہے: "جیسے ہی اوپن سورس جاری ہو جائے، یہ اختیارات ہمیشہ کے لیے ختم ہو جائیں گے۔"

اس ڈیٹا سیٹ کا AGI کے منظر پر اعداد و شمار سے زیادہ گہرا اثر ہے۔

اوپن سورس اور بند سورس کے درمیان صلاحیت کا فرق نصف سال سے کم ہو گیا ہے، "بند سورس کے منفرد دور کو سیکورٹی بفر کے طور پر استعمال کرنا" کی ڈیفالٹ حکمت عملی تقریباً ختم ہو رہی ہے۔

فیبل 5 واقعہ میں بند ماڈل کے گارڈریلز بھی کمزور ثابت ہوئے۔

اگلے مرحلے میں عالمی فیصلہ سازوں کے لیے پالیسی کے کھیل کا مرکزی سوال مزید تیز ہو گیا ہے: کس سطح کے ماڈل سے زیادہ کے وزن کو کبھی بھی کھولا نہیں جانا چاہیے۔

AISI نے اعلان کیا ہے کہ وہ جاری رکھیں گیں评估 کیمی K3 اگلی ایمیٹیو ماڈل کا انتظار کر رہا ہے — اس لائن کو کہاں کھینچا جائے گا، اگلے کچھ ماہ کے ٹیسٹ نتائج پر منحصر ہوگا۔

حوالہ جات:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

یہ مضمون ویچن گروپ "نیوزی یوآن" سے ہے، مصنف: ASI وحی؛ ایڈیٹر: مارکو

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔