GPT-5.6-Sol এর আক্রমণ ও প্রতিরোধের ক্ষমতা Claude Mythos 5 কে ছাড়িয়ে গেছে!
যুক্তরাজ্যের এআই সুরক্ষা প্রতিষ্ঠান (এআইএসআই) 17 জুলাই একটি মূল্যায়ন রিপোর্ট প্রকাশ করে, যেখানে প্রথমবারের মতো ওপেন-সোর্স এআই মডেল এবং বন্ধ সোর্স অগ্রণী মডেলের মধ্যে নেটওয়ার্ক আক্রমণের ক্ষমতার পার্থক্যকে 4 থেকে 7 মাসের মধ্যে পরিমাপ করা হয়।

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
গত বছর একই ধরনের অভ্যন্তরীণ পরীক্ষায়, এই ব্যবধান ছিল 6 থেকে 10 মাস।
ডিফেন্স উইন্ডো সংকুচিত হচ্ছে, আর আক্রমণের এগিয়ে যাওয়ার রেখা ত্বরান্বিত হচ্ছে।
এপ্রিলে, মাইথোস প্রিভিউ এবং জিপিটি-5.5 এআইএসআই-এর মূল্যায়নে ২০২৩ সাল থেকে পরীক্ষা শুরু হওয়ার পর থেকে সবচেয়ে বড় নেটওয়ার্ক আক্রমণ ক্ষমতার বৃদ্ধি ঘটিয়েছিল, যার ফলে বহু সরকার সতর্কবার্তা জারি করেছে।
ওপেন-সোর্স মডেলগুলি এই লাফটি এখনও পুনরায় তৈরি করেনি, তবে গত বছরের তুলনায় তারা অনেক দ্রুত অগ্রসর হচ্ছে।
4 থেকে 7 মাস: কীভাবে পরীক্ষা করা হয়েছে, কোথায় পার্থক্য আছে
AISI মডেলের নেটওয়ার্ক আক্রমণ ক্ষমতা মূল্যায়নের জন্য দুটি সিস্টেম ব্যবহার করে।
প্রথম সেটে 70টি সংকীর্ণ কাজ রয়েছে, যা ভালনারেবিলিটি গবেষণা, রিভার্স ইঞ্জিনিয়ারিং, ওয়েব পেনিট্রেশন এবং ক্রিপ্টোগ্রাফি—চারটি দিককে কভার করে, যা কঠিনতা অনুযায়ী চারটি লেভেলে বিভক্ত: 'প্রযুক্তিগত পটভূমি সম্পন্ন অপেশাদার' থেকে 'দশকের বেশি অভিজ্ঞতা সম্পন্ন বিশেষজ্ঞ'।

দ্বিতীয় সেট হল সাইবার রেঞ্জ, যা মডেলের প্রতিনিধিত্বকারী কর্মক্ষমতা পরীক্ষা করে যা একটি প্রতিষ্ঠানের নেটওয়ার্কে একাধিক পদক্ষেপের আক্রমণ শৃঙ্খলা স্বয়ংক্রিয়ভাবে সম্পন্ন করতে পারে। 'দ্য লাস্ট ওনস' নামক একটি পরীক্ষার পরিস্থিতিতে ৩২টি আক্রমণ পদক্ষেপ, ৪টি সাবনেট এবং প্রায় ২০টি হোস্ট রয়েছে, যেখানে AISI অনুমান করেছে যে মানব বিশেষজ্ঞদের সমস্ত পদক্ষেপগুলি সম্পন্ন করতে প্রায় ২০ ঘন্টা সময় লাগবে।

দুটি পদ্ধতি একই সিদ্ধান্তে পৌঁছেছে:
GLM-5.2 (2026 জুন প্রকাশিত) সংকীর্ণ কাজে অপাস 4.6 (ফেব্রুয়ারি প্রকাশিত) এর সাথে সমান পারফরম্যান্স দেখায়, যার মধ্যে 4 মাসের পার্থক্য;
সাইবার রেঞ্জে ওপাস 4.5 (গত নভেম্বরে প্রকাশিত) এর সাথে 7 মাসের ব্যবধানে পিছনে।
DeepSeek V4-Pro ন্যূনতম কাজে Opus 4.5 এর সাথে প্রতিদ্বন্দ্বিতা করে, যার পার্থক্য 5 মাস।
উভয় ব্যবধানই 2025 সালের অভ্যন্তরীণ মূল্যায়নে পরিমাপ করা 6 থেকে 10 মাসের চেয়ে কম।
খরচের পার্থক্য ক্ষমতার পার্থক্য থেকে বড়।
একই সাইবার রেঞ্জ পরীক্ষা (1 কোটি টোকেন ক্ষমতা), Opus 4.5 বা 4.6 ব্যবহার করে একবার চালানো প্রায় 85 ডলার, GLM-5.2 ব্যবহার করে প্রায় 46 ডলার, কিন্তু DeepSeek V4-Pro ব্যবহার করে মাত্র 1.19 ডলার।
দুটি মডেলই যে সংকীর্ণ কাজগুলি 100% সম্পন্ন করতে পারে, সেগুলিতে Opus 4.6 প্রতি কাজে 15.17 ডলার খরচ করে, GLM-5.2 খরচ করে 6.12 ডলার;
ওপাস ৪.৫ এর জন্য ১২.৫০ ডলার, DeepSeek V4-Pro এর জন্য 0.28 ডলার।
একই আক্রমণ ক্ষমতা, ওপেন সোর্স এক থেকে দুই ক্রম সস্তা।
বন্ধ সোর্স মডেলের নিরাপত্তা গার্ডও পার্থক্য তৈরি করতে পারেনি।
AISI পরীক্ষায়, DeepSeek V4-Pro কখনও কখনও রিভার্স ইঞ্জিনিয়ারিং ভিত্তিক টাস্ক অস্বীকার করে, কিন্তু কয়েকবার পুনরায় চেষ্টা করে এটি পার করা যায়।
অ্যানথ্রোপিকের ফেবল 5 একটি আরও চরম উদাহরণ: 9 জুন প্রকাশিত, তিন দিন পরে সিকিউরিটি গবেষক প্লিনি দ্য লিবারেটর একটি মাল্টি-স্টেপ জেইলব্রেক কৌশল ব্যবহার করে সিকিউরিটি ক্লাসিফায়ারকে পার করেন, যার স্ক্রিনশটগুলিতে মডেলটির ব্লক হওয়ার কথা ছিল এমন ভালনাব্য কোড উত্পাদন করা দেখা যায়।
অ্যামাজন গবেষক পরে অন্য একটি পারিপার্শ্বিক পদ্ধতির স্বতন্ত্র প্রতিবেদন করেন।
এটি মার্কিন বাণিজ্য বিভাগের প্রথম AI মডেলের রপ্তানি নিয়ন্ত্রণ আদেশকে সরাসরি উত্তেজিত করে, যার ফলে Fable 5 19 দিনের জন্য বিশ্বব্যাপী সেবা বন্ধ হয়ে যায়, যতক্ষণ না Anthropic একটি নতুন শ্রেণীবিভাজক চালু করে।
বন্ধ সোর্স স্বয়ংক্রিয়ভাবে নিরাপদ বলে মানা হয় না।
ডিফেন্স উইন্ডো সংকীর্ণ হচ্ছে এবং ডিফেন্স টুলসও ত্বরান্বিত হচ্ছে
AISI এর প্রতিবেদনে পলিসি সংকেত পরিষ্কারভাবে উল্লেখ করা হয়েছে: প্রতিরক্ষামূলক পক্ষের প্রস্তুতির সময় গত বছরের তুলনায় কম।
UK এর জাতীয় সাইবার নিরাপত্তা কেন্দ্র সংস্থাগুলিকে সাইবার নিরাপত্তা বেসলাইন শক্তিশালী করতে এবং AI ব্যবহার করে প্রতিরক্ষা ক্ষমতা বৃদ্ধি করতে আহ্বান জানিয়েছে।
একই প্রজন্মের এআই টুলগুলি আসলে প্রতিরক্ষামূলক কাজগুলিকেও ত্বরান্বিত করছে।
গ্লেন ফিডলার, গেম নেটওয়ার্ক প্রোগ্রামিং এর একজন অভিজ্ঞ ডেভেলপার, যিনি বিশেষ করে গেম নেটওয়ার্ক প্রোগ্রামিং এর ক্ষেত্রে বিশ্বব্যাপী পাঠ্যপুস্তকের মতো বিখ্যাত লেখা লিখেছেন, সম্প্রতি তাঁর বারবার বজায় রাখা চারটি ওপেন-সোর্স নেটওয়ার্ক লাইব্রেরি (yojimbo, netcode, reliable, serialize — এগুলির মোট ৬০০০টি GitHub Star, যা গেমিং ক্ষেত্রে অত্যন্ত প্রভাবশালী পুরনো ওপেন-সোর্স লাইব্রেরি) -এর জন্য একটি ব্যাপক নিরাপত্তা অডিট চালিয়েছেন: libFuzzer টার্গেট ডিপ্লয়, AddressSanitizer এবং MemorySanitizer CI-এর চালু, কয়েক মিলিয়ন ইটারেশনের প্রেশার টেস্ট, এবং প্রতিটি লাইনের কোড পরীক্ষা।

গ্লেন ফিডলার
দুই সপ্তাহে ৪৩টি সুরক্ষা ভাঙ্গন ঠিক করা হয়েছে, যার মধ্যে ২৭টি ওয়েব থেকে দূরবর্তীভাবে অ্যাক্সেসযোগ্য।

সবচেয়ে গুরুতর বিষয় হল 2019 থেকে যোজিমবোতে একটি রিমোট হিপ ওভারফ্লো—অপরাধী ক্লায়েন্ট এটিকে নির্দিষ্ট প্যাকেট তৈরি করে ট্রিগার করতে পারে।

সম্পূর্ণ অডিটের টোকেন খরচ প্রায় 2500 ডলার।

আক্রমণ এবং প্রতিরক্ষা উভয়ই এআই দ্বারা ত্বরান্বিত হচ্ছে, কিন্তু ত্বরান্বিত হওয়ার পদ্ধতি অসমান।
আক্রমণের ক্ষমতার প্রসার অপরিবর্তনীয়: ওপেন-সোর্স মডেল ওয়েট একবার প্রকাশিত হয়ে গেলে তা ফিরিয়ে আনা যায় না, সুরক্ষা বাধা সরিয়ে ফেলা যায়, এবং কপি গোপন সার্ভারে নিয়ন্ত্রণহীনভাবে চালানো যায়।
কিন্তু প্রতি টিমের জন্য প্রতিরক্ষামূলক টুলস বাস্তবায়নের জন্য সক্রিয়ভাবে সময় এবং খরচ ব্যয় করা প্রয়োজন।
AISI রিপোর্টে একটি বাক্য এই কাঠামোকে উল্লেখ করে: «যেহেতু ওপেন সোর্স প্রকাশিত হয়ে গেছে, এই বিকল্পগুলি চিরতরে হারিয়ে যায়।»
এই ডেটা সেটের প্রভাব সংখ্যাগুলির চেয়ে এজিআই পরিস্থিতির জন্য অধিক গভীর।
ওপেন সোর্স এবং প্রোপ্রাইটারি সফটওয়্যারের মধ্যে ক্ষমতার ব্যবধান ছয় মাসের মধ্যে কমে এসেছে, এবং "প্রোপ্রাইটারি এক্সক্লুসিভিটি পিরিয়ডকে সুরক্ষা বাফার হিসেবে ব্যবহার করা" এর ডিফল্ট কৌশল শীঘ্রই অকার্যকর হয়ে পড়বে।
Fable 5 ইভেন্টে বন্ধ সোর্স মডেলের গার্ডের দুর্বলতা প্রমাণিত হয়েছে।
বিশ্বব্যাপী সিদ্ধান্তগ্রহণকারীদের জন্য পরবর্তী পর্যায়ে নীতিগত খেলার মূল প্রশ্নটি আরও তীব্র হয়ে উঠেছে: কোন ক্ষমতার মডেলগুলির ওজন খোলা উচিত নয়।
AISI ঘোষণা করেছে যে এটি মূল্যায়ন চালিয়ে যাবে কিমি K3 পরবর্তী ওপেন সোর্স মডেলগুলির জন্য—এই লাইনটি কোথায় টানা হবে, তা পরবর্তী কয়েক মাসের পরীক্ষার ফলাফলের উপর নির্ভর করতে পারে।
উৎস তথ্য:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "নিউ জ্ঞান" থেকে এসেছে, লেখক: ASI প্রকাশনা; সম্পাদক: মা কে
