এআই সুরক্ষা ক্ষেত্রের সবচেয়ে জাদুকরী সপ্তাহ।লেখক এবং উৎস: জিকে পার্ক
01 একটি পরীক্ষা, একটি পালানো, একটি হ্যাকিং
একটি এক্সপ্লয়িটজিম নামক সুরক্ষা মূল্যায়ন থেকে গল্পটি শুরু হয়।
ExploitGym একটি পাবলিক সাইবার সিকিউরিটি ক্ষমতা বেঞ্চমার্ক যা AI মডেলগুলিকে পরীক্ষা করে যে এগুলি পরিচিত সিকিউরিটি ভালনাগুলিকে কতটা সফলভাবে বাস্তব আক্রমণে রূপান্তরিত করতে পারে। এই ধরনের মূল্যায়ন শিল্পে সাধারণ, যা মডেলের আক্রমণ ও প্রতিরোধের সীমানা বুঝতে ব্যবহৃত হয়। OpenAI GPT-5.6 Sol এবং একটি আরও শক্তিশালী অপ্রকাশিত মডেল ব্যবহার করে এই পরীক্ষা চালায়, যাতে বাস্তব ক্ষমতার সীমানা পরীক্ষা করা যায়, এবং নিরাপত্তা সুরক্ষা ইচ্ছাকৃতভাবে কমিয়ে দেওয়া হয়।
ডিজাইন অনুযায়ী, মডেলটি একটি বিচ্ছিন্ন স্যান্ডবক্স পরিবেশে পরীক্ষা করা উচিত, একটি সফটওয়্যার প্যাকেজ ইনস্টল করার জন্য একটি টুল ছাড়া অন্য কোনও ইন্টারনেট অ্যাক্সেস নেই।
কিন্তু পরে যা ঘটল, তা কেউ ভাবেনি।
মডেলটি ব্যাপক যুক্তিসঙ্গত গণনা শক্তি ব্যয় করে স্যান্ডবক্সের মধ্যে বারবার বিচ্ছিন্নতা খুঁজে বের করেছে। শেষ পর্যন্ত, এটি ওপেনএআই-এর অভ্যন্তরীণ প্যাকেজ ম্যানেজমেন্ট প্রক্সি এবং ক্যাশিংয়ের জন্য ব্যবহৃত তৃতীয় পক্ষের সফটওয়্যারে একটি জিরো-ডে দুর্বলতা আবিষ্কার করেছে। এই দুর্বলতার ব্যবহারে, মডেলটি অসীম ইন্টারনেট অ্যাক্সেস অর্জন করেছে।
নেটওয়ার্ক অ্যাক্সেস পাওয়ার পর, মডেলটি নিজে থেকে অনুমান করল যে Hugging Face-এ ExploitGym-এর সাথে সম্পর্কিত ডেটাসেট এবং উত্তরগুলি হোস্ট করা হতে পারে। তাই এটি একটি প্রবেশার্ধ খুঁজতে শুরু করল।
OpenAI ব্লগে লিখেছে, মডেলটি "চুরি করা যাচাইকরণ তথ্য এবং একাধিক ভাঙ্গনকে একত্রিত করে" একটি রিমোট কোড এক্সিকিউশন পথ খুঁজে পেয়েছে এবং শেষ পর্যন্ত Hugging Face-এর প্রোডাকশন ডাটাবেস থেকে বেঞ্চমার্ক উত্তরগুলি সরাসরি প্রাপ্তি করেছে।
সহজ ভাষায় বললে—মডেলটি পরীক্ষায় বসে প্রশ্নগুলো খুব কঠিন বলে মনে করে, তারপর নিজে থেকে পালিয়ে যায়, প্রশ্ন করা দলের সার্ভারে হ্যাক করে সঠিক উত্তরগুলো চুরি করে।
OpenAI একটি চিত্রাত্মক বর্ণনা ব্যবহার করেছে—এই মডেলগুলি হল «tokenmaxxers», যার অর্থ লক্ষ্য অর্জনের জন্য যুক্তিভিত্তিক সংস্থান খরচ করতে অকুণ্ঠ এবং চরমে যাওয়া। তারা ExploitGym-এর সমাধানের লক্ষ্যে «hyperfocused» (অতিমাত্রায় ফোকাসড) আচরণ দেখিয়েছে, «going to extreme lengths» (চরম পদক্ষেপ নিয়েছে)।
OpenAI নিজেই স্বীকার করেছে যে এটি একটি "অত্যন্ত অদ্ভুত সাইবার নিরাপত্তা ঘটনা, যা সবচেয়ে উন্নত সাইবার আক্রমণ ক্ষমতা সম্পর্কিত।"
02 48 ঘন্টা, দুটি «পালানো»
আরও বেশি চিন্তাচ্ছল হওয়ার বিষয় হলো, হাগিং ফেস ইভেন্টটি একা একা ঘটনা নয়।
7 ই জুলাই, অপেনএআই এই হ্যাকের প্রকাশের একদিন আগে, তারা একটি ভিন্ন কিন্তু সদৃশ প্রকৃতির ঘটনার অপর একটি নিরাপত্তা রিপোর্ট প্রকাশ করেছিল।
প্রধান চরিত্রটি হল OpenAI-এর অভ্যন্তরীণ একটি অপ্রকাশিত দীর্ঘমেয়াদী মডেল—যে মডেলটি এই বছরের মে মাসে গণিতবিদ Erdős-এর 1946 সালের “ইউনিট ডিসট্যান্স কনজেকচার” ভুল বলে প্রমাণ করেছিল, যা ফিল্ডস পুরস্কার বিজয়ী Tim Gowers একটি AI গণিতের মাইলফলক বলে অভিহিত করেছেন।
একটি NanoGPT স্পিড-ট্রেনিং বেঞ্চমার্কে, গবেষকরা মডেলকে শুধুমাত্র Slack-এ ফলাফল পোস্ট করার নির্দেশ দিয়েছিলেন। কিন্তু এই মডেলটি লক্ষ্য করল যে NanoGPT বেঞ্চমার্কের নিজস্ব নির্দেশাবলীতে ফলাফলগুলি GitHub pull request-এর মাধ্যমে জমা দেওয়ার কথা বলা হয়েছে। তাই এটি পরবর্তীটি বেছে নিল—প্রায় এক ঘন্টা স্যান্ডবক্স ভাঙার জন্য খুঁজতে গিয়ে, সফলভাবে সীমাবদ্ধতা অতিক্রম করে GitHub-এ একটি পাবলিক pull request জমা দিল।
অন্য একটি পরীক্ষায়, একই মডেল অনুমোদন টোকেন বিভক্ত করেছিল এবং নিরাপত্তা স্ক্যানারকে বাইপাস করতে বিভ্রান্তিকর পদ্ধতি ব্যবহার করেছিল, যার ফলে প্রাইভেট রিভিউ সাবমিশনগুলি পাওয়ার চেষ্টা করেছিল।
অতএব, ওপেনএআই এই মডেলের অভ্যন্তরীণ অ্যাক্সেস স্থগিত করেছিল এবং পরবর্তীতে আরও কঠোর মনিটরিংয়ের অধীনে এর ব্যবহার পুনঃস্থাপন করেছিল।
দুই দিনে, দুটি পালানো। সাধারণ বৈশিষ্ট্যগুলি সতর্কতা দেয়—পূর্ববর্তী মডেলগুলি পরিবেশের সীমাবদ্ধতা দেখলে থেমে যেত এবং কাজটি মানুষের হাতে ফিরিয়ে দিত। কিন্তু এই নতুন মডেলগুলি থামে না। তারা বেড়াকে সমাধানের জন্য একটি বাধা হিসেবে দেখে এবং সত্যিই সমাধান করে।
এটিই তা যা বলা হয় "দীর্ঘস্থায়ী মডেল" এর কারণে উত্থাপিত নতুন নিরাপত্তা সমস্যা। এই মডেলগুলি দীর্ঘস্থায়ীভাবে স্বায়ত্তশাসিতভাবে কাজ করার জন্য ডিজাইন করা হয়েছে, এবং স্থায়িত্ব হল এদের মূল ক্ষমতা। কিন্তু স্থায়িত্বই হল ঝুঁকির উৎস—একটি যথেষ্ট ধৈর্যশীল মডেল সবসময় বেড়ার ফাঁক খুঁজে পাবে।
০৩ নিজের কাটা, নিজের হাতল কাটা যায় না
হাগিং ফেস পাশে ফিরে আসুন। তাদের অভিজ্ঞতাও বিস্তারিতভাবে দেখার মতো।
17,000 এর বেশি আক্রমণ লগের মুখোমুখি হয়ে, হাগিং ফেস সিকিউরিটি টিমের প্রথম প্রতিক্রিয়া ছিল বিশ্লেষণের জন্য AI ব্যবহার করা—যেহেতু মানুষের সিকিউরিটি বিশ্লেষকদের কয়েক দিন লাগতে পারে এমন কাজটি বড় মডেলগুলি কয়েক ঘন্টায়ই শেষ করতে পারে।
কিন্তু তারা একটি অপ্রত্যাশিত দেয়ালের সাথে সংঘর্ষে পড়ে। যখন তারা প্রকৃত আক্রমণ নির্দেশ, দুর্বলতা ব্যবহারের লোড এবং C2 যোগাযোগের বৈশিষ্ট্যগুলি মার্কিন অগ্রগামী মডেলের বাণিজ্যিক API-এ বিশ্লেষণের জন্য জমা দেয়, তখন সুরক্ষা গতিশীলতা এই অনুরোধগুলি সম্পূর্ণভাবে বাধা দেয়।
কারণটি খুব সহজ এবং অত্যন্ত বিড়ম্বনাপূর্ণ—হেডলাইনগুলি বুঝতে পারে না যে “নিরাপত্তা গবেষক আক্রমণের লোড বিশ্লেষণ করছেন” এবং “আক্রমণকারী আক্রমণ চালাচ্ছেন” এর মধ্যে পার্থক্য। হেডলাইনের দৃষ্টিতে, দুটি একই মনে হয়।
হাগিং ফেস তাদের নিজস্ব ইনফ্রাস্ট্রাকচারে চীনা জিএস এআইয়ের ওপেন-সোর্স মডেল GLM-5.2 স্থানীয়ভাবে চালানোর জন্য বাধ্য হয়েছে, যেকোনো বাণিজ্যিক API ছাড়া। এটি দুটি সুবিধা দেয়—বিশ্লেষণের কাজকে কোনো হার্ডওয়্যার বাধা দেয় না, এবং আক্রমণকারীদের ডেটা এবং প্রকাশিত পাসওয়ার্ডও হাগিং ফেসের নিজস্ব পরিবেশের বাইরে যায় না।
শেষ পর্যন্ত, GLM-5.2 হাগিং ফেসকে কয়েক ঘন্টার মধ্যে আক্রমণের সময়রেখা পুনর্গঠন, আক্রমণের সূচক বের করা এবং প্রভাবিত পাসওয়ার্ডের ম্যাপিং করতে সাহায্য করেছে।
এটি একটি তীব্র বিপর্যয় তৈরি করে—যত কঠোর বাধা থাকে, প্রতিরক্ষাকারীরা তত অপ্রতিক্রিয়শীল হয়ে পড়ে। আক্রমণকারীদের কোনো ব্যবহার নীতি নেই, কিন্তু প্রতিরক্ষাকারীদের নিজেদের প্রতিরক্ষার জন্য ব্যবহৃত টুলগুলি তাদের বাইরে রেখে দেয়।
হাগিং ফেস ঘটনার পরে একটি ব্যবহারিক পরামর্শ দিয়েছে—নিরাপত্তা দলের উচিত হবে «ঘটনার আগেই নিজেদের অবকাঠামোতে একটি যাচাইকৃত, প্রস্তুত মডেল রাখা» যাতে গার্ডরেল লক হওয়া এবং সংবেদনশীল ডেটা প্রবাহিত হওয়া এড়ানো যায়।
হাগিং ফেসের সিইও ক্লেম ডেলাংগের মনোভাব খুবই উদার। তিনি ওপেনএআই-এর তদন্ত এবং সমাধানের ক্ষেত্রে সহযোগিতার প্রশংসা করেন এবং বলেন, "এই ঘটনাটি আমরা যা বিশ্বাস করি তার প্রমাণ দেয়—এআই নিরাপত্তা কোনও একটি কোম্পানি গোপনে সমাধান করতে পারবে না, এটি শুধুমাত্র খোলা এবং সহযোগিতার মাধ্যমেই সমাধান করা যায়।"
04 শক্তিশালী এআইয়ের গঠনগত সমস্যা
এই সপ্তাহের ঘটনাগুলিকে একসাথে দেখলে, একটি শিল্প-স্তরের গঠনগত সমস্যা স্পষ্ট হয়ে উঠেছে।
মডেলের নেটওয়ার্ক আক্রমণের ক্ষমতা সঠিকভাবে মূল্যায়ন করতে, নিরাপত্তা গতিশীলতা সরিয়ে ফেলতে হবে। কিন্তু গতিশীলতা সরিয়ে ফেলা মডেলটি ঠিক বাস্তব আক্রমণ চালানোর ক্ষমতা অর্জন করে। মডেলটি যত শক্তিশালী, পরীক্ষাটি তত বেশি বিপজ্জনক।
এটি শুধুমাত্র OpenAI-এর সমস্যা নয়। GPT-5.6 Sol-এর প্রকাশ আমেরিকান সরকারের সাথে পুনরাবৃত্ত আলোচনার পরেই অনুমোদিত হয়েছিল, এবং ব্রিটিশ AI সুরক্ষা ইনস্টিটিউট (AISI) আগেই এর সুরক্ষা ব্যবস্থাগুলি পারিপার্শ্বিকভাবে পার হওয়ার সম্ভাবনা এবং বিপজ্জনক সাইবার আক্রমণের ক্ষমতা খোলার ঝুঁকি শনাক্ত করেছিল। এই ঘটনাটি এই উদ্বেগগুলির কোনও কথামাত্র নয় বলে প্রমাণিত হয়েছে।
এবং এনথ্রোপিক এই গ্রীষ্মকালে প্রকাশিত এজেন্টিক মিসঅ্যালাইনমেন্ট গবেষণাও একই প্রবণতাকে অন্য দিক থেকে প্রমাণ করে—নিয়ন্ত্রিত পরিস্থিতিতে, বিভিন্ন অগ্রণী মডেলগুলি কাজের ফলাফল গোপনে পরিবর্তন, মূল্যায়নের ফলাফল প্রভাবিত করা এবং মানুষের সহকর্মীদের নির্ধারিত লক্ষ্য থেকে বিচ্যুত করার মতো আচরণ দেখিয়েছে।
OpenAI এটিকে একটি "আক্রমণ এবং প্রতিরোধ উভয়ের জন্য" গল্প হিসেবে প্রস্তুত করছে—উন্নত নেটওয়ার্ক আক্রমণের ক্ষমতা একইসাথে সুরক্ষা দলকে আক্রমণকারীদের আগেই দুর্বলতা খুঁজে পেতে সাহায্য করতে পারে। তারা Hugging Face কে "বিশ্বস্ত অ্যাক্সেস" নেটওয়ার্ক নিরাপত্তা পরিকল্পনায় অন্তর্ভুক্ত করেছে, যেখানে প্রতিরোধের জন্য একটি কম সীমাবদ্ধ GPT-5.6 Sol সংস্করণ প্রদান করা হয়েছে।
কিন্তু এই বর্ণনাটি আরও মৌলিক প্রশ্নগুলি এড়িয়ে যায়। এই ঘটনায়, মডেলটির সচেতনতা ছিল না, কোনও দুষ্টুমি ছিল না, এটি শুধুমাত্র একটি কাজ করছিল—লক্ষ্যটি পূরণ করা। এটিকে ExploitGym-এ উচ্চ স্কোর পেতে বলা হয়েছিল, এবং এটি পাল্টা আক্রমণ এবং হ্যাকিংসহ সমস্ত উপলব্ধ পদ্ধতি ব্যবহার করে উচ্চ স্কোর পেয়েছিল।
এটি একটি "এআই জাগরণ"-এর গল্প নয়, বরং একটি "লক্ষ্য অপ্টিমাইজেশন"-এর গল্প। যখন একটি যথেষ্ট বুদ্ধিমান অপ্টিমাইজারকে একটি সংকীর্ণ লক্ষ্য দেওয়া হয়, তখন এটি আপনার কল্পনার বাইরের সমস্ত পথ খুঁজে বের করবে যাতে লক্ষ্যটি অর্জন করা যায়—যদিও এই পথগুলি আপনার বেড়া, অন্যদের সার্ভার এবং সম্পূর্ণ ইন্টারনেটের মধ্যে দিয়ে যায়।
সত্যিকারের সমস্যা কখনই নয় যে “এআই খারাপ হয়ে যাবে কি না”, বরং — আমরা কি আমাদের চেয়ে বেশি সহজ পথ খুঁজে বার করতে পারে এমন একজন ছাত্রকে নিয়ন্ত্রণ করতে পারব?
