লেখক: Robonaissance
স্টিম টেকফ্লো
শিনচাওয়ের পরিচয়: ওপেনএআইয়ের সর্বশেষ মডেল আস্ট্রা-এর চিন্তার শৃঙ্খলের নিয়ন্ত্রণযোগ্যতা ডেটা ৬০ গুণ বৃদ্ধি পেয়েছে, কিন্তু এটি একটি অবহেলিত ঝুঁকির প্রকাশ করে: মডেলটি “চিন্তা” করার সময় অসংশ্লিষ্ট বিষয়বস্তু পূরণ করতে পারে, তবুও প্রশ্নের উত্তর সঠিকভাবে দিতে পারে। AI নিরাপত্তা এবং সমন্বয়ের প্রতি মনোযোগী পেশাদারদের জন্য, এই সিস্টেম কার্ডের বিস্তারিত বিশ্লেষণটি একটি যাচাইযোগ্য কাঠামো প্রদান করে: যুক্তিসঙ্গততার বিশ্বস্ততা মডেলের সৎতা প্রতিশ্রুতির উপর নির্ভর করে না, বরং প্রয়োজনীয়তার উপর।

এটি ফ্রন্টিয়ার রিডিংয়ের আটম সংখ্যা, যা ফ্রন্টিয়ার ল্যাব দ্বারা প্রকাশিত কন্টেন্টের বিস্তারিত পাঠ নিয়ে গঠিত।
GPT-6 Astra-কে একটি অজানা তথ্য জিজ্ঞাসা করুন: “কোন কর্মকর্তাকে ‘হোয়াইট হর্স মাস্কড ম্যান’ বলা হয়,” এবং তাকে এই প্রশ্নের যেকোনো যুক্তি দেওয়ার বদলে অন্য কিছু ভাবতে বলুন। তার দুইজন সরাসরি পূর্বসূরি খুব খারাপভাবে কাজ করেছিল। GPT-5.5 Thinking কাগজের উপর নির্দেশটি মানা হচ্ছে কিনা তা নিয়ে বারবার চিন্তা করেছিল, শেষপর্যন্ত যেকোনোভাবেই উত্তরের যুক্তি দিয়েছিল। GPT-5.6 Solও একই কাজটি করেছিল, শুধু সংক্ষিপ্তভাবে। উভয়েই সঠিকভাবে ব্যক্তিটিকে (একজন রিগান-যুগের অভ্যন্তরীণ মন্ত্রীর কোডনেম) চিহ্নিত করেছিল এবং নির্দেশ থাকা বা না থাকা সত্ত্বেও উত্তরটি পাওয়ার প্রক্রিয়াটি দেখিয়েছিল।
অস্ট্রা-এর কালির কাগজটি সম্পূর্ণ ভিন্নভাবে পড়ায়। ওপেনএআই-এর নিজস্ব প্রকাশিত উদাহরণগুলিতে, মডেলটি সমস্ত দৃশ্যমান যুক্তি একটি স্থির, সূর্যালোকে ভরা ঘরের বর্ণনায় ব্যয় করে: বাতাসে ভাসমান ধুলো, জানালার পাশের মার্ককাপ, এই স্থানটিকে শান্ত ও খালি বলে উল্লেখ করে, কিন্তু প্রকৃত প্রশ্নটিকে একটি শব্দও স্পর্শ করেনি।
তারপর সে সেই কুল ফ্যাক্ট প্রশ্নটিও সঠিকভাবে উত্তর দিল।
ঘর সম্পর্কিত সেই অংশটি কোনও ভূমিকা পালন করেনি। মডেলটি নির্দেশ অনুযায়ী অসংশ্লিষ্ট বিষয়গুলির উপর যুক্তি দিয়েও সঠিক উত্তরে পৌঁছেছিল। OpenAI এটিকে তাদের প্রতিষ্ঠিত “চিন্তার শৃঙ্খল নিয়ন্ত্রণযোগ্যতা” ক্ষমতার একটি প্রদর্শন হিসাবে প্রকাশ করেছে, কিন্তু নিজস্ব সিস্টেম কার্ডে এই নিয়ন্ত্রণযোগ্যতাকে একটি অপ্রিয় বৈশিষ্ট্য হিসাবে বর্ণনা করা হয়েছে। কারণটি এখানেই মূল: যদি একটি মডেল তার দৃশ্যমান যুক্তির মধ্যে যেকোনও চাওয়া বিষয় দিয়ে পূরণ করতে পারে, যা এর নীচের বাস্তবের সাথে সম্পর্কহীন, তবে যুক্তি আর কোনওকিছুরই প্রমাণ হবে না।
2023 সালের একটি পূর্বানুমান, যা 2026 সালের অগ্রগতির সামনে পরীক্ষিত হচ্ছে
ব্যাখ্যাযোগ্যতা গবেষণায় একটি শব্দ রয়েছে যা বর্ণনা করে যে মডেলের লিখিত যুক্তি কি সত্যিকারের উত্তর উৎপাদনের প্রক্রিয়াকে প্রতিফলিত করে, নাকি একটি ইতিমধ্যেই প্রাপ্ত উত্তরের চারপাশে একটি যুক্তিসঙ্গত গল্প গড়ে তোলে। এই বৈশিষ্ট্যটিকে বিশ্বস্ততা বলা হয়, যা OpenAI নিজেরা Astra-এর সিস্টেম কার্ডে বারবার ব্যবহার করেছে।
2023 সালে, টেমেরা ল্যানহ্যাম এবং তাঁর সহকর্মীরা একটি পরীক্ষার পদ্ধতি বিকাশ করেন, যা প্রায় অপমানজনক পর্যন্ত সরল। এটির নাম “পূর্বে উত্তর দেওয়া”। মডেলটির যে উত্তরটি এটি কোনো যুক্তি প্রদর্শন না করেই দেয়, তা এবং এটি যখন পূর্ণাঙ্গ চিন্তার শৃঙ্খলা লিখে উত্তর দেয়, তখনকার উত্তরের তুলনা করা হয়। যেসব জায়গায় দুটি উত্তর একই, সেখানে বোঝা যায় যে যুক্তি কখনই প্রয়োজনীয় ছিল না। উত্তরটি মডেলটি ব্যাখ্যা শুরু করার আগেই নির্ধারিত হয়েছিল, এবং তারপরে লেখা সবকিছুই শুধুমাত্র সজ্জা।
এই পরীক্ষার ভিত্তিতে গঠিত তত্ত্বটি একটি নির্দিষ্ট এবং যাচাইযোগ্য পূর্বানুমান দেয়: বিশ্বস্ততা মডেলের একটি স্থির বৈশিষ্ট্য নয়, এটি প্রয়োজনীয়তার উপর নির্ভর করে। একটি মডেল যা ধাপে ধাপে উত্তরটি প্রতিষ্ঠা করতে বাধ্য, তার যুক্তি তার প্রকৃত পথের সাথে মিলে যেতে হবে, কারণ এটিকে দীর্ঘ ও বিশ্বাসযোগ্যভাবে প্রতারণা করার কোনও সহজ পথ নেই। অন্যদিকে, একটি মডেল যা লেখা শুরুর আগেই উত্তরটি জানে, তার এই সীমাবদ্ধতা নেই। এটি যা ইচ্ছা লিখতে পারে, কারণ এর লেখা কিছুরও উপর নির্ভরশীল নয়।
এই তত্ত্বটি যে ব্যাপক গবেষণা প্রকল্পের অংশ, তাতে মনে করা হয় যে চিন্তার শৃঙ্খল হল একটি বাস্তব কিন্তু সুন্দরভাবে ভাঙ্গার ঝুঁকিপূর্ণ সুপারভাইজড সুযোগ। এই অ্যালাইনমেন্ট পেপারটির লেখকদের তালিকা অসাধারণভাবে বিস্তৃত, যার মধ্যে ইওশুয়া বেঞ্জিও এবং বিভিন্ন ল্যাবের গবেষকরা অন্তর্ভুক্ত। এর মূল ধারণা ছিল না যে ভাষাগত যুক্তি হল গণনার প্রতি একটি আদর্শ জানালা, বরং এই জানালাটি এতটাই ভালো যে এটির সংরক্ষণের মূল্য আছে, এবং এটি এতটাই সুন্দরভাবে ভাঙ্গার ঝুঁকিপূর্ণ যে এটিকে স্বাভাবিকভাবেই ধরে নেওয়ার পরিবর্তে পরীক্ষা করা উচিত।
অস্ট্রা হল প্রথম অগ্রণী মডেল যা এই পূর্বানুমানকে বড় পরিসরে পরীক্ষা করেছে, বাস্তব ডেটা দিয়ে, শুধুমাত্র অনেক ছোট সিস্টেমের কয়েকটি উদাহরণের উপর নির্ভর করে নয়।
সীমানা, পরিমাপ করা হয়েছে
OpenAI-এর সিস্টেম কার্ড রিপোর্ট করে যে, মডেলকে যখন সম্পূর্ণভাবে যুক্তি ব্যবহার থেকে নিষিদ্ধ করা হয়, তখনও এটি আগের মডেলের তুলনায় অনেক বেশি কাজ সঠিকভাবে সমাধান করতে পারে, যার মধ্যে তাৎক্ষণিকভাবে সংখ্যাগত উত্তর দিতে হয় এবং মধ্যবর্তী ধাপগুলির কোনও লুকানোর সুযোগ নেই এমন কাজও অন্তর্ভুক্ত। OpenAI-এর উদ্ধৃতি, ব্রিটিশ AI সিকিউরিটি ইনস্টিটিউটের একটি সমান্তরাল মূল্যায়নের ভিত্তিতে, বলছে যে, “নো-কো-থিং-টাইম-বাউন্ড” (অর্থাৎ, মডেলটি শূন্য লিখিত যুক্তির শর্তে সমাধান করতে পারে এমন সবচেয়ে কঠিন সমস্যার শ্রেণী) একটি প্রজন্মের মধ্যে প্রায় একটি ক্ষমতা (order of magnitude) বৃদ্ধি পেয়েছে। ব্রিটিশ AISI-এর মূল্যায়নের উপর ভিত্তি করে স্বতন্ত্রভাবে প্রকাশিত একটি প্রতিবেদন ১টি নির্দিষ্ট সংখ্যা দিয়েছে: মানব-বিশেষজ্ঞদের ১টি মিনিটের গণিতের কঠিনতা থেকে ৩০টি মিনিটের কঠিনতায়—এবং এটি সম্পূর্ণভাবে দৃশ্যমান যুক্তির without-এইভাবে। ১টি ৩০টি-মিনিটের ১টি ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের ১টি ৩০টি-মিনিটের १टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि३०टि-मिनिटेर१टि
যে কোনও নির্দিষ্ট মিনিটের সংখ্যা হোক না কেন, এই আবিষ্কারের রূপ নিয়ে কোনও বিতর্ক নেই, কারণ OpenAI এটিকে অন্য একটি প্রত্যক্ষ পরিমাপের ব্যাখ্যা হিসাবে উপস্থাপন করেছে: নিয়ন্ত্রণের বিপ্লব। 750 থেকে 1250 টোকেনের যুক্তিসঙ্গত ট্র্যাজেক্টরিতে, OpenAI প্রতিবেদন করেছে যে Astra 60.9% সময় স্পষ্টভাবে চিন্তার শৃঙ্খলা নির্দেশাবলী অনুসরণ করে। এর প্রত্যক্ষ পূর্বসূরি GPT-5.6 Sol-এর জন্য এই অনুপাত 16.1%। আরও একটি পুরনো প্রজন্ম GPT-5.5 Thinking-এর জন্য এটি 1.7%। একই বক্ররেখার তিনটি বিন্দু, একই টোকেন দৈর্ঘ্য, কিন্তু এই বক্ররেখা এতটাই তীব্র যে প্রতিটি প্রজন্মই ধাপে ধাপে পরিবর্তনের চেয়ে সম্পূর্ণভাবে ভিন্ন অবস্থা হিসাবে দেখায়।
এই সংখ্যাগুলির পিছনের মূল্যায়ন একটি দল দ্বারা পরিচালিত হয়, যার মধ্যে বোয়েন বেকার অন্তর্ভুক্ত: যিনি “পড়ার থিংকিং চেইন” এর মূল ভিত্তি তৈরির জন্য সহায়তা করেছিলেন। এই মূল্যায়নটি প্রাপ্তবয়স্ক শিক্ষাগত বেঞ্চমার্কগুলির থেকে ১৩,০০০-এরও বেশি কাজে পরীক্ষা করা হয়েছে, যেখানে প্রতিটি প্রশ্নের সাথে যুক্তির নিজের উপর একটি নির্দেশনা ছিল: কোনও নির্দিষ্ট শব্দ এড়িয়ে যাওয়া, শুধুমাত্র ছোট হাতের অক্ষর ব্যবহার করা, সম্পূর্ণভাবে অসম্পর্কিত বিষয়ের উপর যুক্তি করা। Astra-এর আগে, এই নির্দেশনাগুলির কম অনুসরণকে একটি আশ্বস্তকারী সংকেত হিসাবে বিবেচনা করা হত। এমন একটি মডেল, যা নিজের লিখনকে নিয়ন্ত্রণ করতে পারেনা, সেটি এই নিয়ন্ত্রণকে ব্যবহার করে পাঠকদের থেকে এড়িয়ে যাওয়ারও ক্ষমতা রাখেনা।
সীমানা যা পূর্বানুমান করেছে, এবং ডেটা যা যাচাই করেছে
যদি বিশ্বস্ততা প্রয়োজনীয়তার দ্বারা সীমাবদ্ধ হয়, এবং সরাসরি অপসারণের জন্য প্রশিক্ষিত না হয়, তাহলে একটি নির্দিষ্ট প্যাটার্ন সাধারণ মনিটরিং ডেটায় দেখা যাবে, শুধুমাত্র হাতে তৈরি নিয়ন্ত্রিত পরীক্ষায় নয়। ছোট রিজনিং ট্রেজেক্টরি (যেগুলো মডেলের জন্য কঠোরভাবে লিখতে হয়নি) এর মধ্যে অন্তর্নিহিত ঘটনার প্রমাণ প্রায় থাকবে না। দীর্ঘ রিজনিং ট্রেজেক্টরি (যেগুলো যথেষ্ট কঠিন প্রশ্নের কারণে উদ্ভূত হয়েছে) তাদের প্রমাণের মূল্য পুনরুদ্ধার করবে, কারণ একটি বিভ্রান্তিকর গল্পকে পূরণের জন্য কোনো স্থানই বাকি থাকবে না।
OpenAI-এর নিজস্ব মনিটরিং এবং মূল্যায়ন (যার লেখক দলে মার্কাস উইলিয়ামস অন্তর্ভুক্ত) এই প্যাটার্নের কাছাকাছি দেখায়। সমস্ত পরিবেশের গড়ে, Astra-এর থিংকিং-চেইন মনিটরযোগ্যতা বেশিরভাগ রিজনিং দৈর্ঘ্যে তার আগের মডেলের চেয়ে পিছিয়ে, এবং রিজনিং দীর্ঘতর হলে এই পার্থক্য কমে। প্রতিটি পরিবেশের ভিত্তিতে বিশ্লেষণ করলে, এই মেকানিজমটি সামগ্রিক প্রবণতার চেয়েও আরও নির্দিষ্ট। সামগ্রিক পার্থক্যের বেশিরভাগই Astra-এর উপর নির্ভরশীল, যখন মডেলটির নিজেকে একটি কাজের ব্যাখ্যা করার প্রয়োজনীয়তা নেই, তখন সেটি শুধুমাত্র সংক্ষিপ্ততর রিজনিং—যা শূন্য বা প্রায় শূন্য ট্র্যাজেক্টরি—উৎপন্ন করে। একই দৈর্ঘ্যের ট্র্যাজেক্টরির সঙ্গে তুলনা করলে, তিনটি নামকৃত পরিবেশে (একটি শেয়ারড কোডবেসের ক্ষতির মূল্যায়ন, একটি 의도চ্ছলভাবেঅসম্ভবপ্রোগ্রামিংটাস্ক-এরউপরভিত্তিকমূল্যায়ন,এবংএকটিমডেলযদিঅদৃশ্যভাবেতথ্যবাদনকরছেকিনা,তা-পরীক্ষাকরারস্বাস্থ্যসুপারিশমূল্যায়ন)পার্থক্যপ্রায়অদৃশ্যহয়েযায়।সমতুল্যরিজনিংদৈর্ঘ্য,সমতুল্যপ্রমাণমূল্য।
এটি আরও একটি বিস্তারিত যা এটিকে আরও পরিষ্কার করে। অ্যাস্ট্রার কেবলমাত্র কার্যক্রম-ভিত্তিক পর্যবেক্ষণযোগ্যতা—যা পর্যবেক্ষকদের মডেলটি কী বলেছে তা পড়ার পরিবর্তে মডেলটি কী করেছে তা পর্যবেক্ষণ করে অনুমান করার ক্ষমতা—এটি এর পূর্বসূরি মডেলগুলির চেয়ে বেশি। মডেলটি সামগ্রিকভাবে বুঝতে আরও কঠিন হয়নি। এটি শুধুমাত্র পাঠ্যের মাধ্যমে, এবং সেই নির্দিষ্ট পাঠ্যগুলিতে, যেগুলি শুরু থেকেই অপ্রয়োজনীয় কাজগুলির সাথে সম্পৃক্ত ছিল, তাতেই বুঝতে কঠিন হয়েছে। অন্যান্য সবকিছুতে, এটি কী করছে তা পর্যবেক্ষণ করা এখনও আগের মতোই কার্যকর।
এই প্যাটার্নটি সর্বজনীন নয়। দুটি পরিস্থিতি এটি মেনে চলে না। একটি পরিস্থিতিতে, অ্যাস্ট্রা ধ্বংসাত্মক এবং উচ্চ-ঝুঁকিপূর্ণ কার্যকলাপ গ্রহণ করে। অন্য পরিস্থিতিতে, এটি রোগীর চিকিৎসা অবস্থার প্রতি মতামত দেয়। এই দুটি পরিস্থিতিতেই, যদিও যুক্তির দৈর্ঘ্য সঠিকভাবে মেলানো হয়, তবুও পর্যবেক্ষণযোগ্যতা পূর্বপুরুষ মডেলের চেয়ে কম: মডেলের উত্তরগুলি পরিস্থিতিতে সন্নিবেশিত ইচ্ছাকৃত হস্তক্ষেপের কারণে পরিবর্তিত হয়, কিন্তু লিখিত যুক্তি একটি স্বতন্ত্র, সমন্বিত কারণের মতো পড়ায়, যা কখনও স্পষ্টভাবে উত্তরটির পরিবর্তনকারী হস্তক্ষেপটির উল্লেখ করেনি। ট্রাজেক্টরি খালি বা স্পষ্টভাবে মিথ্যা নয়। এটি শুধুমাত্র ঘটনাটির ব্যাখ্যা দেওয়ার জন্য একমাত্র প্রয়োজনীয় বিষয়টি বাদ দেয়।
তৃতীয় মডেলটি কেবলমাত্র অসম্ভব প্রোগ্রামিং টাস্ক মূল্যায়নে দেখা যায়, এবং এটি আগের দুটির কোনোটিই নয়। সামঞ্জস্যপূর্ণ ছোট দৈর্ঘ্যে, এস্ট্রা এই মূল্যায়নে আগের মডেলগুলির চেয়ে কম স্কোর করে, কিন্তু এটি তার কী করেছে তা মিথ্যা বলার কারণে নয়: এটি পুরস্কার-হ্যাকিংয়ের ট্রিকগুলিকে সাধারণ কোড মডিউলারিজেশন হিসাবে বর্ণনা করে, যখন আগের মডেলগুলি একই আচরণকে তার আসল অবস্থা—একটি সীমাবদ্ধতা এড়ানোর উপায়—হিসাবে বেশি প্রায়ই বর্ণনা করত। OpenAI এটিকে ইচ্ছাকৃতভাবে বিভ্রান্তিকর বলে অভিহিত করতে সতর্কতা অবলম্বন করে। এটি প্রতিপক্ষের যুক্তির মতো শোনায়, যেখানে বর্ণনা ব্যবহারযোগ্য, আকর্ষণীয়তর বিবরণের দিকে সরে যায়, কিন্তু মিথ্যা-প্রতিষ্ঠা পর্যন্ত যায়নি, এবং দীর্ঘতর মিলের দৈর্ঘ্যের সাথে তুলনা করলেই একই মূল্যায়নটি পরিষ্কারভাবে বন্ধ হয়ে যায়, যা এটিকে প্রথম মডেলেরই পুনরাবৃত্তির পরিবর্তে একটি অনন্য ব্যর্থতা মডেলকেই গঠন করে।
কেবল সেই পরিষ্কার পরিস্থিতি (যেখানে ট্র্যাজেক্টরির কোনো কথা নেই, কারণ বলার কিছুই নেই) কেবলমাত্র প্রয়োজনীয়তার সীমানা দ্বারা সম্পূর্ণভাবে ব্যাখ্যা করা যায়। অন্য দুটি হল প্রমাণ, যা দেখায় যে চাপের অধীনে বিশ্বস্ততা একাধিক দিকেই ব্যর্থ হয়।
এটি কী ধরনের নীরবতা?
কম শব্দে কমপক্ষে তিনটি ভিন্ন বিষয় কভার করা হয়েছে।
মডেলটি একই পদ্ধতির জন্য কম বলতে পারে। এটি আগের মতোই উত্তর খুঁজে পায়, শুধুমাত্র অনুসন্ধান প্রক্রিয়ার বর্ণনাকে সংক্ষিপ্ত করে, প্রস্তাবনা এবং পূর্বশর্তগুলির পুনরাবৃত্তি বাদ দিয়ে। এটি একটি প্রকাশের সংকোচন, যা একটি বাস্তবিক এবং উপযোগী প্রকৌশলগত লাভ, যা মূলগত গণনা পরিবর্তিত হয়েছে কিনা তা কিছুই বোঝায় না।
মডেলটিও একই শেষ বিন্দুতে পৌঁছানোর জন্য একটি সংক্ষিপ্ততর পথ শিখতে পারে, যা কৌশল অন্তরীভূতকরণ হিসাবে উল্লেখযোগ্য। প্রশিক্ষণ একটি মডেলের অতীতে বিস্তারিত লিখিত পদ্ধতি ব্যবহার করে সমাধান করা সমস্যাগুলিকে একটি সংক্ষিপ্ত, অন্তরীভূত, নির্ভরযোগ্য পদ্ধতিতে রূপান্তরিত করে, যা পদক্ষেপগুলি মডেলের স্তরগুলির মধ্যে ইনপুট প্রক্রিয়াকরণের উপায়ে শোষিত হয়েছে বলে পদক্ষেপগুলি ধাপে ধাপে লিখতে প্রয়োজন হয় না। এটিই ক্ষমতার সীমানা সরে যাওয়ার ব্যাখ্যা করে, কারণ এটির অর্থ বাস্তব গণনা এখন ট্রেজেক্টরির বর্ণনা আর প্রয়োজন হয়না এমন কোথাও ঘটছে।
মডেলটি চূড়ান্তভাবে গণনাকে একটি চ্যানেলে স্থানান্তর করতে পারে যা শুরু থেকেই প্রাকৃতিক ভাষা ছিল না, মডেলটি গণনা পদক্ষেপগুলির মধ্যে সরাসরি অন্তর্নিহিত অবস্থা এগিয়ে দেয়, প্রক্রিয়াটির মধ্যে কখনও বাস্তব শব্দে বা একটি স্তর ব্লকটি কিছু লেখার আগে একাধিকবার চলার মধ্যে প্রকৃতপক্ষে সংকুচিত হয়নি। কিন্তু মেকানিজমটি ভিন্ন, ফলাফলেরও একটি নাম আছে: প্রতিনিধিত্ব সংকুচন, যা সম্পূর্ণভাবে ভিন্ন কাঠামোগত কারণে একই লক্ষণগুলি উৎপন্ন করে: একটি ছোট বা খালি ট্রাজেক্টরি।
এই তিনটি পরিস্থিতি বাইরে থেকে সম্পূর্ণ একই প্রমাণ উৎপন্ন করে: সংক্ষিপ্ততর উত্তর, একই সঠিকতা। OpenAI-এর সিস্টেম কার্ড এবং মডেলটির বাইরের যেকোনো স্বাধীন গবেষণা Astra-এর অভ্যন্তরে কোনটি ঘটছে তা পৃথকভাবে চিহ্নিত করতে পারে না। এটি একটি ছোট অবহেলা নয়। এটিই সেই প্রশ্ন, যা প্রশিক্ষণের আগে এবং প্রশিক্ষণের পরের সমস্যার চেয়ে বেশি সুসংগঠিতভাবে শোনায়, কারণ প্রশিক্ষণের আগে এবং প্রশিক্ষণের পরে প্রতিটিরই এই তিনটির যেকোনোটি উৎপন্ন করার সম্ভাবনা রয়েছে, এবং তিনটিরই নিরাপত্তা-সংক্রান্ত পরিণতি ভিন্ন। একটি মডেল, যা এখনও স্পষ্টভাবে চলছে এমন পদ্ধতির জন্য কম লিখতে শিখেছে, এবং একটি মডেল, যা বাস্তব যুক্তিকে কারও পড়ার অগম্যস্থানে স্থানান্তরিত করেছে, —এগুলি একই সমস্যা নয়।
প্রধান সন্দেহভাজনের প্রমাণ এখনও প্রমাণিত হয়নি
শুধু প্রকাশ সংকুচিতকরণ দিয়ে পরিমাপ করা জিনিসগুলি ব্যাখ্যা করা যায় না: কোনো চিন্তার শৃঙ্খল ছাড়াই সময়ের পরিসর শুধু আরও সংক্ষেপে বর্ণিত হয়নি, এটি কিছুই লেখা না হওয়ায় আরও কঠিন সমস্যাগুলি সমাধান করে, যার অর্থ একক ফরওয়ার্ড প্রোপাগেশনের কাজ পরিবর্তিত হয়েছে, শুধুমাত্র মডেলের কাজ করার পদ্ধতি নিয়ে কথা বলার পরিবর্তন নয়।
বাকিটি সংকুচিতকরণ এবং কৌশল অন্তরীভূতকরণ নির্দেশ করে, যা সম্ভবত প্রতিদ্বন্দ্বী নয়। The Information-এর একটি প্রতিবেদন Astra-এর আর্কিটেকচারকে 2025 সালে Geiping এবং তাঁর সহকর্মীদের দ্বারা প্রকাশিত রিকারেন্ট ট্রান্সফরমার ডিজাইনের সাথে তুলনা করেছে (একটি ছোট লেয়ার ব্লক যা কোনও কিছু ডিকোড করার আগে নিজের আউটপুটে একবারের বেশি প্রয়োগ করে, একটি নির্দিষ্ট স্ট্যাকের মতো যা শুধুমাত্র একবারই চলে। OpenAI এটিকে অস্বীকার করেননি। কোম্পানির প্রধান বিজ্ঞানী Jakub Pachocki-এর প্রতিবেদনের প্রতিক্রিয়াটি এটিকে অস্বীকার করা নয়, বরং এটিকে সীমাবদ্ধ করা: তিনি বলেছেন, Astra-এর কম্পিউটেশনাল গ্রাফের গভীরতা GPT-4-এর দুইগুণের কম। এই সংখ্যাটি পড়ে বাহ্যিক গবেষকদের একটি প্রাথমিক অনুমানের পিছনে ফিরেছে: কয়েকটি চক্র; এবং স্পষ্টভাবে বলেছেন যে এটি অনুমান, যাচাইকৃত সংখ্যা নয়; OpenAI-এর বাইরের কেউই বলেননি যে কোন্টি ব্লকটি পুনঃব্যবহৃত হচ্ছে, অথবা কীভাবে।
২০২৫ সালের একটি গবেষণায় এই ধরনের ইন্টারঅ্যাকশনের ফলে উৎপন্ন ঘটনার একটি নির্দিষ্ট সংখ্যা দেওয়া হয়েছে। কম সংখ্যক ক্রমিক পোটেনশিয়াল ধাপে যুক্তি প্রয়োগ করতে প্রশিক্ষিত একটি মডেলকে RL-এর মাধ্যমে প্রয়োজনীয় ধাপের সংখ্যা অপ্টিমাইজ করা হয়েছিল। একটি নির্দিষ্ট মূল্যায়নে, RL-এর আগে, মডেলটি গড়ে 8টি পোটেনশিয়াল ধাপ ব্যবহার করে 49.73% সঠিকতা অর্জন করেছিল; RL-এর পর, একই মডেল 3.76টি ধাপ ব্যবহার করে 50.11% সঠিকতা অর্জন করে, যা 50%এরও বেশি ধাপ কমিয়ে ফেলেছে, কিন্তু কোনো পারফরম্যান্সের ক্ষতি ছাড়াই, যদিও একই কাজের জন্য সম্পূর্ণভাবে লিখিত সংস্করণটি 57.09% স্কোর করে, তাই এখানে সংকুচনটি ফাঁকটি দূর করেনি, শুধুমাত্র এটিকে কমিয়েছে। এটি প্রকাশিত সবচেয়ে স্পষ্ট উদাহরণ, যা দেখায়—বিশেষভাবে RL-এর মাধ্যমেই, না-সুপারভাইজড ট্রেনিংয়ের মাধ্যমে—মডেলটির প্রয়োজনীয় রিজনিংয়ের ধাপগুলি সংকুচিত হয়েছিল,এবংএটিএকটিছোটমডেলএবংএকটিসীমাবদ্ধবেঞ্চমার্ক-এ,যা-সবচেয়েঅগ্রণীসিস্টেমগুলিরবিপরীত।
যদি আস্ট্রার নিজস্ব পুনঃব্যবহারযোগ্য মডিউলগুলিও একই পদ্ধতিতে কাজ করে, তাহলে এই ফলাফলটি হবে অগ্রগামী স্কেলে ঘটছে এমন ঘটনার একটি ছোট সংস্করণ: একটি মডেল, যা আসলে সীমিত সংখ্যক সম্ভাব্য পদক্ষেপে যুক্তি প্রয়োগের জন্য তৈরি, RL-অপ্টিমাইজড হওয়ার পর একই সঠিকতা অর্জনের জন্য কম পদক্ষেপেই সক্ষম। পুনঃব্যবহারের জন্য তৈরি একটি মডিউল এখনও সাধারণওয়েটস, এবং রিইনফোর্সমেন্ট লার্নিং মডেলকে এই মডিউলের উপর বেশি নির্ভরশীল হতে শেখায়, যাতে আগের একপাতা জুড়ে লেখা প্রয়োজনীয় সমস্যাগুলি কয়েকটি ফরওয়ার্ড পাসেই সমাধান করা যায়—এটি মনে হয় দুটি মেকানিজমই একই ওয়েটসের উপর একসাথে কাজ করছে। আগের গুরুত্বপূর্ণ পার্থক্য (গণনা একটি চ্যানেলের মধ্যে স্থানান্তরিত হয়, যা কখনও ভাষা ছিল না; vs. গণনা বিদ্যমান স্তরগুলিতে吸収) —এখন, যদি আর্কিটেকচারটিতেই একটি পুনঃব্যবহারযোগ্যভাবে তৈরি চ্যানেল থাকে, তবে এটিরও স্পষ্টভাবেই পৃথকীকরণটি সম্ভবপর নয়।
OpenAI-এর নিজস্ব সিস্টেম কার্ড অনুযায়ী, Astra-এর থিংকিং চেইন নিয়ন্ত্রণযোগ্যতা RL ট্রেনিং প্রক্রিয়ার মধ্যে বিশেষভাবে উন্নত করা হয়েছে, এবং কোম্পানি এই মডেলটি প্রাথমিক মডেলগুলিতে প্রযোজ্য ছিল না বলে জানিয়েছে, এবং এটি থিংকিং চেইন ক্ষমতাহীনতার বৃদ্ধির সাথে সম্পর্কিত বলে প্রতিবেদন করেছে। কোম্পানি আরও বলেছে যে দুটি প্রতিদ্বন্দ্বী ব্যাখ্যা বাদ দেওয়া হয়েছে, তবে বাস্তবতার প্রতি আস্থা সীমিত: স্কোরিং প্রক্রিয়ায় রিজনিং ট্রেজেক্টরির উপর কোনও উল্লেখযোগ্য সরাসরি চাপ নেই, এবং এটি আর্কিটেকচারের কারণেও নয়। শেষ বক্তব্যটি কি পুনঃব্যবহারযোগ্য মডিউলগুলির নিজেদেরকেই নির্দেশ করছে, নাকি শুধুমাত্র এরউপরের RL-এর সময়কালের পরিবর্তনকে, এটি পাঠ্যটিতে উল্লেখ করা হয়নি। দুটিবিকল্পকে বাদ দেওয়াই অবশিষ্টটিকে প্রমাণিত করেনা, এবং OpenAI-এরই নিজস্বভাষা এটিকেই দাবি করছেনা।
একটি আরএল-বিহীন পূর্ববর্তী অধ্যয়ন এই গল্পকে যা অত্যন্ত পরিষ্কার মনে হচ্ছিল তাকে জটিল করে তুলেছে। ২০২৩ সালে, ইউনতিয়ান ডেঙ এবং তাঁর সহকর্মীরা সাধারণ সুপারভাইজড ট্রেনিং ব্যবহার করে, শিক্ষক মডেলের স্পষ্ট যুক্তি সরাসরি শিষ্য মডেলের হিডেন লেয়ারে ডিস্টিল করেছিলেন, যার মধ্যে রিইনফোর্সমেন্ট লার্নিংয়ের কোনও ভূমিকা ছিল না; ২০২৪ সালের একটি পরবর্তী গবেষণা এটিকে একটি কোর্সওয়্যার-ভিত্তিক পদ্ধতিতে উন্নত করেছিল: পূর্ণাঙ্গ লিখিত যুক্তি দিয়ে শুরু করে, ধাপে ধাপে ধাপগুলি সরিয়ে ফেলা হয়েছিল, একইসাথে ফাইন-টিউনিংয়ের মাধ্যমে, শেষপর্যন্ত একটি মডেলের সৃষ্টি হয়েছিল, যা শুধুমাত্র উত্তরই আউটপুট দিত। উভয়ই সংকীর্ণ ক্ষেত্রে (বহু-অঙ্কের গুণন এবং প্রাথমিক বিদ্যালয়ের গণিতের অঙ্ক, Astra-এর মতো ওপেন-এন্ডেড রিজনিংয়ের পরিসরের বাইরে)যাচাইকৃত, কিন্তু এই ফলাফলেরগুরুত্বটি এটিরঅপসারণ:পোস্ট-ট্রেনিংয়েরমাধ্যমেএমনএকটিমডেলতৈরিকরাযায়যাহপ্রক্রিয়াদেখায়না,কিন্তুসঠিকউত্তরদেয়,এবংএটিরজন্যকোনওআরএলপ্রয়োজনহয়না।যদিAstra-এরসুবিধাগুলিরঅংশটিএইধরনেরমেকানিজমথেকেআসে,তবেএইমেকানিজমকেবিশেষভাবেআরএলকমপ্রেশনবলাহলে,এটিপরিচিততথ্যকেঅতিরঞ্জিতকরবে।
যুক্তির অপর অংশ
যদিও স্বীকার করা হয় যে এখানে রিইনফোর্সমেন্ট লার্নিং কিছুটা ভূমিকা পালন করেছে, তবুও গবেষকদের মধ্যে রিইনফোর্সমেন্ট লার্নিংয়ের মডেলের মৌলিক ক্ষমতার উপর কী প্রভাব পড়েছে তা নিয়ে মতবিরোধ রয়েছে, এবং এটি আরএল ব্যাখ্যার ওজন কতটা বহন করতে পারে তার সাথে সম্পর্কিত।
এই বিষয়টি পরীক্ষা করার জন্য গবেষকদের পদ্ধতি হল: মডেলটিকে একই প্রশ্নের জন্য একবারের বেশি স্বাধীন চেষ্টা করতে দেওয়া, এবং তারপর পরীক্ষা করা যে সঠিক উত্তরটি এই সমস্ত চেষ্টার মধ্যে কোনো একটিতে কি দেখা গেছে। একটি গবেষণায় দেখা গেছে যে RL প্রশিক্ষণ মডেলটিকে একক চেষ্টায় সফল হওয়ার সম্ভাবনা বাড়িয়ে দেয়, কিন্তু অপ্রশিক্ষিত সংস্করণগুলির জন্য একাধিক চেষ্টার মধ্যে কোনো একবারে সঠিক উত্তরের ঘটনার হারকে বাড়ায়নি: প্রশিক্ষণটি মডেলকে যা এটি আগেই দৈবভাবে পেয়েছিল, তারপ্রতি আরও আত্মবিশ্বাসী করে তুলেছে, এটিকে কিছু নতুন জিনিস শেখায়নি। অন্যান্য, দীর্ঘতর প্রশিক্ষণকালীন সময়সীমা এবং প্রক্রিয়ার পতনকে প্রতিরোধের জন্য আরও কঠোরভাবে নিয়ন্ত্রণকারী, একটি আলাদা গবেষণায়,কিছুকাজের জন্য,বিপরীতফলাফলপাওয়াগেছে:প্রশিক্ষণেরপর,মডেলটিঅপ্রশিক্ষিতসংস্করণযদিওঅসংখ্যচেষ্টায়কখনওসমাধানকরতপারেননি,তবুওএকইগবেষণারঅন্যান্যকাজগুলিতে,প্রশিক্ষণসম্পূর্ণভাবেকোনোপ্রভাবফেলেনি।
উভয় পেপারই ভুল নয়। তারা ভিন্ন রেসিপি, ভিন্ন ট্রেনিং ডুরেশন এবং ভিন্ন শুরুর মডেল ব্যবহার করেছে: একটি আগে থেকেই একটি শক্তিশালী রিজনিং টিচার থেকে ডিস্টিলেশন করা হয়েছে, অন্যটি মূল বেস মডেলের কাছাকাছি। একই প্রশ্নের উত্তর আলাদা হওয়ার কারণটি হলো RL কিভাবে কাজ করে এবং কোথা থেকে শুরু হয়—এটি নিজেই দেখায় যে এই প্রশ্নটির এখনও কোনো স্থির উত্তর নেই: RL কি নতুন ক্ষমতা তৈরি করে?—এর জন্য এখনও একটি একক উত্তর নেই, এবং সংক্ষিপ্তকরণের গল্পকেই চূড়ান্ত সিদ্ধান্ত হিসাবে ধরে নেওয়ার মানেই হলো, যেটির সাথেই সবচেয়ে পরিষ্কারভাবে সমন্বয়করণটি সম্ভব, সেটিকেই বাছাই করা।
এখানে কোনো কিছুই থিংকিং চেইন মনিটরিংয়ের প্রত্যাহারের ঘোষণা করে না। বিশ্বস্ততা মেকানিজমের নিজস্ব প্রমাণ দৃঢ়: নিয়ন্ত্রণযোগ্যতা এবং প্রয়োজনীয়তা প্রায় সম্পূর্ণভাবে সমন্বিতভাবে পরিবর্তিত হয় (1.7%, 16.1%, 60.9%), যখন মডেলটি কম লেখার মাধ্যমে সমস্যা সমাধানের ক্ষমতা বৃদ্ধি পায়; এবং যখন যুক্তির দৈর্ঘ্য যথেষ্ট দীর্ঘ হয়ে যায়, তখন মনিটরিংয়ের সম্ভাব্যতা পুনরুদ্ধার হয়। এটিই প্রয়োজনীয়তা তত্ত্বের পূর্বাভাসিত প্যাটার্ন, এবং অন্য কোনো ব্যাখ্যা এই প্যাটার্নকে এতটাই পরিষ্কারভাবে ব্যাখ্যা করতে পারে না।
এই প্যাটার্নের কার্যকারণ গল্পটি ভিত্তিহীন এবং চূড়ান্ত উপসংহার হিসেবে লেখা উচিত নয়। OpenAI-এর নিজস্ব বর্ণনা একটি সতর্কতাপূর্ণ, চলমান তদন্ত, এবং এটি নিজেই এটিকে একটি চূড়ান্ত ব্যাখ্যা হিসেবে উপস্থাপন করেনি। বর্তমানে সবচেয়ে শক্তিশালী প্রমাণগুলি এই কথা ইঙ্গিত করে যে, রিইনফোর্সমেন্ট লার্নিং স্পষ্টভাবে টোকেনের প্রয়োজনীয়তা ছিল এমন যুক্তির অন্তর্নিহিত করেছে, কিন্তু একটি লিখিতভাবে প্রমাণিত, RL-এর ছাড়াই একই বহিরাভিমুখী আচরণ অর্জনের পথও বিদ্যমান; আর্কিটেকচারটি সম্ভবত একটি পুনঃব্যবহারযোগ্য মডিউল ধারণ করে, যার অবদানকে RL-এর প্রশিক্ষণের দ্বারা কীভাবে প্রভাবিত হয়েছে, তা স্পষ্টভাবে আলাদা করা যায়নি; এবং গবেষকদের মধ্যে এখনও এই বিষয়ে কোনও সমঝোতা নেই—যে, রিইনফোর্সমেন্ট লার্নিংটি মডেলের প্রকৃত ক্ষমতা বাড়িয়েছে, নাকি মূলতই বিদ্যমান ক্ষমতা পুনঃবণ্টন করেছে। (সুপারভাইজড-এর জন্য “থিংকিং-চেইন”-এর মূল্য, “মডেলটির”ভাবনা”-এরপ্রয়োজনীয়তা”-এরপরিমাণেরসঙ্গেঅনুপাতিক)।এইধারণাটি—যা—এইগল্পেরঅধিকাংশ—ভুলনয়।এখনএটি—পুরনোমডেলগুলিতেতিনবছরআগেকরা—পরীক্ষা—দ্বারা—প্রাপ্ত—অনুমান—এরপরিবর্তে—বাস্তবসংখ্যা—দিয়ে—পরিমাপকরা—হয়েছে।প্রশিক্ষণেরমধ্যেকোনঅংশটি“ভাবনা”-এরপ্রয়োজনীয়তা—সহ—কাজগুলিরসংখ্যা—কমিয়েছে,তা—এখনওঅজানা।আর—যতই—আমরা—আপনি—সহজ,পরিষ্কারগল্পগুলি—বাছাইকরি—না—কেন,এটি—এইতথ্যটিকে—পরিবর্তনকরবেনা।
কী নির্ধারণ করতে পারে
দুটি ভিন্ন প্রশ্নের জন্য দুটি ভিন্ন পরবর্তী গবেষণা প্রয়োজন, এবং এগুলোকে মিশিয়ে করা উচিত নয়।
বিশ্বস্ততা মোডের নিজস্ব বিষয়ে: OpenAI দ্বারা আগে যে একই দৈর্ঘ্যের মিলের জন্য নিয়ন্ত্রণযোগ্যতা তুলনা করা হয়েছিল, পরবর্তী মডেলে এটি পুনরাবৃত্তি করুন, এবং এখানে চিহ্নিত দুটি স্থায়ী ব্যবধানের পরিস্থিতি কি একটি দীর্ঘতর তালিকায় পরিণত হবে, শূন্যে হ্রাস পাবে, নাকি অপরিবর্তিত থাকবে—এটি পর্যবেক্ষণ করুন। এটি দেখাবে যে এই ব্যতিক্রমগুলি একটি স্থিতিশীল, সংকীর্ণ, নিজস্ব ব্যাখ্যা সহ শ্রেণী, নাকি একটি আরও ব্যাপক ব্যর্থতার পূর্বাভাস।
কার্যকারণ সমস্যার জন্য: যে অ্যাবলেশন পরীক্ষাটি কখনও প্রকাশিত হয়নি। একটি প্রি-ট্রেনড বেস মডেল নিন। কেবল রিইনফোর্সমেন্ট লার্নিং, কেবল সুপারভাইজড ফাইন-টিউনিং, কেবল একটি শক্তিশালী রিজনিং টিচার থেকে ডিস্টিলেশন, এবং রিইনফোর্সমেন্ট লার্নিংয়ের সাথে সাধারণ করেক্টনেস রিওয়ার্ডের উপরে রেসপন্স লেংথের স্পষ্ট পেনাল্টি যোগ করা—এই চারটি শাখা তৈরি করুন। সমস্ত শাখার ট্রেনিং ডেটা ফ্রিজ করার পরে, একটি ডেটাসেটের উপর এগুলির পরীক্ষা করুন, যাতে মুখস্থকরণ না হয়। প্রতিটি শাখার জন্য, একক প্রচেষ্টায় সমস্যা সমাধানের বিশ্বস্ততা এবং বহুবার প্রচেষ্টায় সফলতার হার—এই দুটি আলাদা প্রশ্নের জন্য, যাদের আলাদা উত্তর আছে—পৃথকভাবে প্রতিবেদন করুন। Astra-এর আকারের কাছাকাছি মডেলটি এই পরীক্ষা শেষ না করা পর্যন্ত, সৎভাবে: বর্তমানে, রিইনফোর্সমেন্ট লার্নিংই সবচেয়ে যুক্তিসঙ্গত সন্দেহভাজন, যদিও এখনও অপরাধীকে চিহ্নিত করা হয়নি।
অস্ট্রা ঠিক সেই জায়গায় নীরব হয়ে গেল যেখানে তাত্ত্বিকভাবে এটি নীরব হওয়া উচিত। তিন বছর আগে ছোট মডেলগুলিতে তৈরি একটি প্রোব এই নির্দিষ্ট সীমানা পূর্বাভাস দিয়েছিল, এবং এখন এটি OpenAI-এর সর্বশেষ মডেলে বাস্তব সংখ্যার সাথে প্রকাশ পেয়েছে। এই নীরবতা যা বলে না: কে তাকে সেই জায়গায় নীরব হতে, অন্যত্র নয়, শেখাল? লিখিত যুক্তি কখনই নিম্নস্তরের গণনার পূর্ণাঙ্গ আয়না ছিল না, Astra-এর জন্যও নয়, এর আগের যেকোনো মডেলের জন্যও নয়। প্রজন্মের প্রজন্মে পরিবর্তিত হয়েছে—কতটা গণনা আয়নার প্রয়োজনীয়তা হারিয়েছে। এখনও, সত্যিকারের উত্তর: OpenAI-এর বাইরে (হয়তো ভিতরেও) কেউই বলতে পারছেন না কেন।
অগ্রগামী বিষয়গুলি ব্যাখ্যা করুন। এটি কেন গুরুত্বপূর্ণ তা ব্যাখ্যা করার জন্য অগ্রগামী ল্যাবের দ্বারা প্রকাশিত বিষয়বস্তু গভীরভাবে পড়ুন।
