উত্তর তৈরি করা এখন এআইয়ের একটি মৌলিক ক্ষমতা হয়ে উঠেছে, কিন্তু বাস্তব বিশ্বের প্রতিফলন করা হল পরবর্তী পর্যায়ের আরও কঠিন প্রশ্ন।
প্রকৃত সিদ্ধান্ত একটি স্থির প্রশ্নোত্তর নয়। এটি একটি নিয়মিত পরিবর্তনশীল, একাধিক পক্ষ একসাথে কাজ করে, তথ্য অপূর্ণ এবং অনিশ্চয়তায় ভরা বিশ্বে ঘটে।
যেমন একটি নতুন ওপেন-সোর্স মডেল হঠাৎ করে খরচ কমিয়ে দেয়, তখন শীর্ষস্থানীয় মডেল কোম্পানিগুলি কি দাম কমাতে পিছনে হবে, ক্লাউড প্রোভাইডার, ডেভেলপার এবং অ্যাপ্লিকেশন কোম্পানিগুলি কি পুনরায় দলবদল করবে? এই ধরনের সিদ্ধান্তগুলিতে, একপক্ষের কার্যকলাপ অন্যদের পরবর্তী পদক্ষেপের জন্য শর্তগুলি পরিবর্তন করে দেয়, এবং নতুন প্রতিক্রিয়াগুলি আবারও পরিস্থিতি পুনরায় লিখে ফেলে। এটি যেন সব খেলোয়াড়ই একসাথে চাল দেওয়ার একটি শত্রুতাপূর্ণ খেলা, যেখানে প্রতিটি চালের সাথেই খেলার অবস্থা পরিবর্তিত হয়।
এই প্রেক্ষাপটে, জংকে উনগে দ্বিতীয় সিদ্ধান্ত মেশিন Decitron (সংক্ষেপে সিদ্ধান্ত মেশিন) প্রকাশের পর, এটিকে অনেকগুলি প্রধান প্রযুক্তি মিডিয়া "বিশ্বের প্রথম সাধারণ সিদ্ধান্ত বড় মডেল" হিসাবে অভিহিত করেছে। এই উপাধির মূল জোর দেওয়া হয়েছে বিশ্ব মডেল, একাধিক বুদ্ধিমত্তা বা খেলা সমাধানের মতো কোনো একক প্রযুক্তির প্রথম উপস্থিতির উপর নয়, বরং সিদ্ধান্ত মেশিনটি এই সকল ক্ষমতাগুলিকে প্রথমবারের মতো একটি খোলা বিশ্বের জন্য সিদ্ধান্ত গ্রহণের ফ্রেমওয়ার্কের মধ্যে একীভূত করেছে, যা সময়-সময়ে মডেলিং, পরিকল্পনা, সমাধান এবং ক্যালিব্রেশনের একটি সম্পূর্ণ বন্দনা গঠন করে।
“সাধারণ” বলতে বোঝায় যে এটি বিভিন্ন ক্ষেত্রের জটিল সিদ্ধান্ত নেওয়ার সমস্যাগুলিকে একটি সাধারণ কাঠামোতে সাজানোর চেষ্টা করে—বিশ্বের অবস্থা, অংশগ্রহণকারীরা, ক্রিয়াকলাপের স্থান, সীমাবদ্ধতা, বহু-পর্যায়ের মিথস্ক্রিয়া এবং অনিশ্চিত ফলাফল, এবং একই কাঠামোর মধ্যে ধারাবাহিকভাবে প্রতিফলন ও সমাধান খুঁজে বের করে।

টেকনিক্যাল রিপোর্টের ঠিকানা: https://chinaxiv.org/abs/202608.00064
৩ আগস্ট, ডেসিট্রন ডিসিশন মেশিনের পূর্ণাঙ্গ প্রযুক্তিগত রিপোর্ট প্রকাশিত হয়েছে, যা প্রথমবারের মতো তার তিনটি প্রধান প্রযুক্তিগত অবদান সম্পর্কে ব্যাপকভাবে প্রকাশ করেছে:
প্রথমত, একটি স্পষ্ট বিশ্ব মডেল MetaWorld প্রস্তাব করা হয়েছে, যা বহুস্রোত তথ্যকে সংগঠিত, স্থায়ী এবং গণনাযোগ্য বিশ্বের অবস্থা এবং কারণ-প্রভাব মডেলিংয়ে রূপান্তরিত করে; দ্বিতীয়ত, State–Action–Outcome (SAO) ফর্মালাইজেশন ব্যবহার করে জটিল সিদ্ধান্তকে গণনাযোগ্য এক্সপ্রেশন এবং যুক্তির রূপে রূপান্তরিত করা হয়; তৃতীয়ত, একটি মিশ্র যুক্তি আর্কিটেকচার AutoABM তৈরি করা হয়েছে, যা বহু-বুদ্ধিমত্তা সিমুলেশন, গেম রিজনিং এবং ফর্মাল অপটিমাইজেশনকে একীভূত করে, যা বহু-বুদ্ধিমত্তা সিদ্ধান্ত-প্রস্তাবনা সিস্টেমের উপর ভিত্তি করে গেম ইকুইলিব্রিয়াম, কৌশল পরিকল্পনা এবং সীমাবদ্ধতা-সন্তোষসহ জটিল সিদ্ধান্ত-সমস্যাগুলির সমাধান করে। এই তিনটি একসাথে AI সিস্টেমের একবারের বিচারকে বিশ্বের পরিবর্তনের সাথে সময়ের সাথে আপডেট হওয়া একটি গণনা এবং যুক্তির প্রক্রিয়ায় রূপান্তরিত করার লক্ষ্যে সিদ্ধান্ত-মেশিনের প্রযুক্তিগত ভিত্তি গঠন করে।
বাস্তব সিদ্ধান্তে এআইকে অংশগ্রহণ করার জন্য কী ধরনের আর্কিটেকচার প্রয়োজন?
বর্তমানে, «ডিসিশন সিমুলেশন» এর চারপাশে, AI-এর প্রয়োজনীয় কয়েকটি মূল ক্ষমতা (যেমন বিশ্ব মডেল, মাল্টি-এজেন্ট, গেম রিজনিং, সম্ভাব্যতা পূর্বানুমান) ধাপে ধাপে প্রকাশিত হয়েছে। প্রকৃত চ্যালেঞ্জটি হল: যখন AI একটি বন্ধ কার্য থেকে খোলা বাস্তব বিশ্বে প্রবেশ করে, তখন এই ক্ষমতাগুলি একটি একক, নিরন্তর আপডেট হওয়া বিশ্বের অবস্থার চারপাশে সমন্বিতভাবে কাজ করতে পারতে হবে, এবং শুধুমাত্র একটি Prompt-এর মধ্যে পরস্পরের সাথে স্বতন্ত্রভাবে বিশ্লেষণ দিয়ে সীমাবদ্ধ থাকা উচিত নয়।
প্রথমে ওয়ার্ল্ড মডেল দেখুন। ওয়ার্ল্ড মডেল উল্লেখ করলে মানুষ সহজেই Sora, World Labs, V-JEPA এর মতো দৃশ্য, স্থান, ভৌত বা রোবোটিক পরিবেশের জন্য উপযোগী ভৌত ওয়ার্ল্ড মডেলগুলির কথা ভাবে। কিন্তু ডিসিশন মেশিন দ্বারা প্রস্তাবিত MetaWorld বেশি জটিল সিদ্ধান্ত-গ্রহণের পরিস্থিতির দিকে মনোনিবেশ করে: অর্থনীতি, নীতি, প্রতিষ্ঠানের প্রতিযোগিতা, ভূ-রাজনীতি ইত্যাদি খোলা সিস্টেমগুলি; এই সিস্টেম মডেলিংয়ের মধ্যে অংশগ্রহণকারী, চলক, সম্পর্ক এবং সীমাবদ্ধতা আরও জটিল।
মেটাওয়ার্ল্ডকে একটি বিশ্ব মডেল হিসেবে সামাজিক ব্যবস্থার দিকে একটি বিস্তার হিসেবে দেখা যেতে পারে, যার জন্য তিনটি জটিল সমস্যা সমাধান করতে হবে: নিয়মের পার্থক্য, প্রতিফলন (কারণ এবং প্রভাবের মধ্যে দ্বিমুখী মিথস্ক্রিয়া, চক্রীয় প্রভাব) এবং সম্পূর্ণরূপে অপসারণযোগ্য নয় এমন অনিশ্চয়তা। এটি একটি সরাসরি প্রশ্নও তুলে ধরে: যদি বর্তমান বিশ্বের উপর আমাদের মূল্যায়নে কোনো বিভ্রান্তি থাকে, তাহলে পরবর্তী অনুমানগুলি কি বিভ্রান্তির দিকে নিয়ে যাবে?
সামাজিক সিস্টেমে প্রবেশ করার পর, শুধুমাত্র পরিবেশের অবস্থা বজায় রাখা যথেষ্ট নয়, AI-কে অন্যান্য অংশগ্রহণকারীদের কীভাবে আচরণ করছে তা বিচার করতে হবে। Meta-এর CICERO, পেকিং বিশ্ববিদ্যালয় ইত্যাদি দলগুলি যে Richelieu প্রস্তাব করেছে, তা সীমিত তথ্যের মধ্যে একাধিক Agent-এর মধ্যে মিথস্ক্রিয়া এবং গেম থিওরির ক্ষমতা প্রদর্শন করেছে; এবং খোলা বিশ্বের প্রকৃত সিদ্ধান্তের জন্য, সমস্ত পক্ষের কার্যকলাপকে সিমুলেট করার পরে, এখনও এই কৌশলগুলির সম্ভাব্যতা, গেমটি কোন্ সমতুল্যতার দিকে যাবে, এবং বিভিন্ন ভবিষ্যতের সম্ভাবনা এবং শর্তগুলির বিচার-বিনিময়ও করতে হবে।
এই ডিসিশন মেশিনের অর্থ এখানেই: এর মিক্সড রিজনিং আর্কিটেকচার AutoABM একই বাস্তবায়ন চেইনে LLM-এর সেমান্টিক বুঝতে পারা, SAO স্ট্রাকচার্ড রিপ্রেজেন্টেশন, মাল্টি-এজেন্ট মডেলিং এবং সিমুলেশন, এবং স্ট্র্যাটেজি রিজনিং ও অপ্টিমাইজেশনকে একত্রিত করে, যা “বিশ্বকে বুঝা — সিমুলেশন ও পরীক্ষা — সমাধানের জন্য সিদ্ধান্ত নেওয়া — ভবিষ্যত মূল্যায়ন” এই চারটি ধাপকে সংযুক্ত করে।
তথ্য থেকে ভবিষ্যতের দিকে, ডিসিশন মেশিন কীভাবে একটি জটিল পূর্বানুমান সম্পন্ন করে?
ডিসিশন মেশিন ইনপুট এবং টাস্ক, ডেটা এবং জ্ঞান, মডেলিং এবং ফর্মালাইজেশন, সিমুলেশন এবং রিজনিং, প্রেডিকশন এবং ক্যালিব্রেশন, রিপোর্টিং এবং এক্সপ্লানেশন—এই ছয়টি স্তর দ্বারা গঠিত, যা বাস্তব তথ্য থেকে ডিসিশন আউটপুটের পূর্ণাঙ্গ লিঙ্ক তৈরি করে।

পরবর্তীতে, আমরা "পরবর্তী ছয় মাসে, একটি জটিল বাণিজ্যিক সংঘাত কীভাবে বিকশিত হতে পারে?" এই কেসটি নিয়ে দেখব যে কীভাবে ডিসিশন মেশিনটি বাস্তব তথ্য থেকে শুরু করে বর্তমান বিশ্বের অবস্থা গঠন করে, সমস্ত পক্ষের কার্যকলাপ প্রতিকৃতি করে, ভবিষ্যতে সম্ভাব্য বিভিন্ন পথের প্রতিকৃতি করে, এবং এই পথগুলি কোন শর্তে ঘটতে পারে।
প্রথম ধাপ: ভবিষ্যতের পূর্বানুমান করার আগে প্রথমে বুঝে নিন যে “এখন কী ঘটছে” এবং কোন তথ্যগুলি বিশ্বাসযোগ্য।
বাস্তব বিশ্বের তথ্য বিশৃঙ্খল, পুনরাবৃত্ত বা পরস্পরবিরোধী হতে পারে, বা পুরনো হয়ে গেছে। ডিসিশন মেশিনটি প্রথমে ব্যবহারকারীর প্রশ্নটিকে একটি স্ট্রাকচার্ড টাস্কে রূপান্তরিত করে, যা স্পষ্টভাবে নির্ধারণ করে যে কী উত্তর দিতে হবে, কোন পক্ষগুলি জড়িত, কতক্ষণ পর্যবেক্ষণ করতে হবে, এবং কোন সীমাবদ্ধতা রয়েছে। উদাহরণস্বরূপ, সিস্টেমটি প্রথমে এই দ্বন্দ্বের প্রধান অংশগ্রহণকারীদের, সময়সীমা এবং বর্তমান বিতর্কের কেন্দ্রকে চিহ্নিত করে, তারপরে শুল্ক, সরবরাহ শৃঙ্খল, শিল্পনীতি, কোম্পানির আচরণসহ সম্ভাব্য পরিস্থিতির পরিবর্তনকে প্রভাবিত করতে পারে এমন শর্তগুলির সংগঠন করে। এরপর, এই উপাদানগুলির চারপাশে সংবাদপত্র, সোশ্যাল মিডিয়া, গবেষণা প্রতিবেদনসহ বিভিন্ন来源থেকে তথ্য সংগ্রহ করা হয়।

চিত্র 2: ডেটা প্রসেসিং প্রবাহচিত্র
সংগ্রহ করা তথ্য প্রথমে ডুপ্লিকেট সরানো, ক্লাস্টারিং এবং ইভেন্ট এক্সট্রাকশনের মাধ্যমে ইভেন্ট টাইমলাইন এবং আরও বিস্তারিত প্রমাণ ইউনিটের একটি সেটে সাজানো হয়। তারপর সিস্টেম Evidence Quality Score (EQS) ব্যবহার করে প্রতিটি তথ্যের গুণগত মান মূল্যায়ন করে, যা বর্তমান প্রশ্নের সাথে সম্পর্ক, উৎসের বিশ্বস্ততা, বিষয়বস্তুর সময়সীমা এবং পূর্ণতা, এবং বিভিন্ন উৎসের মধ্যে সামঞ্জস্যতা অন্তর্ভুক্ত করে। একইসাথে, প্রমাণের বিভিন্ন আত্মবিশ্বাসের মাত্রা অনুযায়ী তাদের গন্তব্য নির্ধারণ করা হয়, যেখানে উচ্চ আত্মবিশ্বাসযুক্ত প্রমাণগুলি সরাসরি পরবর্তী অনুমানের জন্য পাঠানো হয়।
যদি বর্তমান প্রমাণ অপর্যাপ্ত হয় বা বিভিন্ন উৎসের মধ্যে দ্বন্দ্ব থাকে, তবে সিস্টেম ReAct-এর উপর ভিত্তি করে বিকল্প যুক্তি এবং অনুসন্ধান চালিয়ে যায়, বর্তমান অভাবজনিত তথ্যের ভিত্তিতে পরবর্তী অনুসন্ধানকে সামঞ্জস্য করে এবং নতুনভাবে পাওয়া তথ্যগুলি বিদ্যমান সময়রেখায় যোগ করে।

চিত্র 3: ReAct-ভিত্তিক যুক্তি এবং অনুসন্ধানের পার্যায়ক্রমিক পদ্ধতি ব্যবহার করা
দ্বিতীয় ধাপ, ছাঁটাই করা তথ্যগুলিকে একটি স্থায়ীভাবে আপডেট হওয়া “বিশ্বের অবস্থা”-এ রূপান্তরিত করুন। তথ্যগুলি সিস্টেমকে বলে যে কী ঘটেছে, এরপর আরও নির্ণয় করতে হবে: এই পরিবর্তনগুলি একসাথে যোগ হয়ে, বর্তমানে বিশ্বটি কী অবস্থায় রয়েছে।
ডিসিশন মেশিন এই প্রক্রিয়াকে State–Action–Outcome (SAO) প্রতিনিধিত্ব করে ফর্মালাইজ করে, যেখানে State বর্তমান বিশ্বের অবস্থা বর্ণনা করে, Action প্রতিটি Agent-এর বর্তমান অবস্থায় গৃহীত কর্মগুলি রেকর্ড করে, এবং Outcome কর্মগুলির ফলে লাভ, ক্ষতি, খরচ এবং ঝুঁকি ইত্যাদি ফলাফলগুলি রেকর্ড করে। মনে রাখবেন, State ম্যাক্রো স্টেট এবং আরও সূক্ষ্ম, পরিমাপযোগ্য স্টেটে বিভক্ত। উদাহরণস্বরূপ, ঘর্ষণের উত্তেজনা একটি ম্যাক্রো স্টেট হতে পারে, যখন শুল্কের হার, পণ্যের দাম, সাপ্লাই চেইনের প্রভাবিত মাত্রা ইত্যাদি সূক্ষ্মতর স্টেট রেকর্ডে অন্তর্ভুক্ত হতে পারে।
এছাড়াও, সিস্টেমটি বাহ্যিক আঘাত, যেমন নীতির হঠাৎ পরিবর্তন, পরিবেশগত পরিবর্তন বা এজেন্ট দ্বারা নিয়ন্ত্রিত নয় এমন অন্যান্য ঘটনাগুলিকে আলাদাভাবে বিবেচনা করে। একটি কার্য এবং বাহ্যিক ঘটনার পর, বিশ্বের অবস্থা আপডেট হয়। আপডেটকৃত অবস্থাটি পরবর্তী কার্যের জন্য শুরু হয়। এভাবেই একটি নিরবচ্ছিন্ন SAO ট্রেজেক্টরি গঠিত হয়।

চিত্র 4: SAO প্রক্রিয়া
এই অবস্থাগুলি প্রকৃতপক্ষে বজায় রাখার দায়িত্ব পালন করে MetaWorld, যা একটি গণনা এবং আপডেটযোগ্য স্ট্রাকচারড ওয়ার্ল্ড স্টেট আউটপুট দেয়। অবস্থা তিনটি স্তরে বিভক্ত করা যায়: Environment Layer সমস্ত অংশগ্রহণকারীদের দ্বারা শেয়ার করা সামগ্রিক পরিবেশ, যেমন পরিস্থিতির পর্যায়, সম্পদের মূল্য ইত্যাদি রেকর্ড করে; Agent Metrics Layer প্রতিটি Agent-এর সম্পদ, ক্ষমতা এবং লক্ষ্যের অগ্রগতি রেকর্ড করে; Relationship Matrix Layer বিভিন্ন Agent-এর মধ্যে সম্পর্কের পরিবর্তন রেকর্ড করে।
MetaWorld এছাড়াও কারণগত DAG (Causal Directed Acyclic Graph) ব্যবহার করে অবস্থার পরিবর্তনকে সীমাবদ্ধ করে: ভেরিয়েবলগুলির মধ্যে সম্ভাব্য প্রভাবগুলি মডেলিং পর্যায়েই কারণগত গ্রাফে সংগঠিত হয়। প্রক্রিয়াকরণের সময়, সিস্টেম নোডের অবস্থা এবং কারণগত প্রান্তের ওজন আপডেট করে, কিন্তু প্রতিটি চক্রে নতুন কারণগত গ্রাফ তৈরি করে না।
এটি দীর্ঘমেয়াদী প্রেক্ষাপটে গণনার জন্য অত্যন্ত গুরুত্বপূর্ণ। পূর্ববর্তী পর্যায়ের ট্যারিফ পরিবর্তন মূল্যকে প্রভাবিত করে, যা আবার প্রতিষ্ঠানের বিকল্প এবং অন্যান্য অংশগ্রহণকারীদের প্রতিক্রিয়াকে পরিবর্তন করে, এবং এই পরিবর্তনগুলি পরবর্তী গণনার জন্য সংরক্ষণ করা প্রয়োজন। MetaWorld এই নিরন্তর আপডেট হওয়া “বিশ্ব লেজ”-এর দায়িত্ব বহন করে।
তৃতীয় ধাপে, বিশ্বের অবস্থা পাওয়ার পর বিভিন্ন এজেন্ট কাজ শুরু করে। প্রচলিত Agent-Based Modeling (ABM) সাধারণত বিশেষজ্ঞদের দ্বারা পূর্বনির্ধারিত অংশগ্রহণকারী, আচরণের নিয়ম, পরিবেশগত চলক এবং মিথস্ক্রিয়ার কাঠামো প্রয়োজন। অন্য একটি প্রশ্ন করলে, অনেককিছুকে আবার মডেল করতে হয়। ডিসিশন মেশিন দ্বারা প্রস্তাবিত AutoABM এই ধাপটিকে স্বয়ংক্রিয়ভাবে করে: প্রাকৃতিক ভাষার প্রশ্নের সামনে, সিস্টেমটি বাহ্যিক প্রমাণের সাথে মিলিয়ে অংশগ্রহণকারী, লক্ষ্য এবং সীমাবদ্ধতা, কর্মক্ষেত্র, পরিবেশগত চলক এবং কারণ-প্রভাব সম্পর্কগুলি চিহ্নিত করে, এবং তারপরে এইভাবে একটি মাল্টি-এজেন্ট সিমুলেশন পরিবেশ তৈরি করে।
একটি বাণিজ্যিক সংঘাতে একসাথে সরকার, কোম্পানি, শিল্প সংগঠন, ভোক্তা ইত্যাদি বিভিন্ন এজেন্ট থাকতে পারে, যাদের প্রত্যেকের নিজস্ব লক্ষ্য, সম্পদ, ঝুঁকির পছন্দ এবং অতিক্রম করা যাবে না এমন লাল রেখা রয়েছে। এই এজেন্টগুলির কোনো ঈশ্বরীয় দৃষ্টিভঙ্গি নেই, তারা শুধুমাত্র নিজেদের কাছে উপলব্ধ আংশিক তথ্যের ভিত্তিতে কাজ করে।
একটি কার্যক্রমের জন্য, এজেন্ট আগের ইন্টারঅ্যাকশন এবং ইতিহাস পর্যালোচনা করে, বর্তমান পরিস্থিতিতে সুযোগ, ঝুঁকি এবং সীমাবদ্ধতা চিহ্নিত করে, কয়েকটি বিকল্প কৌশল তৈরি করে এবং একটি বেছে নেয়। প্রতিটি চক্রে শুধুমাত্র একটি দিকেই এগিয়ে যায় না; সিস্টেম একসাথে বিভিন্ন বিশ্বের অবস্থা বিকাশ করে, যার মধ্যে রয়েছে আপেক্ষিকভাবে স্থিতিশীল সমতুল্য পথ, আশাবাদী বা নিষ্ঠুর বিকাশের দিক, এবং সম্ভাবনা কম কিন্তু ঘটলে পরিস্থিতির উল্লেখযোগ্যভাবে পরিবর্তন করে এমন উচ্চ-প্রভাবশালী শাখা। তারপরে এই পথগুলির বাছাই এবংযাচাইকরণ করা হয়, বিশ্বের অবস্থা আপডেট করা হয়, এবং পরবর্তী চক্রে যাওয়া হয়। যতক্ষণ সবাই কাজ করতে থাকবে, কিছু পথের প্রযোজ্যতা হারিয়ে যাবে, অন্যগুলিরও সম্ভাবনা বাড়বে।

চিত্র 5: এজেন্ট আচরণ প্যাটার্ন
বহু বুদ্ধিমত্তার সিমুলেশনের বাইরে, জটিল সিদ্ধান্তের জন্য একজন 'গাণিতিক বিচারক' প্রয়োজন। বহু বুদ্ধিমত্তা অনেকগুলি যুক্তিসঙ্গত ভবিষ্যতের পথ প্রস্তাব করতে পারে, কিন্তু ভাবা এবং করা দুটি আলাদা বিষয়; বাস্তব সিদ্ধান্ত বাজেট, সম্পদ, সময়, নীতির লাল রেখা, এবং বিভিন্ন পক্ষের ভারসাম্যপূর্ণ সম্পর্কের মতো কঠোর সীমাবদ্ধতার দ্বারা নিয়ন্ত্রিত হয়।
একটি ফর্মাল সলভার ক্ষমতা যুক্ত করা হয়েছে, যা ক্লাসিক্যাল গেম থিওরি, সম্পদ বন্টন ও অপ্টিমাইজেশন, পথ পরিকল্পনা ও শিডিউলিং, অনিশ্চয়তার অধীনে সম্ভাব্যতা উপসংহার এবং সীমাবদ্ধতা পূরণ—এই পাঁচটি ধরনের সমস্যা অন্তর্ভুক্ত করে। উদাহরণস্বরূপ, বাজেট সীমিত থাকলে সম্পদ কীভাবে বন্টন করা উচিত, একাধিক পক্ষের গেমে কী ধরনের সাম্যাবস্থা গঠিত হবে, এবং একটি কৌশল কি নির্ধারিত সীমানা অতিক্রম করে—এইসবই এই স্তরের গণনায় অন্তর্ভুক্ত হয়। গেম থিওরির ক্ষেত্রে, সিস্টেমটি 9টি ক্লাসিক্যাল অ্যাটমিক গেম—যেমন: প্রিজনার'স ডিলেমা, ডিয়ার-হান্টিং গেম, চিকেন গেম, জিরো-সাম গেম—এবং 144টি Robison–Goforth 2×2 গেম টপোলজির সমন্বয়ে গঠিত, যা বিভিন্ন গেম স্ট্রাকচারকে識別 এবং সমাধানের জন্য ব্যবহৃত হয়।
এই স্তরের মূল বিষয় হল বহু-বুদ্ধিমত্তা দ্বারা উত্পাদিত প্রতিটি প্রস্তাবিত কৌশলকে গণনামূলক খেলা, সীমাবদ্ধতা এবং অপটিমাইজেশনের কাঠামোতে ফিরিয়ে আনা, যাতে "অর্থপূর্ণ" হওয়াকে "ঔপচারিকভাবে যাচাইযোগ্য" এ পরিণত করা যায়।
টিএমজিবেঞ্চ বেঞ্চমার্কে মাল্টি-এজেন্ট গেম ক্ষমতা পরীক্ষার সময়, ডিসিশন মেশিনের সামঞ্জস্যতা সঠিকতা 99.4%, টপোলজি শনাক্তকরণ সঠিকতা 100%, গড় সমাধান সময় 0.8 সেকেন্ড, এবং ব্যাখ্যাযোগ্যতা স্কোর 4.3/5.0।

টেবিল ২: পাঁচটি প্রধান সমাধান সমস্যার ধরন
বহু-বুদ্ধিমত্তা সিমুলেশন এবং ফর্মাল সমাধানের ভূমিকা স্পষ্ট: প্রথমটি সম্ভাব্য পথগুলি বিস্তারিত করে; দ্বিতীয়টি এই পথগুলির সীমাবদ্ধতা এবং গেম স্ট্রাকচারের অধীনে স্থিতিশীলতা পরীক্ষা করে।
প্রাকৃতিক পরিকল্পনার শেষ ধাপে, এখনও একটি গুরুত্বপূর্ণ প্রশ্ন অবশিষ্ট রয়েছে: আগে উপস্থাপিত বিভিন্ন ভবিষ্যতের পথগুলির প্রতিটির সম্ভাবনা কতটা? এই জন্য, ডিসিশন মেশিনটি পূর্বানুমান এবং ক্যালিব্রেশন প্রক্রিয়া (Forecasting & Calibration) সেট করেছে।
পূর্বে প্রাপ্ত প্রার্থী পথগুলির ভিত্তিতে, এই স্তরটি এগুলির অনিশ্চয়তা আরও প্রক্রিয়া করে: সিস্টেমটি মডেলের যুক্তিসঙ্গত ফলাফল এবং বাহ্যিক ক্যালিব্রেশন সংকেতগুলি একত্রিত করে বিভিন্ন ফলাফলের জন্য সম্ভাবনা বরাদ্দ করে, এবং তারপর ভবিষ্যদ্বাণী বাজারের তথ্য, ইতিহাসগত ভবিষ্যদ্বাণীর কর্মক্ষমতা এবং সম্ভাবনা স্কোরিং নিয়মের মাধ্যমে এই সম্ভাবনাগুলি ক্যালিব্রেট করে। ডিসিশন মেশিনটি শুধুমাত্র “কী ঘটতে পারে” এর একটি তালিকা দেয়না; বিভিন্ন পথগুলির সাথে সংশ্লিষ্ট সম্ভাবনা মূল্যায়নও থাকে, এবং নতুন প্রমাণ এবং যুক্তির ফলাফলের সাথে সাথে এগুলি আপডেট হয়।
আমরা এটিকে একটি গতিশীলভাবে পরিবর্তনশীল "ভবিষ্যতের মানচিত্র" হিসাবে বুঝতে পারি: বাণিজ্যিক উত্তেজনা বাড়তে থাকা, দুই পক্ষের অস্থায়ী শান্তি, বা নতুন অপ্রত্যাশিত পরিবর্তন—এগুলি সম্ভাব্য বিভিন্ন শাখা হয়ে উঠতে পারে। সিস্টেমটি প্রতিটি পথের সম্ভাবনা এবং কোন পরিবর্তনগুলি কোন পথকে আরও সম্ভাব্য করে তুলবে তা মূল্যায়ন করে।

চিত্র 6: সম্ভাব্যতা পূর্বাভাস মডিউল
এইভাবে, ডিসিশন মেশিন একটি পূর্ণাঙ্গ সিদ্ধান্ত পরীক্ষা শৃঙ্খল তৈরি করেছে।
পরীক্ষামূলক যাচাই: এই সিদ্ধান্ত কাঠামোটি কি কার্যকর?
ডিসিশন মেশিনের ইনফারেন্স সিস্টেম পরীক্ষা করতে কয়েকটি পরীক্ষা ব্যবহার করা হয়েছে, যার মধ্যে সবচেয়ে গুরুত্বপূর্ণ হলো "ইভেন্ট সিমুলেশন এবং প্রোবাবিলিটি প্রেডিকশন" এর ফলাফল।
প্রথমে নিজস্ব তৈরি ইভেন্ট প্রেডিকশন সেটটি দেখুন, যাতে দেখা যায় কি স্ট্রাকচার্ড ইনফারেন্স ইভেন্ট প্রেডিকশনকে উন্নত করতে পারে। টিমটি 74টি ইভেন্ট এবং 370টি বাইনারি জাজমেন্ট প্রশ্ন সহ একটি ডেটাসেট তৈরি করেছে, যা বিভিন্ন উচ্চ অস্থিরতা ইভেন্ট ক্যাটাগরিগুলিকে কভার করে এবং বিভিন্ন প্রেডিকশন স্প্যানগুলিকে মূল্যায়নের জন্য অন্তর্ভুক্ত করে। টিমের মূল্যায়ন সেটআপের অধীনে, ডিসিশন মেশিনের সামগ্রিক ফলাফল 78.41%।
এছাড়াও, LLM-NEWS সেটিংয়ে, 3-30 দিনের শর্ট-টার্ম গ্রুপের জন্য ডিসিশন মেকার ফলাফল 72.80%, GPT-5.5 এবং Claude-4.7 যথাক্রমে 35.43% এবং 44.62%; মধ্যম এবং দীর্ঘমেয়াদীতে প্রবেশ করার পরে, এই পার্থক্য ধীরে ধীরে কমে যায়। অর্থাৎ, স্ট্রাকচার্ড রিজনিং দ্রুত পরিবর্তনশীল পরিস্থিতি এবং অতীতের নিয়মগুলির সাথে খাপ খাওয়ানোর কঠিন শর্ট-টার্ম পরিস্থিতিতে আপেক্ষিকভাবে বেশি সুবিধা প্রদান করে।

তারপরে পাবলিক প্রেডিকশন মার্কেট বেঞ্চমার্ক PolyBench-এ সম্পূরক পরীক্ষা।
ডিসিশন মেশিনের FFA (চূড়ান্ত পূর্বাভাস সঠিকতা) 81.20%, EVPA (প্রত্যাশিত ভোলাটিলিটি পূর্বাভাস সঠিকতা) 73.40%, এবং MSE (গড় বর্গ ত্রুটি) 0.822, যা Gemini-3-Flash, MiMo-V2-Flash এবং Grok-4.1-Fast-এর চেয়ে ভালো। এটি নির্দেশ করে যে, ডিসিশন মেশিন বাজারের সম্ভাবনার পরিবর্তনের দিক এবং সম্ভাবনা ত্রুটি নিয়ন্ত্রণে ভালো পারফরম্যান্স দেখিয়েছে।

ডিসিশন এআই, বড় মডেলের প্রতিযোগিতার একককে পরিবর্তন করছে
জেনারেটিভ এআই টোকেনকে মৌলিক গণনা একক হিসাবে ব্যবহার করে এবং “পরবর্তী অংশটি কীভাবে তৈরি করা হবে” সমস্যার সমাধান করে; ডিসিশন এআই তখন বিশ্বের অবস্থার পরিবর্তনকে মৌলিক গণনা বিষয় হিসাবে নেয় এবং “একটি কার্যক্রম পরবর্তী বিশ্বকে কীভাবে পরিবর্তন করবে” সমস্যার সমাধান করে। প্রথমটি শুধুমাত্র উত্তরটি যুক্তিসঙ্গত কিনা তা নিয়ে চিন্তা করে, দ্বিতীয়টির জন্য কারণ-প্রভাব, বাস্তবসম্মত সীমাবদ্ধতা, প্রতিপক্ষের প্রতিক্রিয়া এবং সম্ভাবনার পরিবর্তনও প্রক্রিয়াকরণ করতে হয়। এই দুটির মধ্যে সহজ দক্ষতা যোগের চেয়েও বেশি—এটি একটি গণনা পদ্ধতির পরিবর্তন।
বড় প্যারামিটার স্কেল এবং শক্তিশালী ভাষাগত ক্ষমতা দিয়ে কেবলমাত্র সিদ্ধান্ত নেওয়ার এআই স্বাভাবিকভাবেই উদ্ভূত হওয়া কঠিন। ওপেন ওয়ার্ল্ডে প্রবেশ করার পরে, বেসিক মডেলগুলি এখনও গুরুত্বপূর্ণ, কিন্তু এটি এখন সম্পূর্ণ সিস্টেমের অংশ হিসাবে পরিণত হচ্ছে। এআই-এর প্রতিযোগিতার এককও এখন একক মডেল থেকে সম্পূর্ণ সিস্টেমে পরিণত হচ্ছে।
ডিসিশন মেশিনের প্রযুক্তিগত অর্থ হলো, এটি অতীতের বিক্ষিপ্ত ক্ষমতাগুলিকে একটি সাধারণ সিদ্ধান্ত গঠনে সংগঠিত করে। যা “সাধারণ” বলা হয়, তার অর্থ সমস্ত ক্ষেত্রের ভবিষ্যতের পূর্বানুমান করা নয়, বরং বিভিন্ন ক্ষেত্রের সমস্যাগুলিকে অবস্থা, কার্য, ফলাফল, সীমাবদ্ধতা এবং অনিশ্চয়তায় রূপান্তরিত করা যায় এবং একই প্রক্রিয়াকরণ ও সমাধানের কাঠামোতে প্রবেশ করানো যায়।
এই দৃষ্টিকোণ থেকে, "বিশ্বের প্রথম সার্বজনীন সিদ্ধান্ত বড় মডেল" এর প্রকৃত মূল্য শুধুমাত্র একটি "প্রথম" দখল করার বিষয় নয়, বরং "সার্বজনীন সিদ্ধান্ত বড় মডেল" এর জন্য একটি পরিপূর্ণ প্রযুক্তিগত কাঠামো তৈরি করা: প্রকাশ্য অবস্থা দিয়ে বিশ্বকে বর্ণনা করা, একাধিক বুদ্ধিমত্তা ব্যবহার করে কার্যকলাপ পরিচালনা করা, গেম থিওরি এবং অপটিমাইজেশন ব্যবহার করে কৌশল পরীক্ষা করা, এবং সম্ভাবনা ব্যবহার করে ভিন্ন ভবিষ্যতের পথগুলি সমন্বয় করা। প্রতিটি পরিস্থিতিতে, AI-এর মূল্যায়নের মানদণ্ডও পরিবর্তিত হচ্ছে — শুধুমাত্র উত্তরটি সঠিক কিনা দেখা হচ্ছে না, বরং অবস্থা সামঞ্জস্যপূর্ণ কিনা, অনুমানগুলি পরীক্ষা করা যায় কিনা, সম্ভাবনা নির্ভরযোগ্য কিনা, এবং নতুন তথ্য আসলে সেগুলি দ্রুত আপডেট করা যায় কিনা।
কারণ, একটি ঠিক শোনায় এমন উত্তর অবশ্যই বাস্তবের পরিবর্তনের সাথে মানিয়ে নেওয়ার জন্য দৃঢ় সিদ্ধান্ত নয়।
এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন মাইন্ড" (ID: almosthuman2014) থেকে এসেছে, লেখক: ডিসিশন এআই-এর প্রতি মনোযোগী
