ডেসিট্রন: বিশ্বের প্রথম জেনারেল ডিসিশন-মেকিং এআই মডেল প্রকাশিত

icon MarsBit
শেয়ার
AI summary iconসারাংশ
মার্সবিটের অনুসারে, জংকে ওয়েঙে বিশ্বের প্রথম সাধারণ সিদ্ধান্ত গ্রহণ বড় মডেল ডেসিট্রন চালু করেছে। এই মডেলটি ওপেন-ওয়ার্ল্ড সিদ্ধান্তের জন্য বিশ্ব মডেলিং, মাল্টি-এজেন্ট সিমুলেশন এবং গেম-থিওরেটিক যুক্তি একত্রিত করে। এটি স্ট্রাকচার্ড স্টেট মডেলিংয়ের জন্য মেটাওয়ার্ল্ড, সিদ্ধান্ত প্রতিনিধিত্বের জন্য SAO এবং যুক্তির জন্য অটোএবিএম ব্যবহার করে। ডেসিট্রনকে বাণিজ্যিক সংঘাতের মতো জটিল পরিস্থিতি সিমুলেট করতে এবং ক্যালিব্রেটেড সম্ভাবনার সাথে ফলাফল মূল্যায়ন করতে প্রতিশ্রুতিবদ্ধ। CFT (টেররিজমের অর্থায়ন প্রতিরোধ) নিয়ে বাড়তি উদ্বেগের মধ্যেই এই প্রকাশ হয়েছে, যার তরলতা এবং ক্রিপ্টো বাজারের উপর প্রভাব রয়েছে।

উত্তর তৈরি করা এখন এআইয়ের একটি মৌলিক ক্ষমতা হয়ে উঠেছে, কিন্তু বাস্তব বিশ্বের প্রতিফলন করা হল পরবর্তী পর্যায়ের আরও কঠিন প্রশ্ন।

প্রকৃত সিদ্ধান্ত একটি স্থির প্রশ্নোত্তর নয়। এটি একটি নিয়মিত পরিবর্তনশীল, একাধিক পক্ষ একসাথে কাজ করে, তথ্য অপূর্ণ এবং অনিশ্চয়তায় ভরা বিশ্বে ঘটে।

যেমন একটি নতুন ওপেন-সোর্স মডেল হঠাৎ করে খরচ কমিয়ে দেয়, তখন শীর্ষস্থানীয় মডেল কোম্পানিগুলি কি দাম কমাতে পিছনে হবে, ক্লাউড প্রোভাইডার, ডেভেলপার এবং অ্যাপ্লিকেশন কোম্পানিগুলি কি পুনরায় দলবদল করবে? এই ধরনের সিদ্ধান্তগুলিতে, একপক্ষের কার্যকলাপ অন্যদের পরবর্তী পদক্ষেপের জন্য শর্তগুলি পরিবর্তন করে দেয়, এবং নতুন প্রতিক্রিয়াগুলি আবারও পরিস্থিতি পুনরায় লিখে ফেলে। এটি যেন সব খেলোয়াড়ই একসাথে চাল দেওয়ার একটি শত্রুতাপূর্ণ খেলা, যেখানে প্রতিটি চালের সাথেই খেলার অবস্থা পরিবর্তিত হয়।

এই প্রেক্ষাপটে, জংকে উনগে দ্বিতীয় সিদ্ধান্ত মেশিন Decitron (সংক্ষেপে সিদ্ধান্ত মেশিন) প্রকাশের পর, এটিকে অনেকগুলি প্রধান প্রযুক্তি মিডিয়া "বিশ্বের প্রথম সাধারণ সিদ্ধান্ত বড় মডেল" হিসাবে অভিহিত করেছে। এই উপাধির মূল জোর দেওয়া হয়েছে বিশ্ব মডেল, একাধিক বুদ্ধিমত্তা বা খেলা সমাধানের মতো কোনো একক প্রযুক্তির প্রথম উপস্থিতির উপর নয়, বরং সিদ্ধান্ত মেশিনটি এই সকল ক্ষমতাগুলিকে প্রথমবারের মতো একটি খোলা বিশ্বের জন্য সিদ্ধান্ত গ্রহণের ফ্রেমওয়ার্কের মধ্যে একীভূত করেছে, যা সময়-সময়ে মডেলিং, পরিকল্পনা, সমাধান এবং ক্যালিব্রেশনের একটি সম্পূর্ণ বন্দনা গঠন করে।

“সাধারণ” বলতে বোঝায় যে এটি বিভিন্ন ক্ষেত্রের জটিল সিদ্ধান্ত নেওয়ার সমস্যাগুলিকে একটি সাধারণ কাঠামোতে সাজানোর চেষ্টা করে—বিশ্বের অবস্থা, অংশগ্রহণকারীরা, ক্রিয়াকলাপের স্থান, সীমাবদ্ধতা, বহু-পর্যায়ের মিথস্ক্রিয়া এবং অনিশ্চিত ফলাফল, এবং একই কাঠামোর মধ্যে ধারাবাহিকভাবে প্রতিফলন ও সমাধান খুঁজে বের করে।

Zhongke Wenge

টেকনিক্যাল রিপোর্টের ঠিকানা: https://chinaxiv.org/abs/202608.00064

৩ আগস্ট, ডেসিট্রন ডিসিশন মেশিনের পূর্ণাঙ্গ প্রযুক্তিগত রিপোর্ট প্রকাশিত হয়েছে, যা প্রথমবারের মতো তার তিনটি প্রধান প্রযুক্তিগত অবদান সম্পর্কে ব্যাপকভাবে প্রকাশ করেছে:

প্রথমত, একটি স্পষ্ট বিশ্ব মডেল MetaWorld প্রস্তাব করা হয়েছে, যা বহুস্রোত তথ্যকে সংগঠিত, স্থায়ী এবং গণনাযোগ্য বিশ্বের অবস্থা এবং কারণ-প্রভাব মডেলিংয়ে রূপান্তরিত করে; দ্বিতীয়ত, State–Action–Outcome (SAO) ফর্মালাইজেশন ব্যবহার করে জটিল সিদ্ধান্তকে গণনাযোগ্য এক্সপ্রেশন এবং যুক্তির রূপে রূপান্তরিত করা হয়; তৃতীয়ত, একটি মিশ্র যুক্তি আর্কিটেকচার AutoABM তৈরি করা হয়েছে, যা বহু-বুদ্ধিমত্তা সিমুলেশন, গেম রিজনিং এবং ফর্মাল অপটিমাইজেশনকে একীভূত করে, যা বহু-বুদ্ধিমত্তা সিদ্ধান্ত-প্রস্তাবনা সিস্টেমের উপর ভিত্তি করে গেম ইকুইলিব্রিয়াম, কৌশল পরিকল্পনা এবং সীমাবদ্ধতা-সন্তোষসহ জটিল সিদ্ধান্ত-সমস্যাগুলির সমাধান করে। এই তিনটি একসাথে AI সিস্টেমের একবারের বিচারকে বিশ্বের পরিবর্তনের সাথে সময়ের সাথে আপডেট হওয়া একটি গণনা এবং যুক্তির প্রক্রিয়ায় রূপান্তরিত করার লক্ষ্যে সিদ্ধান্ত-মেশিনের প্রযুক্তিগত ভিত্তি গঠন করে।

বাস্তব সিদ্ধান্তে এআইকে অংশগ্রহণ করার জন্য কী ধরনের আর্কিটেকচার প্রয়োজন?

বর্তমানে, «ডিসিশন সিমুলেশন» এর চারপাশে, AI-এর প্রয়োজনীয় কয়েকটি মূল ক্ষমতা (যেমন বিশ্ব মডেল, মাল্টি-এজেন্ট, গেম রিজনিং, সম্ভাব্যতা পূর্বানুমান) ধাপে ধাপে প্রকাশিত হয়েছে। প্রকৃত চ্যালেঞ্জটি হল: যখন AI একটি বন্ধ কার্য থেকে খোলা বাস্তব বিশ্বে প্রবেশ করে, তখন এই ক্ষমতাগুলি একটি একক, নিরন্তর আপডেট হওয়া বিশ্বের অবস্থার চারপাশে সমন্বিতভাবে কাজ করতে পারতে হবে, এবং শুধুমাত্র একটি Prompt-এর মধ্যে পরস্পরের সাথে স্বতন্ত্রভাবে বিশ্লেষণ দিয়ে সীমাবদ্ধ থাকা উচিত নয়।

প্রথমে ওয়ার্ল্ড মডেল দেখুন। ওয়ার্ল্ড মডেল উল্লেখ করলে মানুষ সহজেই Sora, World Labs, V-JEPA এর মতো দৃশ্য, স্থান, ভৌত বা রোবোটিক পরিবেশের জন্য উপযোগী ভৌত ওয়ার্ল্ড মডেলগুলির কথা ভাবে। কিন্তু ডিসিশন মেশিন দ্বারা প্রস্তাবিত MetaWorld বেশি জটিল সিদ্ধান্ত-গ্রহণের পরিস্থিতির দিকে মনোনিবেশ করে: অর্থনীতি, নীতি, প্রতিষ্ঠানের প্রতিযোগিতা, ভূ-রাজনীতি ইত্যাদি খোলা সিস্টেমগুলি; এই সিস্টেম মডেলিংয়ের মধ্যে অংশগ্রহণকারী, চলক, সম্পর্ক এবং সীমাবদ্ধতা আরও জটিল।

মেটাওয়ার্ল্ডকে একটি বিশ্ব মডেল হিসেবে সামাজিক ব্যবস্থার দিকে একটি বিস্তার হিসেবে দেখা যেতে পারে, যার জন্য তিনটি জটিল সমস্যা সমাধান করতে হবে: নিয়মের পার্থক্য, প্রতিফলন (কারণ এবং প্রভাবের মধ্যে দ্বিমুখী মিথস্ক্রিয়া, চক্রীয় প্রভাব) এবং সম্পূর্ণরূপে অপসারণযোগ্য নয় এমন অনিশ্চয়তা। এটি একটি সরাসরি প্রশ্নও তুলে ধরে: যদি বর্তমান বিশ্বের উপর আমাদের মূল্যায়নে কোনো বিভ্রান্তি থাকে, তাহলে পরবর্তী অনুমানগুলি কি বিভ্রান্তির দিকে নিয়ে যাবে?

সামাজিক সিস্টেমে প্রবেশ করার পর, শুধুমাত্র পরিবেশের অবস্থা বজায় রাখা যথেষ্ট নয়, AI-কে অন্যান্য অংশগ্রহণকারীদের কীভাবে আচরণ করছে তা বিচার করতে হবে। Meta-এর CICERO, পেকিং বিশ্ববিদ্যালয় ইত্যাদি দলগুলি যে Richelieu প্রস্তাব করেছে, তা সীমিত তথ্যের মধ্যে একাধিক Agent-এর মধ্যে মিথস্ক্রিয়া এবং গেম থিওরির ক্ষমতা প্রদর্শন করেছে; এবং খোলা বিশ্বের প্রকৃত সিদ্ধান্তের জন্য, সমস্ত পক্ষের কার্যকলাপকে সিমুলেট করার পরে, এখনও এই কৌশলগুলির সম্ভাব্যতা, গেমটি কোন্‌ সমতুল্যতার দিকে যাবে, এবং বিভিন্ন ভবিষ্যতের সম্ভাবনা এবং শর্তগুলির বিচার-বিনিময়ও করতে হবে।

এই ডিসিশন মেশিনের অর্থ এখানেই: এর মিক্সড রিজনিং আর্কিটেকচার AutoABM একই বাস্তবায়ন চেইনে LLM-এর সেমান্টিক বুঝতে পারা, SAO স্ট্রাকচার্ড রিপ্রেজেন্টেশন, মাল্টি-এজেন্ট মডেলিং এবং সিমুলেশন, এবং স্ট্র্যাটেজি রিজনিং ও অপ্টিমাইজেশনকে একত্রিত করে, যা “বিশ্বকে বুঝা — সিমুলেশন ও পরীক্ষা — সমাধানের জন্য সিদ্ধান্ত নেওয়া — ভবিষ্যত মূল্যায়ন” এই চারটি ধাপকে সংযুক্ত করে।

তথ্য থেকে ভবিষ্যতের দিকে, ডিসিশন মেশিন কীভাবে একটি জটিল পূর্বানুমান সম্পন্ন করে?

ডিসিশন মেশিন ইনপুট এবং টাস্ক, ডেটা এবং জ্ঞান, মডেলিং এবং ফর্মালাইজেশন, সিমুলেশন এবং রিজনিং, প্রেডিকশন এবং ক্যালিব্রেশন, রিপোর্টিং এবং এক্সপ্লানেশন—এই ছয়টি স্তর দ্বারা গঠিত, যা বাস্তব তথ্য থেকে ডিসিশন আউটপুটের পূর্ণাঙ্গ লিঙ্ক তৈরি করে।

Zhongke Wenge

পরবর্তীতে, আমরা "পরবর্তী ছয় মাসে, একটি জটিল বাণিজ্যিক সংঘাত কীভাবে বিকশিত হতে পারে?" এই কেসটি নিয়ে দেখব যে কীভাবে ডিসিশন মেশিনটি বাস্তব তথ্য থেকে শুরু করে বর্তমান বিশ্বের অবস্থা গঠন করে, সমস্ত পক্ষের কার্যকলাপ প্রতিকৃতি করে, ভবিষ্যতে সম্ভাব্য বিভিন্ন পথের প্রতিকৃতি করে, এবং এই পথগুলি কোন শর্তে ঘটতে পারে।

প্রথম ধাপ: ভবিষ্যতের পূর্বানুমান করার আগে প্রথমে বুঝে নিন যে “এখন কী ঘটছে” এবং কোন তথ্যগুলি বিশ্বাসযোগ্য।

বাস্তব বিশ্বের তথ্য বিশৃঙ্খল, পুনরাবৃত্ত বা পরস্পরবিরোধী হতে পারে, বা পুরনো হয়ে গেছে। ডিসিশন মেশিনটি প্রথমে ব্যবহারকারীর প্রশ্নটিকে একটি স্ট্রাকচার্ড টাস্কে রূপান্তরিত করে, যা স্পষ্টভাবে নির্ধারণ করে যে কী উত্তর দিতে হবে, কোন পক্ষগুলি জড়িত, কতক্ষণ পর্যবেক্ষণ করতে হবে, এবং কোন সীমাবদ্ধতা রয়েছে। উদাহরণস্বরূপ, সিস্টেমটি প্রথমে এই দ্বন্দ্বের প্রধান অংশগ্রহণকারীদের, সময়সীমা এবং বর্তমান বিতর্কের কেন্দ্রকে চিহ্নিত করে, তারপরে শুল্ক, সরবরাহ শৃঙ্খল, শিল্পনীতি, কোম্পানির আচরণসহ সম্ভাব্য পরিস্থিতির পরিবর্তনকে প্রভাবিত করতে পারে এমন শর্তগুলির সংগঠন করে। এরপর, এই উপাদানগুলির চারপাশে সংবাদপত্র, সোশ্যাল মিডিয়া, গবেষণা প্রতিবেদনসহ বিভিন্ন来源থেকে তথ্য সংগ্রহ করা হয়।

Zhongke Wenge

চিত্র 2: ডেটা প্রসেসিং প্রবাহচিত্র

সংগ্রহ করা তথ্য প্রথমে ডুপ্লিকেট সরানো, ক্লাস্টারিং এবং ইভেন্ট এক্সট্রাকশনের মাধ্যমে ইভেন্ট টাইমলাইন এবং আরও বিস্তারিত প্রমাণ ইউনিটের একটি সেটে সাজানো হয়। তারপর সিস্টেম Evidence Quality Score (EQS) ব্যবহার করে প্রতিটি তথ্যের গুণগত মান মূল্যায়ন করে, যা বর্তমান প্রশ্নের সাথে সম্পর্ক, উৎসের বিশ্বস্ততা, বিষয়বস্তুর সময়সীমা এবং পূর্ণতা, এবং বিভিন্ন উৎসের মধ্যে সামঞ্জস্যতা অন্তর্ভুক্ত করে। একইসাথে, প্রমাণের বিভিন্ন আত্মবিশ্বাসের মাত্রা অনুযায়ী তাদের গন্তব্য নির্ধারণ করা হয়, যেখানে উচ্চ আত্মবিশ্বাসযুক্ত প্রমাণগুলি সরাসরি পরবর্তী অনুমানের জন্য পাঠানো হয়।

যদি বর্তমান প্রমাণ অপর্যাপ্ত হয় বা বিভিন্ন উৎসের মধ্যে দ্বন্দ্ব থাকে, তবে সিস্টেম ReAct-এর উপর ভিত্তি করে বিকল্প যুক্তি এবং অনুসন্ধান চালিয়ে যায়, বর্তমান অভাবজনিত তথ্যের ভিত্তিতে পরবর্তী অনুসন্ধানকে সামঞ্জস্য করে এবং নতুনভাবে পাওয়া তথ্যগুলি বিদ্যমান সময়রেখায় যোগ করে।

Zhongke Wenge

চিত্র 3: ReAct-ভিত্তিক যুক্তি এবং অনুসন্ধানের পার্যায়ক্রমিক পদ্ধতি ব্যবহার করা

দ্বিতীয় ধাপ, ছাঁটাই করা তথ্যগুলিকে একটি স্থায়ীভাবে আপডেট হওয়া “বিশ্বের অবস্থা”-এ রূপান্তরিত করুন। তথ্যগুলি সিস্টেমকে বলে যে কী ঘটেছে, এরপর আরও নির্ণয় করতে হবে: এই পরিবর্তনগুলি একসাথে যোগ হয়ে, বর্তমানে বিশ্বটি কী অবস্থায় রয়েছে।

ডিসিশন মেশিন এই প্রক্রিয়াকে State–Action–Outcome (SAO) প্রতিনিধিত্ব করে ফর্মালাইজ করে, যেখানে State বর্তমান বিশ্বের অবস্থা বর্ণনা করে, Action প্রতিটি Agent-এর বর্তমান অবস্থায় গৃহীত কর্মগুলি রেকর্ড করে, এবং Outcome কর্মগুলির ফলে লাভ, ক্ষতি, খরচ এবং ঝুঁকি ইত্যাদি ফলাফলগুলি রেকর্ড করে। মনে রাখবেন, State ম্যাক্রো স্টেট এবং আরও সূক্ষ্ম, পরিমাপযোগ্য স্টেটে বিভক্ত। উদাহরণস্বরূপ, ঘর্ষণের উত্তেজনা একটি ম্যাক্রো স্টেট হতে পারে, যখন শুল্কের হার, পণ্যের দাম, সাপ্লাই চেইনের প্রভাবিত মাত্রা ইত্যাদি সূক্ষ্মতর স্টেট রেকর্ডে অন্তর্ভুক্ত হতে পারে।

এছাড়াও, সিস্টেমটি বাহ্যিক আঘাত, যেমন নীতির হঠাৎ পরিবর্তন, পরিবেশগত পরিবর্তন বা এজেন্ট দ্বারা নিয়ন্ত্রিত নয় এমন অন্যান্য ঘটনাগুলিকে আলাদাভাবে বিবেচনা করে। একটি কার্য এবং বাহ্যিক ঘটনার পর, বিশ্বের অবস্থা আপডেট হয়। আপডেটকৃত অবস্থাটি পরবর্তী কার্যের জন্য শুরু হয়। এভাবেই একটি নিরবচ্ছিন্ন SAO ট্রেজেক্টরি গঠিত হয়।

Zhongke Wenge

চিত্র 4: SAO প্রক্রিয়া

এই অবস্থাগুলি প্রকৃতপক্ষে বজায় রাখার দায়িত্ব পালন করে MetaWorld, যা একটি গণনা এবং আপডেটযোগ্য স্ট্রাকচারড ওয়ার্ল্ড স্টেট আউটপুট দেয়। অবস্থা তিনটি স্তরে বিভক্ত করা যায়: Environment Layer সমস্ত অংশগ্রহণকারীদের দ্বারা শেয়ার করা সামগ্রিক পরিবেশ, যেমন পরিস্থিতির পর্যায়, সম্পদের মূল্য ইত্যাদি রেকর্ড করে; Agent Metrics Layer প্রতিটি Agent-এর সম্পদ, ক্ষমতা এবং লক্ষ্যের অগ্রগতি রেকর্ড করে; Relationship Matrix Layer বিভিন্ন Agent-এর মধ্যে সম্পর্কের পরিবর্তন রেকর্ড করে।

MetaWorld এছাড়াও কারণগত DAG (Causal Directed Acyclic Graph) ব্যবহার করে অবস্থার পরিবর্তনকে সীমাবদ্ধ করে: ভেরিয়েবলগুলির মধ্যে সম্ভাব্য প্রভাবগুলি মডেলিং পর্যায়েই কারণগত গ্রাফে সংগঠিত হয়। প্রক্রিয়াকরণের সময়, সিস্টেম নোডের অবস্থা এবং কারণগত প্রান্তের ওজন আপডেট করে, কিন্তু প্রতিটি চক্রে নতুন কারণগত গ্রাফ তৈরি করে না।

এটি দীর্ঘমেয়াদী প্রেক্ষাপটে গণনার জন্য অত্যন্ত গুরুত্বপূর্ণ। পূর্ববর্তী পর্যায়ের ট্যারিফ পরিবর্তন মূল্যকে প্রভাবিত করে, যা আবার প্রতিষ্ঠানের বিকল্প এবং অন্যান্য অংশগ্রহণকারীদের প্রতিক্রিয়াকে পরিবর্তন করে, এবং এই পরিবর্তনগুলি পরবর্তী গণনার জন্য সংরক্ষণ করা প্রয়োজন। MetaWorld এই নিরন্তর আপডেট হওয়া “বিশ্ব লেজ”-এর দায়িত্ব বহন করে।

তৃতীয় ধাপে, বিশ্বের অবস্থা পাওয়ার পর বিভিন্ন এজেন্ট কাজ শুরু করে। প্রচলিত Agent-Based Modeling (ABM) সাধারণত বিশেষজ্ঞদের দ্বারা পূর্বনির্ধারিত অংশগ্রহণকারী, আচরণের নিয়ম, পরিবেশগত চলক এবং মিথস্ক্রিয়ার কাঠামো প্রয়োজন। অন্য একটি প্রশ্ন করলে, অনেককিছুকে আবার মডেল করতে হয়। ডিসিশন মেশিন দ্বারা প্রস্তাবিত AutoABM এই ধাপটিকে স্বয়ংক্রিয়ভাবে করে: প্রাকৃতিক ভাষার প্রশ্নের সামনে, সিস্টেমটি বাহ্যিক প্রমাণের সাথে মিলিয়ে অংশগ্রহণকারী, লক্ষ্য এবং সীমাবদ্ধতা, কর্মক্ষেত্র, পরিবেশগত চলক এবং কারণ-প্রভাব সম্পর্কগুলি চিহ্নিত করে, এবং তারপরে এইভাবে একটি মাল্টি-এজেন্ট সিমুলেশন পরিবেশ তৈরি করে।

একটি বাণিজ্যিক সংঘাতে একসাথে সরকার, কোম্পানি, শিল্প সংগঠন, ভোক্তা ইত্যাদি বিভিন্ন এজেন্ট থাকতে পারে, যাদের প্রত্যেকের নিজস্ব লক্ষ্য, সম্পদ, ঝুঁকির পছন্দ এবং অতিক্রম করা যাবে না এমন লাল রেখা রয়েছে। এই এজেন্টগুলির কোনো ঈশ্বরীয় দৃষ্টিভঙ্গি নেই, তারা শুধুমাত্র নিজেদের কাছে উপলব্ধ আংশিক তথ্যের ভিত্তিতে কাজ করে।

একটি কার্যক্রমের জন্য, এজেন্ট আগের ইন্টারঅ্যাকশন এবং ইতিহাস পর্যালোচনা করে, বর্তমান পরিস্থিতিতে সুযোগ, ঝুঁকি এবং সীমাবদ্ধতা চিহ্নিত করে, কয়েকটি বিকল্প কৌশল তৈরি করে এবং একটি বেছে নেয়। প্রতিটি চক্রে শুধুমাত্র একটি দিকেই এগিয়ে যায় না; সিস্টেম একসাথে বিভিন্ন বিশ্বের অবস্থা বিকাশ করে, যার মধ্যে রয়েছে আপেক্ষিকভাবে স্থিতিশীল সমতুল্য পথ, আশাবাদী বা নিষ্ঠুর বিকাশের দিক, এবং সম্ভাবনা কম কিন্তু ঘটলে পরিস্থিতির উল্লেখযোগ্যভাবে পরিবর্তন করে এমন উচ্চ-প্রভাবশালী শাখা। তারপরে এই পথগুলির বাছাই এবংযাচাইকরণ করা হয়, বিশ্বের অবস্থা আপডেট করা হয়, এবং পরবর্তী চক্রে যাওয়া হয়। যতক্ষণ সবাই কাজ করতে থাকবে, কিছু পথের প্রযোজ্যতা হারিয়ে যাবে, অন্যগুলিরও সম্ভাবনা বাড়বে।

Zhongke Wenge

চিত্র 5: এজেন্ট আচরণ প্যাটার্ন

বহু বুদ্ধিমত্তার সিমুলেশনের বাইরে, জটিল সিদ্ধান্তের জন্য একজন 'গাণিতিক বিচারক' প্রয়োজন। বহু বুদ্ধিমত্তা অনেকগুলি যুক্তিসঙ্গত ভবিষ্যতের পথ প্রস্তাব করতে পারে, কিন্তু ভাবা এবং করা দুটি আলাদা বিষয়; বাস্তব সিদ্ধান্ত বাজেট, সম্পদ, সময়, নীতির লাল রেখা, এবং বিভিন্ন পক্ষের ভারসাম্যপূর্ণ সম্পর্কের মতো কঠোর সীমাবদ্ধতার দ্বারা নিয়ন্ত্রিত হয়।

একটি ফর্মাল সলভার ক্ষমতা যুক্ত করা হয়েছে, যা ক্লাসিক্যাল গেম থিওরি, সম্পদ বন্টন ও অপ্টিমাইজেশন, পথ পরিকল্পনা ও শিডিউলিং, অনিশ্চয়তার অধীনে সম্ভাব্যতা উপসংহার এবং সীমাবদ্ধতা পূরণ—এই পাঁচটি ধরনের সমস্যা অন্তর্ভুক্ত করে। উদাহরণস্বরূপ, বাজেট সীমিত থাকলে সম্পদ কীভাবে বন্টন করা উচিত, একাধিক পক্ষের গেমে কী ধরনের সাম্যাবস্থা গঠিত হবে, এবং একটি কৌশল কি নির্ধারিত সীমানা অতিক্রম করে—এইসবই এই স্তরের গণনায় অন্তর্ভুক্ত হয়। গেম থিওরির ক্ষেত্রে, সিস্টেমটি 9টি ক্লাসিক্যাল অ্যাটমিক গেম—যেমন: প্রিজনার'স ডিলেমা, ডিয়ার-হান্টিং গেম, চিকেন গেম, জিরো-সাম গেম—এবং 144টি Robison–Goforth 2×2 গেম টপোলজির সমন্বয়ে গঠিত, যা বিভিন্ন গেম স্ট্রাকচারকে識別 এবং সমাধানের জন্য ব্যবহৃত হয়।

এই স্তরের মূল বিষয় হল বহু-বুদ্ধিমত্তা দ্বারা উত্পাদিত প্রতিটি প্রস্তাবিত কৌশলকে গণনামূলক খেলা, সীমাবদ্ধতা এবং অপটিমাইজেশনের কাঠামোতে ফিরিয়ে আনা, যাতে "অর্থপূর্ণ" হওয়াকে "ঔপচারিকভাবে যাচাইযোগ্য" এ পরিণত করা যায়।

টিএমজিবেঞ্চ বেঞ্চমার্কে মাল্টি-এজেন্ট গেম ক্ষমতা পরীক্ষার সময়, ডিসিশন মেশিনের সামঞ্জস্যতা সঠিকতা 99.4%, টপোলজি শনাক্তকরণ সঠিকতা 100%, গড় সমাধান সময় 0.8 সেকেন্ড, এবং ব্যাখ্যাযোগ্যতা স্কোর 4.3/5.0।

Zhongke Wenge

টেবিল ২: পাঁচটি প্রধান সমাধান সমস্যার ধরন

বহু-বুদ্ধিমত্তা সিমুলেশন এবং ফর্মাল সমাধানের ভূমিকা স্পষ্ট: প্রথমটি সম্ভাব্য পথগুলি বিস্তারিত করে; দ্বিতীয়টি এই পথগুলির সীমাবদ্ধতা এবং গেম স্ট্রাকচারের অধীনে স্থিতিশীলতা পরীক্ষা করে।

প্রাকৃতিক পরিকল্পনার শেষ ধাপে, এখনও একটি গুরুত্বপূর্ণ প্রশ্ন অবশিষ্ট রয়েছে: আগে উপস্থাপিত বিভিন্ন ভবিষ্যতের পথগুলির প্রতিটির সম্ভাবনা কতটা? এই জন্য, ডিসিশন মেশিনটি পূর্বানুমান এবং ক্যালিব্রেশন প্রক্রিয়া (Forecasting & Calibration) সেট করেছে।

পূর্বে প্রাপ্ত প্রার্থী পথগুলির ভিত্তিতে, এই স্তরটি এগুলির অনিশ্চয়তা আরও প্রক্রিয়া করে: সিস্টেমটি মডেলের যুক্তিসঙ্গত ফলাফল এবং বাহ্যিক ক্যালিব্রেশন সংকেতগুলি একত্রিত করে বিভিন্ন ফলাফলের জন্য সম্ভাবনা বরাদ্দ করে, এবং তারপর ভবিষ্যদ্বাণী বাজারের তথ্য, ইতিহাসগত ভবিষ্যদ্বাণীর কর্মক্ষমতা এবং সম্ভাবনা স্কোরিং নিয়মের মাধ্যমে এই সম্ভাবনাগুলি ক্যালিব্রেট করে। ডিসিশন মেশিনটি শুধুমাত্র “কী ঘটতে পারে” এর একটি তালিকা দেয়না; বিভিন্ন পথগুলির সাথে সংশ্লিষ্ট সম্ভাবনা মূল্যায়নও থাকে, এবং নতুন প্রমাণ এবং যুক্তির ফলাফলের সাথে সাথে এগুলি আপডেট হয়।

আমরা এটিকে একটি গতিশীলভাবে পরিবর্তনশীল "ভবিষ্যতের মানচিত্র" হিসাবে বুঝতে পারি: বাণিজ্যিক উত্তেজনা বাড়তে থাকা, দুই পক্ষের অস্থায়ী শান্তি, বা নতুন অপ্রত্যাশিত পরিবর্তন—এগুলি সম্ভাব্য বিভিন্ন শাখা হয়ে উঠতে পারে। সিস্টেমটি প্রতিটি পথের সম্ভাবনা এবং কোন পরিবর্তনগুলি কোন পথকে আরও সম্ভাব্য করে তুলবে তা মূল্যায়ন করে।

Zhongke Wenge

চিত্র 6: সম্ভাব্যতা পূর্বাভাস মডিউল

এইভাবে, ডিসিশন মেশিন একটি পূর্ণাঙ্গ সিদ্ধান্ত পরীক্ষা শৃঙ্খল তৈরি করেছে।

পরীক্ষামূলক যাচাই: এই সিদ্ধান্ত কাঠামোটি কি কার্যকর?

ডিসিশন মেশিনের ইনফারেন্স সিস্টেম পরীক্ষা করতে কয়েকটি পরীক্ষা ব্যবহার করা হয়েছে, যার মধ্যে সবচেয়ে গুরুত্বপূর্ণ হলো "ইভেন্ট সিমুলেশন এবং প্রোবাবিলিটি প্রেডিকশন" এর ফলাফল।

প্রথমে নিজস্ব তৈরি ইভেন্ট প্রেডিকশন সেটটি দেখুন, যাতে দেখা যায় কি স্ট্রাকচার্ড ইনফারেন্স ইভেন্ট প্রেডিকশনকে উন্নত করতে পারে। টিমটি 74টি ইভেন্ট এবং 370টি বাইনারি জাজমেন্ট প্রশ্ন সহ একটি ডেটাসেট তৈরি করেছে, যা বিভিন্ন উচ্চ অস্থিরতা ইভেন্ট ক্যাটাগরিগুলিকে কভার করে এবং বিভিন্ন প্রেডিকশন স্প্যানগুলিকে মূল্যায়নের জন্য অন্তর্ভুক্ত করে। টিমের মূল্যায়ন সেটআপের অধীনে, ডিসিশন মেশিনের সামগ্রিক ফলাফল 78.41%।

এছাড়াও, LLM-NEWS সেটিংয়ে, 3-30 দিনের শর্ট-টার্ম গ্রুপের জন্য ডিসিশন মেকার ফলাফল 72.80%, GPT-5.5 এবং Claude-4.7 যথাক্রমে 35.43% এবং 44.62%; মধ্যম এবং দীর্ঘমেয়াদীতে প্রবেশ করার পরে, এই পার্থক্য ধীরে ধীরে কমে যায়। অর্থাৎ, স্ট্রাকচার্ড রিজনিং দ্রুত পরিবর্তনশীল পরিস্থিতি এবং অতীতের নিয়মগুলির সাথে খাপ খাওয়ানোর কঠিন শর্ট-টার্ম পরিস্থিতিতে আপেক্ষিকভাবে বেশি সুবিধা প্রদান করে।

Zhongke Wenge

তারপরে পাবলিক প্রেডিকশন মার্কেট বেঞ্চমার্ক PolyBench-এ সম্পূরক পরীক্ষা।

ডিসিশন মেশিনের FFA (চূড়ান্ত পূর্বাভাস সঠিকতা) 81.20%, EVPA (প্রত্যাশিত ভোলাটিলিটি পূর্বাভাস সঠিকতা) 73.40%, এবং MSE (গড় বর্গ ত্রুটি) 0.822, যা Gemini-3-Flash, MiMo-V2-Flash এবং Grok-4.1-Fast-এর চেয়ে ভালো। এটি নির্দেশ করে যে, ডিসিশন মেশিন বাজারের সম্ভাবনার পরিবর্তনের দিক এবং সম্ভাবনা ত্রুটি নিয়ন্ত্রণে ভালো পারফরম্যান্স দেখিয়েছে।

Zhongke Wenge

ডিসিশন এআই, বড় মডেলের প্রতিযোগিতার একককে পরিবর্তন করছে

জেনারেটিভ এআই টোকেনকে মৌলিক গণনা একক হিসাবে ব্যবহার করে এবং “পরবর্তী অংশটি কীভাবে তৈরি করা হবে” সমস্যার সমাধান করে; ডিসিশন এআই তখন বিশ্বের অবস্থার পরিবর্তনকে মৌলিক গণনা বিষয় হিসাবে নেয় এবং “একটি কার্যক্রম পরবর্তী বিশ্বকে কীভাবে পরিবর্তন করবে” সমস্যার সমাধান করে। প্রথমটি শুধুমাত্র উত্তরটি যুক্তিসঙ্গত কিনা তা নিয়ে চিন্তা করে, দ্বিতীয়টির জন্য কারণ-প্রভাব, বাস্তবসম্মত সীমাবদ্ধতা, প্রতিপক্ষের প্রতিক্রিয়া এবং সম্ভাবনার পরিবর্তনও প্রক্রিয়াকরণ করতে হয়। এই দুটির মধ্যে সহজ দক্ষতা যোগের চেয়েও বেশি—এটি একটি গণনা পদ্ধতির পরিবর্তন।

বড় প্যারামিটার স্কেল এবং শক্তিশালী ভাষাগত ক্ষমতা দিয়ে কেবলমাত্র সিদ্ধান্ত নেওয়ার এআই স্বাভাবিকভাবেই উদ্ভূত হওয়া কঠিন। ওপেন ওয়ার্ল্ডে প্রবেশ করার পরে, বেসিক মডেলগুলি এখনও গুরুত্বপূর্ণ, কিন্তু এটি এখন সম্পূর্ণ সিস্টেমের অংশ হিসাবে পরিণত হচ্ছে। এআই-এর প্রতিযোগিতার এককও এখন একক মডেল থেকে সম্পূর্ণ সিস্টেমে পরিণত হচ্ছে।

ডিসিশন মেশিনের প্রযুক্তিগত অর্থ হলো, এটি অতীতের বিক্ষিপ্ত ক্ষমতাগুলিকে একটি সাধারণ সিদ্ধান্ত গঠনে সংগঠিত করে। যা “সাধারণ” বলা হয়, তার অর্থ সমস্ত ক্ষেত্রের ভবিষ্যতের পূর্বানুমান করা নয়, বরং বিভিন্ন ক্ষেত্রের সমস্যাগুলিকে অবস্থা, কার্য, ফলাফল, সীমাবদ্ধতা এবং অনিশ্চয়তায় রূপান্তরিত করা যায় এবং একই প্রক্রিয়াকরণ ও সমাধানের কাঠামোতে প্রবেশ করানো যায়।

এই দৃষ্টিকোণ থেকে, "বিশ্বের প্রথম সার্বজনীন সিদ্ধান্ত বড় মডেল" এর প্রকৃত মূল্য শুধুমাত্র একটি "প্রথম" দখল করার বিষয় নয়, বরং "সার্বজনীন সিদ্ধান্ত বড় মডেল" এর জন্য একটি পরিপূর্ণ প্রযুক্তিগত কাঠামো তৈরি করা: প্রকাশ্য অবস্থা দিয়ে বিশ্বকে বর্ণনা করা, একাধিক বুদ্ধিমত্তা ব্যবহার করে কার্যকলাপ পরিচালনা করা, গেম থিওরি এবং অপটিমাইজেশন ব্যবহার করে কৌশল পরীক্ষা করা, এবং সম্ভাবনা ব্যবহার করে ভিন্ন ভবিষ্যতের পথগুলি সমন্বয় করা। প্রতিটি পরিস্থিতিতে, AI-এর মূল্যায়নের মানদণ্ডও পরিবর্তিত হচ্ছে — শুধুমাত্র উত্তরটি সঠিক কিনা দেখা হচ্ছে না, বরং অবস্থা সামঞ্জস্যপূর্ণ কিনা, অনুমানগুলি পরীক্ষা করা যায় কিনা, সম্ভাবনা নির্ভরযোগ্য কিনা, এবং নতুন তথ্য আসলে সেগুলি দ্রুত আপডেট করা যায় কিনা।

কারণ, একটি ঠিক শোনায় এমন উত্তর অবশ্যই বাস্তবের পরিবর্তনের সাথে মানিয়ে নেওয়ার জন্য দৃঢ় সিদ্ধান্ত নয়।

এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন মাইন্ড" (ID: almosthuman2014) থেকে এসেছে, লেখক: ডিসিশন এআই-এর প্রতি মনোযোগী

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।