এআই শিক্ষক এখন অনেকগুলি একক শিক্ষামূলক কাজ সম্পন্ন করতে পারে।
একটি গণিতের সমস্যা, এটি ধাপে ধাপে বিশ্লেষণ করতে পারে; একটি ইংরেজি রচনা, এটি ব্যাকরণগত ত্রুটি চিহ্নিত করতে পারে; একটি শতরঞ্জের খেলা, এটি পরবর্তী পদক্ষেপের ধারণা ব্যাখ্যা করতে পারে। অনেক পরিস্থিতিতে, মডেলের আউটপুট ইতিমধ্যেই একজন ধৈর্যশীল সহায়কের মতো।
কিন্তু শিক্ষার ফলাফল শুধু শিক্ষকের দিক থেকে দেখা যায় না। ছাত্ররা শুনে কি ভুলগুলি সংশোধন করেছে, কি শুধু সূচনা অনুসরণ করেছে, একই ব্যাখ্যা ভিন্ন ভিন্ন ছাত্রদের উপর কি ভিন্ন প্রভাব ফেলেছে—এগুলি সবই ছাত্রদের দিকে ঘটেছে।
একজন এআই শিক্ষক যদি ব্যক্তিগতকৃত নির্দেশনা শিখতে চায়, তবে তাকে ছাত্রদের প্রতিক্রিয়া পুনরাবৃত্তি করে পর্যবেক্ষণ করতে হবে।
বাস্তবে, এই প্রতিক্রিয়াগুলি মূলত human study থেকে আসে। প্রতিবার শিক্ষার কৌশল সামঞ্জস্য করার জন্য, শিক্ষার্থীদের অংশগ্রহণ করানো হয়, ইন্টারঅ্যাকশন সংগ্রহ করা হয়, এবং তারপর মানবিকভাবে মূল্যায়ন করা হয়।
এআই মডেলগুলি দ্রুত আপডেট করা যায়, তবে শিক্ষামূলক ফিডব্যাক পাওয়ার গতি মানব অধ্যয়ন পরীক্ষার চক্রের সীমাবদ্ধতার কারণে।

এআই টিউটর শিক্ষার উন্নতির জন্য শিক্ষার্থীদের ফিডব্যাক প্রয়োজন, কিন্তু প্রকৃত ফিডব্যাক সংগ্রহের খরচ বেশি। স্টুডেন্টসিম প্রকৃত শিক্ষার্থীদের রেকর্ডকে প্রশিক্ষণ পর্যায়ে বারবার ব্যবহারযোগ্য এজেন্ট ফিডব্যাকে রূপান্তরিত করতে চায়।
সাম্প্রতিক গবেষণা StudentSim-এর দিকে নিয়ে যায়, এই বিরোধ থেকে।
গবেষণা দল চায় যে AI শিক্ষককে আরও উন্নত করা হোক যাতে এটি শিক্ষার্থীদের শক্তি ও দুর্বলতা বুঝতে পারে এবং বিভিন্ন শিক্ষার্থীদের জন্য উপযুক্ত পরামর্শ দিতে পারে। এই প্রক্রিয়ায়, দলটি সমস্যাটিকে শিক্ষার্থী সিমুলেটরের দিকে নিয়ে আসে: কি সম্ভব যে প্রকৃত শিক্ষার্থীর ডেটা ব্যবহার করে একটি মূল্যায়নযোগ্য, পুনরায় ব্যবহারযোগ্য AI শিক্ষার্থী তৈরি করা যায়, যাতে AI শিক্ষক প্রশিক্ষণের সময় আরও বেশি ফিডব্যাক পায়?

পেপার লিঙ্ক: https://arxiv.org/abs/2609.01591
কোড লিঙ্ক: https://github.com/microsoft/StudentSim
হাগিংফেস পেপার হোমপেজ: https://huggingface.co/papers/2609.01591
আজকের এআই এজেন্ট গবেষণায় এই বিষয়টি একা নয়। ইউজার সিমুলেটর এখন জনপ্রিয় গবেষণার দিক হয়ে উঠেছে, যা কাস্টমার সার্ভিস, ই-কমার্স, চিকিৎসা পরামর্শ এবং ওয়েবসাইট অপারেশনের মতো পরিস্থিতিতে ব্যবহার করা হচ্ছে। গবেষকরা সিমুলেটেড ইউজার তৈরি করেন, যাতে এজেন্টগুলি লাইভের আগে বেশি ইন্টারঅ্যাকশনের মধ্যে দিয়ে যায়, এবং স্ট্র্যাটেজি, কথোপকথন এবং দৃঢ়তা পরীক্ষা করা যায়।
শিক্ষার প্রেক্ষাপটে ব্যবহারকারীর সিমুলেশন আরও জটিল। শিক্ষার্থীদের কাছে আপেক্ষিকভাবে স্থিতিশীল জ্ঞানের সীমানা, ভুলের অভ্যাস এবং শেখার পথ থাকে। একই প্রশ্নের জন্য, কেউ চিহ্ন ভুল করে, কেউ ধারণা ভুলবুঝি করে, কেউ সূচনা শুনেই নিজে উত্তরে পৌঁছায়, আবার কেউ আরও সরাসরি নির্দেশনা চায়।
মানুষের শিক্ষার্থীদের ডিজিটাল টুইন নিয়ে সাম্প্রতিক আলোচনা ঠিক এই ধরনের চাহিদার চারপাশে ঘুরে বেড়াচ্ছে।
মডেলিং শিক্ষার্থী নতুন বিষয় নয়
1995 সালের বেইজিয়ান জ্ঞান ট্র্যাকিং থেকে শুরু করে ডিপ জ্ঞান ট্র্যাকিং এবং অ্যাটেনশন জ্ঞান ট্র্যাকিং পর্যন্ত, এই দিকটি পূর্ববর্তী গবেষকদের দ্বারা প্রায় 30 বছর ধরে অনুসন্ধান করা হয়েছে এবং শিক্ষার্থীদের আচরণকে ম্যাচ করার ক্ষেত্রে এটি খুবই পরিপক্ক।
এদের সাধারণ সীমাবদ্ধতা হল যে, মডেলগুলি শুধুমাত্র প্রশ্ন, অবস্থা, ক্ষমতা ইত্যাদি স্ট্রাকচার্ড ইনপুট গ্রহণ করে, এবং প্রাকৃতিক ভাষার নির্দেশ গ্রহণের কোনো ইনপুট নেই। শিক্ষক যা-ই বলুন না কেন, এই মডেলগুলি শিক্ষার্থীর মতো পারস্পরিকভাবে প্রতিক্রিয়া দিতে পারে না।
যদি সরাসরি বড় মডেলকে একজন শিক্ষার্থীর ভূমিকায় রাখা যায়, তাহলে এটি দেখতে সহজ। একটি বাক্য লিখুন — “তুমি একজন গণিতের ভিত্তি দুর্বল প্রাথমিক শিক্ষার্থী” — মডেল তাৎক্ষণিকভাবে একজন ছোট শিক্ষার্থীর ভাষায় পরিণত হবে এবং অনিশ্চয়তা ও দ্বিধা প্রকাশ করবে।
কিন্তু, চরিত্রের ভাষা এবং চেতনার স্তর একসাথে মানানসই নয়।
একটি মডেল একজন প্রাথমিক বিদ্যালয়ের শিক্ষার্থীর মতো "আমি বুঝতে পারছি না" বলতে পারে, কিন্তু পরবর্তী বাক্যে ক্যালকুলাস-স্তরের যুক্তি দিতে পারে। এটি একজন শিক্ষার্থীর ভূমিকা পালন করছে বলে মনে হলেও, এর প্রতিক্রিয়া এখনও মডেলের নিজস্ব জ্ঞানভাণ্ডারের উপর নির্ভর করে, যা এটির অনুমোদিত জ্ঞানের চেয়ে অনেক বেশি হতে পারে।
AI শিক্ষক প্রশিক্ষণের সময়, এই চিন্তার পর্যায়ের বিষমতা সমস্যা তৈরি করে। টিউটর একজন শিক্ষার্থীর বর্তমান ক্ষমতার সীমার মধ্যে প্রতিক্রিয়া পায় না, বরং একটি উচ্চ-ক্ষমতা মডেলের চরিত্র-ভিত্তিক প্রতিক্রিয়া পায়।
এর কারণেই, কেবলমাত্র একটি ক্ষমতা বর্ণনাকে শর্ত হিসাবে ব্যবহার করা বড় মডেলের জন্য একটি খুব দুর্বল শর্ত চ্যানেল। গত দুই বছরে এই পদ্ধতিটি শিক্ষার প্রসঙ্গে প্রচুর পরিমাণে ব্যবহার করা হয়েছে—কথোপকথন মার্গদর্শনের ডেটা, একাধিক বুদ্ধিমত্তাবিশিষ্ট ক্লাসরুম, এবং শিক্ষার্থীর ডেটা তৈরির জন্য; একইসাথে, এই পদ্ধতির বৈধতা পরীক্ষা করার জন্য একটি সিরিজ গবেষণা প্রকাশিত হচ্ছে, যা আর্কিটেকচার, বিশ্বস্ততা বেঞ্চমার্ক, এবং শিক্ষকদের ব্যবহারের অভিজ্ঞতা—এই তিনটি দৃষ্টিকোণ থেকে প্রশ্ন তোলে।
শিক্ষাবিদ্যায়, একটি নির্দেশনা কতটা কার্যকর ছিল তা মূল্যায়ন করার জন্য শুধুমাত্র ছাত্রদের স্বাধীনভাবে উত্তর দেওয়ার প্রদর্শন দেখা যথেষ্ট নয়; সহায়তা পাওয়ার পর ছাত্ররা কতটা এগিয়ে যেতে পারে তাও দেখা প্রয়োজন।
ভাইগোৎস্কি যা প্রস্তাব করেছিলেন তা হল প্রকৃষ্ট উন্নয়ন অঞ্চল (zone of proximal development): শিক্ষার্থী বর্তমানে স্বাধীনভাবে কী করতে পারে এবং শিক্ষকের সমর্থনে কী করতে পারে, এই দুটির মধ্যের ব্যবধানই শিক্ষার হস্তক্ষেপের জন্য সম্ভাব্য স্থানকে প্রতিফলিত করে।
এই ধারণাটি পরে ডায়নামিক মূল্যায়নের মাধ্যমে কার্যকরী পরিমাপের পদ্ধতিতে রূপান্তরিত হয়: শুধুমাত্র ছাত্রের উত্তর সঠিক কি ভুল তা নয়, বরং সুপারিশ দেওয়ার পরেও তার পারফরম্যান্স কীভাবে পরিবর্তিত হয় তা পর্যবেক্ষণ করা হয়।
ছাত্র সিমুলেটরে রাখুন, এই ধারণাটি দুটি ধরনের ক্ষমতার সাথে সম্পর্কিত।
প্রথমত, সিমুলেটরটি শিক্ষার্থীর স্বাধীনভাবে উত্তর দেওয়ার অবস্থা পুনর্নির্মাণ করতে পারতে হবে, যার মধ্যে ক্ষমতার সীমানা, ভুলের অভ্যাস এবং সাধারণ পছন্দ অন্তর্ভুক্ত থাকবে। দ্বিতীয়ত, সিমুলেটরটি শিক্ষকের নির্দেশনা পড়ার পরে সংশোধিত হতে পারতে হবে এবং এই শিক্ষার্থীর সহায়তার মাধ্যমে দেখা যাওয়ার সম্ভাবনা থাকা আপডেটগুলি প্রদর্শন করতে হবে।
স্টুডেন্টসিম
স্টুডেন্টসিম এই দুই ধরনের ক্ষমতাকে যথাক্রমে বিহেভিওরাল ফিডেলিটি এবং গাইডেন্স রেসপনসিভনেস হিসাবে সংজ্ঞায়িত করে এবং তা অনুযায়ী ব্যক্তিগতকৃত শিক্ষার্থী সিমুলেটরকে প্রশিক্ষণ এবং মূল্যায়ন করে।

ছাত্র সিমুলেটরটি একসাথে দুটি প্রশ্নের উত্তর দিতে হবে: স্বাধীনভাবে উত্তর দেওয়ার সময় এটি লক্ষ্য ছাত্রের মতো কাজ করে কিনা, এবং শিক্ষকের নির্দেশনা গ্রহণের পরে কি সংশোধন ঘটে।
প্রশিক্ষণ প্রক্রিয়া দুটি ধাপে বিভক্ত।
একটি ক্ষেত্রের বিভিন্ন শিক্ষার্থীর রেকর্ড একত্রিত করে একটি সাধারণ শিক্ষার্থী আচরণ মডেল প্রশিক্ষণ দেওয়া হয়। এই পর্যায়ে সাধারণ ভুল, উত্তরের ফরম্যাট এবং পরামর্শের পরে সংশোধনের পথ শেখা হয়।
দ্বিতীয় ধাপে একজন শিক্ষার্থীর নিজস্ব ডেটা ব্যবহার করে পার্সোনালাইজড সিমুলেটর প্রশিক্ষণ চালিয়ে যান। একজন শিক্ষার্থীর ডেটা কম হওয়ায় সরাসরি প্রশিক্ষণ দিলে ওভারফিটিংয়ের ঝুঁকি বেশি; প্রথমে গোষ্ঠীগত নিয়মগুলি শেখা এবং তারপর ব্যক্তিগত ডেটা অ্যাডাপ্ট করলে প্রতিটি শিক্ষার্থীর জন্য আরও স্থিতিশীলভাবে সিমুলেটর পাওয়া যায়।

ট্রেনিং প্রক্রিয়া
অধ্যয়ন দল একসাথে স্টুডেন্টসিমএভাল তৈরি করেছে। মূল্যায়নটি শত্রুপক্ষ, দ্বিতীয় ভাষা ইংরেজি লেখা এবং মৌলিক গণিতের তিনটি পরিস্থিতি থেকে 60 জন বাস্তব শিক্ষার্থীকে কভার করে।
বোর্ড গেমে, সিমুলেটরটি একজন খেলোয়াড়ের চাল পূর্বানুমান করে এবং কোচের পরামর্শের পর চাল পরিবর্তন করে। দ্বিতীয় ভাষা লেখায়, সিমুলেটরটি শিক্ষার্থীর ভুলের প্যাটার্নের সাথে সামঞ্জস্যপূর্ণ রচনা তৈরি করে এবং শিক্ষকের সংশোধনের ভিত্তিতে অংশগুলি পুনর্লিখন করে। গণিতে, সিমুলেটরটি শিক্ষার্থীর উত্তর পূর্বানুমান করে এবং ব্যাখ্যার পর সংশোধন করে।
এই কাজগুলির বাহ্যিক পার্থক্য অনেক, কিন্তু মূল্যায়নের লক্ষ্য একই: প্রথমে দেখুন যে সিমুলেটরটি ছাত্রের মতো কাজ করে কিনা, তারপর দেখুন যে এটি নির্দেশনা প্রতিক্রিয়া জানাতে পারে কিনা। সমস্ত পদ্ধতি একই ছাত্রের রেকর্ড ব্যবহার করে, একই held-out টেস্ট রেকর্ডে তুলনা করা হয়।
বিশ্ব চেস ফলাফলে, স্টুডেন্টসিমের F হল 0.5150 এবং R হল 0.9067; GPT-5.4 এর জন্য যথাক্রমে 0.2316 এবং 0.7186; মাইয়া2 এর জন্য যথাক্রমে 0.4535 এবং 0.2721। দ্বিতীয় ভাষার লেখা এবং গণিতের পরীক্ষায়, স্টুডেন্টসিম উভয় মেট্রিকেই সংশ্লিষ্ট বেসলাইনকে ছাড়িয়েছে।

বোর্ড গেম মূল্যায়নে দ্বিমাত্রিক ফলাফল। GPT-5.4 ভালো নির্দেশনা দেয়, কিন্তু আচরণের বিশ্বস্ততা কম; Maia2 খেলোয়াড়দের চালের সাথে বেশি মিলে যায়, কিন্তু প্রাকৃতিক ভাষার নির্দেশনার প্রবেশাধিকার অনুপস্থিত; StudentSim উভয় সূচকেই উচ্চ স্তরে অবস্থান করে।
এই ফলাফলগুলি স্পষ্ট বিভাজন দেখায়। GPT-5.4 নির্দেশনা পড়তে পারে, কিন্তু বিশেষ শিক্ষার্থীদের অনুকরণে বিশ্বস্ততা কম। Maia2 মানুষের শিক্ষার্থীদের চলার পদ্ধতির সাথে বেশি মিলে যায়, কিন্তু প্রাকৃতিক ভাষার কোচিং পরামর্শগুলি গ্রহণ করতে পারে না। StudentSim বাস্তব শিক্ষণ রেকর্ড দিয়ে প্রশিক্ষিত এবং প্রতিটি শিক্ষার্থীর জন্য সামঞ্জস্যপূর্ণ, যা ব্যক্তিগত আচরণ এবং নির্দেশনা প্রতিক্রিয়া উভয়ক্ষেত্রেই উন্নতি ঘটায়।
কিন্তু শিক্ষার্থী সিমুলেটরটি নিজেই লক্ষ্য নয়; চূড়ান্ত লক্ষ্য হল এটির কার্যকারিতা বাস্তব জগতে বাস্তবায়িত হতে পারে এবং শিক্ষক মডেলগুলি উন্নত করতে ব্যবহার করা যায়।
আগের এআই টিউটর প্রশিক্ষণে, পুরস্কার সংকেতগুলি কিছু কাজে বিশেষজ্ঞদের দ্বারা লেবেলযুক্ত উৎকৃষ্ট টিউটরিং কথোপকথন থেকে আসত, অন্যগুলি সাধারণ বড় মডেল বিচারকদের দ্বারা ব্যবহৃত স্কেল দ্বারা স্কোর করা হত। কিছু কাজ পুরস্কারকে সিমুলেটেড শিক্ষার্থীতে সংযুক্ত করার চেষ্টা করেছে, তবে সেগুলি সবই বাস্তব শিক্ষার্থীর ডেটা দিয়ে প্রশিক্ষিত সিমুলেটর নয়, বরং পরিচিতি-অনুসারে অবিশ্বস্ত ভূমিকা পালনকারী এলএলএম শিক্ষার্থী। StudentSim এই বিষয়ে একটি ভিন্ন পদ্ধতি প্রস্তাব করে।
পেপারটি আরও বিস্তারিতভাবে StudentSim-কে AI টিউটর রিইনফোর্সমেন্ট লার্নিং প্রক্রিয়ায় একীভূত করে।
পরীক্ষার পরিস্থিতি হল শ্যাচ। সিস্টেম প্রথমে বাস্তব শিক্ষার্থীদের দ্বারা করা ভুল চালগুলি বের করে, AI টিউটর নির্দেশনা তৈরি করে, এবং StudentSim নির্দেশনা পড়ে সংশোধিত চাল দেয়।
স্টকফিশ মূল ভুল চালের তুলনায় সংশোধিত চালের গুণগত পরিবর্তন গণনা করে, এবং এই স্কোরটি RL সংকেত হিসাবে টিউটরকে ফিরিয়ে দেওয়া হয়। নিয়ন্ত্রণ গ্রুপের মধ্যে রয়েছে RL-হীন টিউটর এবং GPT-5.4 ব্যবহার করে শিক্ষার্থী সিমুলেটর রিওয়ার্ড হিসাবে ব্যবহারকারী টিউটর।

টিউটর জেনারেশন গাইড, ফ্রিজ করা এআই শিক্ষার্থী সিমুলেটর সংশোধিত উত্তর দেয়, সিস্টেম সংশোধনের আগে ও পরের গুণগত পরিবর্তনের ভিত্তিতে টিউটর আপডেট করে।
তিনটি টিউটর একই বেস মডেল, এসএফটি শুরু এবং জিআরপিও সেটিংস ব্যবহার করে, কিন্তু পুরস্কারের উৎস ভিন্ন।
চেস মূল্যায়নকারীদের অন্ধ মূল্যায়নের পর, স্টুডেন্টসিম রিওয়ার্ড দ্বারা প্রশিক্ষিত টিউটর সঠিকতা, নির্দেশনার গুণমান এবং ব্যক্তিগতকরণের স্কোরিংয়ে প্রথম স্থান অধিকার করে।
বিশেষজ্ঞরা তিনটি মাপদণ্ডে অন্ধভাবে মূল্যায়ন করেন: সঠিকতা হলো “কোনো ভুলবোধক তথ্য নেই” এমন উত্তরের শতাংশ, নির্দেশনার মান এবং ব্যক্তিগতকরণ প্রতিটি 1 থেকে 5 স্কেলে। StudentSim reward-এ প্রশিক্ষিত টিউটর তিনটি মাপদণ্ডেই প্রথম স্থান অধিকার করে।
আরও গুরুত্বপূর্ণ বিষয় হলো বিপরীত ফলাফল সহ পরীক্ষার গ্রুপ: GPT-5.4 কে শিক্ষার্থী সিমুলেটর হিসেবে ব্যবহার করে প্রশিক্ষিত টিউটরটির সঠিকতা StudentSim-এর চেয়েও কম এবং RL-এর কোনো প্রশিক্ষণ ছাড়াই বেসলাইনের চেয়েও কম। এর পিছনে প্রকাশ্যভাবে বেশি গুরুতর তথ্যগত ভুলের হার। সিমুলেটরটি যদি বাস্তবসম্মত না হয়, তবে এটি শিক্ষককে ভুল দিকে ঠেলে দেয়: একটি বাস্তব শিক্ষার্থীর চেয়ে অনেক বেশি জ্ঞানসম্পন্ন, কিন্তু বাস্তবসম্মত নয় এমন সিমুলেটর, যেকোনো অসঙ্গতির নির্দেশনা পড়েই নিজেই কোনো উত্তরের উদ্ভাবন করে, এবং ভুল নির্দেশনার জন্য র্যান্ডম পুরস্কার দেয়, RL-এর অপটিমাইজেশনটি তখন বিশৃঙ্খল (এমনকি ভুল) দিকেই চলে।
স্টুডেন্টসিম শিক্ষাগত গবেষণা থেকে বাস্তব শিক্ষার্থী পরীক্ষাকে প্রতিস্থাপন করে না। এটি বাস্তব শিক্ষার্থীর রেকর্ডকে প্রশিক্ষণ পর্যায়ে পুনরাবৃত্তভাবে ব্যবহারযোগ্য সিমুলেটেড ফিডব্যাকে রূপান্তরিত করে, যাতে AI টিউটরটি human study-এ প্রবেশের আগে আরও অনেক রাউন্ড ফিল্টারিং এবং অপ্টিমাইজেশন সম্পন্ন করতে পারে।
ব্যক্তিগত ফিডব্যাক প্রয়োজনীয় এআই শিক্ষক সিস্টেমের জন্য, এই ধরনের শিক্ষার্থী সিমুলেটরগুলি সাম্প্রতিক জনপ্রিয় ব্যবহারকারী সিমুলেটরের ধারণার পরিপ্রেক্ষিতে একটি বিপ্লবী প্রকৌশল পথ প্রদান করে:
শিক্ষার্থীদের কীভাবে ভুল করে তা শিখুন, শিক্ষার্থীদের কীভাবে নির্দেশনায় পরিবর্তন করে তা শিখুন, যা শিক্ষক মডেলের শক্তিশালী শিক্ষার জন্য মেশিন লার্নিং সময়সীমার ফিডব্যাক সংকেত প্রদান করে।
প্রসঙ্গ: https://arxiv.org/abs/2609.01591
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "নিউ জ্ঞান" থেকে এসেছে, লেখক: নিউ জ্ঞান; সম্পাদক: LRST
