ای آئی ٹیچر پہلے ہی کئی ایکل تدریسی کاموں کو مکمل کر چکا ہے۔
ایک ریاضی کا مسئلہ، جس کے مراحل کو ٹوٹا جا سکتا ہے؛ ایک انگریزی تحریر، جس میں گرامر کی غلطیاں بتائی جا سکتی ہیں؛ ایک شطرنج کا کھیل، جس کا اگلا مرحلہ بھی بتایا جا سکتا ہے۔ بہت سے مناظر میں، ماڈل کا آؤٹ پٹ ایک صبر والا مددگار کی طرح لگتا ہے۔
لیکن تدریس کا اثر صرف اساتذہ کی طرف سے نہیں دیکھا جا سکتا۔ طلباء کو سننے کے بعد کیا وہ غلطیوں میں اصلاح کرتے ہیں، کیا وہ صرف حوالہ جات پر ہی عمل کرتے ہیں، اور ایک ہی وضاحت مختلف طلباء پر کیا مختلف اثرات ڈالتی ہے، یہ سب طلباء کی طرف سے ہوتا ہے۔
اگر AI ٹیچر کو ذاتی رہنمائی سیکھنی ہو، تو اسے طلباء کے رد عمل کا بار بار مشاہدہ کرنا ہوگا۔
حقیقی زندگی میں، یہ ردعملز زیادہ تر انسانی مطالعہ سے آتے ہیں۔ ہر تدریسی حکمت عملی کے ایڈجسٹمنٹ کے لیے، طلبہ کو شرکت کرنے، تفاعل جمع کرنے اور انسانی جائزہ لینے کے لیے منظم کیا جانا چاہیے۔
AI ماڈلز جلدی اپڈیٹ ہو سکتے ہیں، لیکن تعلیمی فیڈ بیک کا حصول انسانی مطالعہ کے تجرباتی دور کی وجہ سے محدود ہے۔

AI ٹیوٹر کو تعلیم میں بہتری کے لیے طلبہ کے ردعمل کی ضرورت ہوتی ہے، لیکن حقیقی ردعمل جمع کرنے کا اخراج زیادہ ہوتا ہے۔ StudentSim حقیقی طلبہ کے ریکارڈز کو تربیتی مرحلے میں دوبارہ استعمال کیے جانے والے ایجنٹ ردعمل میں تبدیل کرنا چاہتا ہے۔
ہالیا تحقیق StudentSim پر مرکوز کریں، اس تضاد سے شروع کرتے ہوئے۔
تحقیقی ٹیم AI ٹیچر کو بہتر بنانا چاہتی ہے تاکہ وہ طالب علم کے فوائد اور کمزوریوں کو سمجھ سکے اور مختلف طالب علموں کے لیے مناسب ہدایات دے سکے۔ ترقی کے دوران، ٹیم نے مسئلہ طالب علم کے محاکمے پر مرکوز کیا: کیا حقیقی طالب علم کے ڈیٹا کا استعمال کرکے ایک ایسا AI طالب علم تیار کیا جا سکتا ہے جو قابل جائزہ اور دوبارہ استعمال کے قابل ہو، تاکہ AI ٹیچر تربیت کے مراحل میں زیادہ فیڈ بیک حاصل کر سکے؟

کاغذ کا لنک: https://arxiv.org/abs/2609.01591
کوڈ لنک: https://github.com/microsoft/StudentSim
ہگنگ فیس پیپر کی ویب سائٹ: https://huggingface.co/papers/2609.01591
یہ بات آج کے AI ایجنٹ تحقیق میں منفرد نہیں ہے۔ یوزر سیمولیٹر کسٹمر سروس، ای کامرس، طبی مشورہ، اور ویب سائٹ آپریشنز جیسے مناظر میں مقبول تحقیقی سمت بن رہا ہے۔ تحقیق کار مصنوعی صارفین بناتے ہیں تاکہ ایجنٹ کو لانچ سے پہلے زیادہ تعاملات کا تجربہ دلوایا جا سکے، اور اس کے اسٹریٹجیز، بات چیت کے انداز اور مضبوطی کا ٹیسٹ کیا جا سکے۔
تعلیمی ماحول میں صارفین کی محاکہ زیادہ پیچیدہ ہوتی ہے۔ طلباء کے پاس نسبتاً مستقل علمی حدود، غلط عادات اور سیکھنے کے رجحانات ہوتے ہیں۔ ایک ہی سوال پر، کچھ لوگ نشانوں کو غلط حساب کرتے ہیں، کچھ مفہوم کو غلط سمجھتے ہیں، کچھ تجاویز سننے کے بعد خود اپنے آپ جواب تک پہنچ جاتے ہیں، جبکہ کچھ کو زیادہ براہ راست ہدایت کی ضرورت ہوتی ہے۔
ہالیوڈ کے اسٹوڈیوز کے لیے ایک ٹیکنالوجی ہے جو اسٹار کی ڈیجیٹل ڈوبل کو تخلیق کرتی ہے۔
اسٹوڈنٹس کو ماڈل کرنا نیا موضوع نہیں ہے
1995 کے بیزین کنٹرول ٹریکنگ سے لے کر گہری کنٹرول ٹریکنگ اور توجہ کنٹرول ٹریکنگ تک، یہ راستہ پچھلے تقریباً 30 سالوں سے پہلے ہی دریافت کیا جا چکا ہے اور طلبہ کے رویوں کو مطابق بنانے میں بہت زیادہ ناضک ہے۔
ان کا مشترکہ خلا یہ ہے کہ ماڈل صرف سوال، حالت، اور صلاحیت جیسے ڈھانچہ بند ان پٹس کو قبول کرتا ہے، اور قدرتی زبان کی ہدایات کو قبول کرنے کا کوئی انٹر فیس نہیں ہے۔ چاہے استاد کچھ بھی کہے، اس قسم کے ماڈلز طالب علم کی طرح تعاملی طور پر اپنا رفتار تبدیل نہیں کر سکتے۔
اگر براہ راست بڑے ماڈل کو طالب علم کے کردار میں ڈال دیا جائے، تو اسے آسان لگتا ہے۔ اسے صرف ایک جملہ لکھیں، "آپ ایک کمزور ریاضی کے ساتھ چھٹی جماعت کے طالب علم ہیں"، اور ماڈل فوراً کم عمر طالب علم کے انداز میں تبدیل ہو جائے گا اور شک و شبہ کا اظہار بھی کرے گا۔
لیکن، کردار کی آواز اور تصوری سطح ایک ساتھ نہیں ہیں۔
ایک ماڈل چھوٹے بچے کی زبان میں "میں نہیں سمجھا" کہہ سکتا ہے، لیکن اگلے جملے میں کیلکولس کے سطح کا استدلال دے سکتا ہے۔ اس کا لگ رہا ہے کہ وہ طالب علم کا کردار ادا کر رہا ہے، لیکن اصل میں اس کا جواب اس کی اپنی علمی بنیاد پر ہی ہوتا ہے، جو اس کے محدود جاننے کے سطح سے بہت زیادہ ہو سکتی ہے۔
AI ٹیچر کی تربیت کے دوران، اس جانچ کی سطح کا انحراف مسائل پیدا کرتا ہے۔ ٹیوٹر کو کسی طالب علم کے موجودہ صلاحیت کے حد تک کے جوابات نہیں ملتے، بلکہ ایک اعلیٰ صلاحیت والے ماڈل کے انسانی کردار کے ساتھ پیکج شدہ جوابات ملتے ہیں۔
اسی لیے، صرف ایک صلاحیت کے تفصیل کو شرط کے طور پر رکھنا، بڑے ماڈل کے لیے ایک کمزور شرط کا چینل ہے۔ گزشتہ دو سالوں میں اس طریقہ کار کو تعلیمی مناظر میں بہت زیادہ استعمال کیا گیا ہے—مکالمات کی تربیت، متعدد ذہین نظاموں والی کلاس روم، اور سیکھنے والوں کے ڈیٹا کی تخلیق میں؛ اس کے ساتھ ہی، اس کی درستگی کی جانچ کرنے والی ایک نئی نسل کے تحقیقی مطالعات بھی ظاہر ہو رہے ہیں، جو تعمیر، سچائی کے معیار، اور استاد کے تجربے کے تین پہلوؤں سے سوال اٹھا رہے ہیں۔
تعلیمی سائنس میں، ایک ہدایت کی کارکردگی کا جائزہ لینے کے لیے صرف اس بات پر انحصار نہیں کیا جا سکتا کہ طالب علم خود سے جواب دے پایا یا نہیں، بلکہ اس بات پر بھی انحصار کیا جانا چاہیے کہ مدد کے بعد طالب علم کتنی دور تک جا سکتا ہے۔
وائگوتسکی نے قریبی ترقیاتی علاقہ (zone of proximal development) کا ذکر اسی بات کے بارے میں کیا ہے: طالب علم کی موجودہ صلاحیت کیا ہے کہ وہ کیا خود سے کر سکتا ہے، اور تعلیم دینے والے کی مدد سے وہ کیا کر سکتا ہے، اس فرق میں تعلیم کے لیے مداخلت کا موقع ظاہر ہوتا ہے۔
اس خیال کو بعد میں ڈائنانک ایسیسمنٹ کے ذریعے قابل عمل پیمائش کے طریقے میں تبدیل کر دیا گیا: صرف اس بات کو ریکارڈ کرنا کہ طالب علم نے جواب صحیح دیا یا نہیں، بلکہ رہنمائی دینے کے بعد اس کی کارکردگی میں کیا تبدیلی آئی، اسے بھی دیکھنا۔
اس خیال کو طلبہ کے سیمولیٹر پر رکھنا، اس کا تعلق دو قسم کی صلاحیتوں سے ہے۔
پہلا، سیمیولیٹر کو طالب علم کی ذاتی جواب دینے کی حالت کو دہرانا چاہیے، جس میں صلاحیت کی حدود، غلط عادات اور عام انتخابات شamil ہوں۔ دوسرا، سیمیولیٹر کو استاد کے رہنمائی کو پڑھنے کے بعد متعلقہ تبدیلیاں پیدا کرنی چاہیں اور یہ ظاہر کرنا چاہیے کہ مدد کے ساتھ طالب علم کس طرح اپڈیٹ ہو سکتا ہے۔
اسٹوڈنٹسیم
اسٹوڈنٹسِم نے ان دو قسموں کی صلاحیتیں الگ الگ بیہیوئرل فِدِلِٹی اور گائیڈنس ریسپانسِوینس کے طور پر تعریف کی ہیں، اور اس کے بنیاد پر ذاتی صلاحیت والے طالب علم کے سیمولیٹر کو تربیت دی گئی اور جانچ گئی۔

اسٹوڈنٹ سیمیولیٹر کو دو سوالات کا جواب دینا ہوگا: مستقل طور پر جواب دینے پر کیا یہ ہدف والے طالب علم کی طرح ہے، اور استاد کی ہدایت کے بعد کیا اس میں متعلقہ تبدیلی آتی ہے؟
ٹریننگ پروسیس دو مراحل پر مشتمل ہے۔
ایک شعبے میں کئی طلبہ کے ریکارڈز کو اکٹھا کرکے، عام طلبہ کے رویے کا ماڈل تربیت دیں۔ اس مرحلے میں عام غلطیاں، جواب کے فارمیٹ، اور ہدایات کے بعد درستگی کے راستے سیکھے جاتے ہیں۔
دومین مرحلہ میں، ایک واحد طالب علم کے اپنے ڈیٹا کا استعمال کرتے ہوئے تربیت جاری رکھی جاتی ہے تاکہ شخصی سیمولیٹر حاصل کیا جا سکے۔ ایک طالب علم کے ڈیٹا کی مقدار کم ہوتی ہے، اس لیے براہ راست تربیت سے زیادہ فٹ ہونے کا خطرہ ہوتا ہے؛ گروہ کے اصولوں کو پہلے سیکھنا اور پھر انفرادی ڈیٹا کے لیے ایڈجسٹ کرنا، ہر طالب علم کے لیے زیادہ مستحکم سیمولیٹر حاصل کرنے کا طریقہ ہے۔

ٹریننگ پروسیس
تحقیقی ٹیم نے StudentSimEval کو بھی تعمیر کیا۔ اس جائزہ میں 60 حقیقی طلباء شامل ہیں، جو شطرنج، دوسری زبان انگریزی لکھائی اور بنیادی ریاضی کے تین مناظر سے تعلق رکھتے ہیں۔
شطرنج میں، سیمیولیٹر کسی کھلاڑی کے چیس گیم میں حرکت کا پیشگوئی کرتا ہے اور معلم کی ہدایت کے بعد حرکت تبدیل کرتا ہے۔ دوسری زبان کے تحریری کام میں، سیمیولیٹر سیکھنے والے کے غلطیوں کے نمونے کے مطابق مضمون تخلیق کرتا ہے اور استاد کے جائزے کے بعد اجزاء کو دوبارہ لکھتا ہے۔ ریاضی میں، سیمیولیٹر طالب علم کے جواب کا پیشگوئی کرتا ہے اور وضاحت کے بعد اسے درست کرتا ہے۔
ان کاموں کی ظاہری تفصیلات بہت مختلف ہیں، لیکن جائزہ کا مقصد ایک جیسا ہے: پہلے یہ دیکھیں کہ محاکمہ طالب علم کی طرح لگتا ہے یا نہیں، پھر یہ دیکھیں کہ وہ ہدایات کا جواب دے سکتا ہے یا نہیں۔ تمام طریقے ایک ہی طالب علم کے ریکارڈ کو استعمال کرتے ہیں اور ایک ہی held-out ٹیسٹ ریکارڈ پر تقابل کرتے ہیں۔
شطرنج کے نتائج میں، StudentSim کا F 0.5150 اور R 0.9067 ہے؛ GPT-5.4 کے لیے یہ ترتیب سے 0.2316 اور 0.7186 ہیں؛ Maia2 کے لیے یہ ترتیب سے 0.4535 اور 0.2721 ہیں۔ دوسری زبان کے تحریری اور ریاضی کے تجربات میں، StudentSim نے دونوں اشاریوں میں متعلقہ بنیادی سطح کو پار کر لیا۔

شطرنج کے جائزے میں دو بعدی نتائج۔ GPT-5.4 کا جواب ہدایت کے لیے بہتر ہے، لیکن رویے کی سچائی کم ہے؛ Maia2 کھلاڑیوں کے حرکات کے زیادہ قریب ہے، لیکن قدرتی زبان کی ہدایت کا انٹر فیس نہیں ہے؛ StudentSim دونوں اشاریوں پر اعلیٰ درجہ رکھتا ہے۔
یہ نتائج واضح تقسیمِ کام کو ظاہر کرتے ہیں۔ GPT-5.4 ہدایات پڑھ سکتا ہے، لیکن خاص طالب علم کی شبیہہ بنانے میں اصلیت کم ہے۔ Maia2 انسانی شطرنج کھلاڑیوں کے اقدامات کے قریب تر ہے، لیکن قدرتی زبان کے کوچنگ کے حوالے سے معلومات حاصل نہیں کر سکتا۔ StudentSim حقیقی سیکھنے کے ریکارڈز پر تربیت پا چکا ہے اور ہر طالب علم کے لیے مخصوص طور پر تطبیق دیتا ہے، جس سے اس کی ذاتی سرگرمیوں اور ہدایات کے جوابات دونوں میں بہتری آئی ہے۔
تاہم، طلبہ کا سیمیولیٹر خود مقصد نہیں ہے؛ نتیجہ یہ ہے کہ اس کا استعمال حقیقی دنیا میں عملی شکل اختیار کر سکے اور یہ استاد ماڈل کو بہتر بنانے کے لیے استعمال کیا جا سکے۔
پہلے AI ٹیوٹر کی تربیت میں، انعام کا سگنل کچھ کاموں میں ماہرین کے ذریعہ نشان زد کردہ اعلیٰ کوالٹی کے ٹیوٹنگ مکالموں سے آتا تھا، جبکہ دوسرے کاموں میں عام بڑے ماڈل جج کے ذریعہ اسکورنگ سکیل استعمال کی جاتی تھی۔ کچھ کاموں نے انعام کو محاکمہ طلبہ پر جوڑنے کی کوشش بھی کی، لیکن ان میں صرف ایسے LLM طلبہ استعمال کیے گئے جو认知 سطح کے لحاظ سے سچائی نہیں رکھتے تھے، اور نہ ہی انہیں حقیقی سیکھنے والوں کے ڈیٹا پر تربیت دی گئی تھی۔ StudentSim اس نقطہ پر ایک مختلف approach پیش کرتا ہے۔
مطالعہ مزید StudentSim کو AI ٹیوٹر کے تقویتی سیکھنے کے عمل میں شامل کرتا ہے۔
تجربہ کا منظر شطرنج ہے۔ سسٹم پہلے حقیقی طلباء کے کیے گئے غلط اقدامات نکالتا ہے، AI ٹیوٹر رہنمائی تیار کرتا ہے، اور StudentSim رہنمائی پڑھنے کے بعد درست اقدامات پیش کرتا ہے۔
اسٹاکفش کو اصل غلط حرکت کے مقابلے میں درست حرکت کی معیاری تبدیلی کا حساب لگانے کے لیے استعمال کیا جاتا ہے، اور یہ اسکور RL سگنل کے طور پر ٹیوٹر کو واپس بھیجا جاتا ہے۔ کنٹرول گروپ میں RL کے بغیر ٹیوٹر اور GPT-5.4 کو طالب علم سیمیولیٹر ریوارڈ کے طور پر استعمال کرنے والا ٹیوٹر شامل ہے۔

ٹیوٹر کی تیاری، جامد AI طالب علم سیمیولیٹر درست جوابات فراہم کرتا ہے، اور سسٹم درستگی کے قبل اور بعد کی معیاری تبدیلیوں کے مطابق ٹیوٹر کو اپڈیٹ کرتا ہے۔
تین گروہس کے ٹیوٹرز ایک ہی بنیادی ماڈل، SFT شروعات اور GRPO سیٹنگز کا استعمال کرتے ہیں، لیکن ان کے ریوارڈ ذرائع مختلف ہیں۔
بے نظر جائزہ کے بعد، اسٹوڈنٹ سیم ری وارڈ تربیت یافتہ ٹیوٹر درستگی، ہدایت کی معیار اور شخصی تفصیلات کے لحاظ سے پہلے نمبر پر ہے۔
ماہرین نے تین ابعاد کا اندھا جائزہ لیا جبکہ پیشکش کا ترتیب بدل دیا گیا تھا: دقت کے لیے "غلط معلومات سے نہ ہونے والے" جوابات کا فیصد، اور ہدایت کی معیار اور شخصیت کے لیے 1 سے 5 تک کے اسکور۔ StudentSim reward کے ذریعے تربیت یافتہ ٹیوٹر تینوں ابعاد میں پہلے نمبر پر رہا۔
زیادہ اہم بات یہ ہے کہ اُلٹے نتائج والے تجربات میں: GPT-5.4 کو طالب علم سیمیولیٹر کے طور پر استعمال کرکے تربیت دی گئی ٹیوٹر، StudentSim کے مقابلے میں درستگی میں کم تھی اور RL کے بغیر بنائے گئے بنیادی مدل سے بھی کم تھی، اس کا سبب واضح طور پر زیادہ سنگین حقیقی غلطیوں کی شرح تھی۔ اگر سیمیولیٹر درست نہ ہو، تو یہ استاد کو غلط راستے پر لے جاتا ہے: ایک ایسا سیمیولیٹر جو حقیقی طالب علم کے认知 سطح سے مطابقت نہ رکھتا ہو لیکن سمجھنے کی صلاحیت بہت زیادہ ہو، وہ کسی بھی غیر منطقی ہدایت کو پڑھ کر خود کوئی جواب نکال لے گا، اور غلط ہدایات کو تصادفی انعام دے دے گا، جس سے RL اُلٹا (یا غلط) راستہ اختیار کرنے لگتا ہے۔
StudentSim نے تعلیمی تحقیق سے حقیقی طلبہ کے تجربات کو مکمل طور پر نہیں بدل دیا۔ اس نے حقیقی طلبہ کے ریکارڈز کو تربیتی مرحلے میں دوبارہ استعمال کیے جانے والے سیمولیشن فیڈ بیک میں تبدیل کر دیا، جس سے AI ٹیوٹر انسانی تجربے میں داخل ہونے سے پہلے متعدد راؤنڈز کی فلٹرنگ اور بہتری کر سکتا ہے۔
انفرادی فیڈ بیک کی ضرورت والے AI ٹیچر سسٹم کے لیے، یہ طلبہ کے سیمولیٹرز، حالیہ مقبول صارف سیمولیٹرز کے خیال کو جاری رکھتے ہیں (ہر کوئی سیمولیٹ کیا جا سکتا ہے، انسانوں کا ڈیجیٹل ڈوپلیکیٹ تعمیر کریں)، ایک انقلابی انجینئرنگ راستہ فراہم کرتے ہیں:
طلاب کے غلطیوں کو سیکھیں، طلباء کو ہدایت کے تحت تبدیل ہونے کے طریقے سیکھیں، تعلیمی ماڈل کے لیے تقویتی سیکھنے کے لیے مشین لرننگ کے وقت کے پیمانے پر فیڈ بیک سگنل فراہم کریں۔
حوالہ جات: https://arxiv.org/abs/2609.01591
یہ مضمون ویچن گروپ "نیوزی ایوان" سے ہے، مصنف: نیوزی ایوان؛ ایڈیٹر: LRST
