StudentSim: ฝึกอบรมนักเรียนดิจิทัล 60 คนด้วยข้อมูลจริงเพื่อปรับปรุงการสอนด้วยปัญญาประดิษฐ์

icon MarsBit
แชร์
AI summary iconสรุป
การศึกษาชิ้นใหม่แนะนำ StudentSim ซึ่งเป็นตัวจำลองนักเรียนที่ฝึกด้วยข้อมูลจริงเพื่อปรับปรุงระบบการสอนด้วยปัญญาประดิษฐ์ โมเดลนี้เลียนแบบพฤติกรรมและคำตอบของนักเรียน โดยทดสอบกับนักเรียน 60 คนในเกมหมากรุก การเขียนภาษาที่สอง และคณิตศาสตร์พื้นฐาน ซึ่งมีความแม่นยำและตอบสนองดีกว่า GPT-5.4 และ Maia2 นักวิจัยได้ผสาน StudentSim เข้ากับกรอบการทำงานการเรียนรู้แบบเสริมแรงสำหรับตัวสอนปัญญาประดิษฐ์ ซึ่งแสดงผลลัพธ์ที่ดีกว่าในการทดสอบแบบไม่รู้ตัว การพัฒนานี้สอดคล้องกับแนวโน้มในการกำกับดูแลสินทรัพย์ดิจิทัล และสะท้อนถึงความสนใจที่เพิ่มขึ้นในสภาพคล่องและตลาดคริปโต

ครู AI สามารถดำเนินการภารกิจการสอนแบบครั้งเดียวได้หลายอย่าง

โจทย์คณิตศาสตร์หนึ่งข้อ มันสามารถแยกขั้นตอนได้; บทความภาษาอังกฤษหนึ่งฉบับ มันสามารถชี้จุดผิดไวยากรณ์ได้; เกมหมากรุกหนึ่งเกม มันยังสามารถเสนอแนวคิดสำหรับ下一步ได้ ในหลายสถานการณ์ ผลลัพธ์ที่โมเดลให้ออกมานั้นดูเหมือนผู้ช่วยสอนที่มีความอดทน

แต่ผลลัพธ์ของการสอนไม่สามารถวัดได้จากฝั่งครูเท่านั้น หลังจากได้ยินคำอธิบาย นักเรียนได้แก้ไขข้อผิดพลาดหรือไม่ พวกเขาแค่ทำตามคำใบ้หรือไม่ คำอธิบายเดียวกันมีผลต่างกันกับนักเรียนแต่ละคนหรือไม่ สิ่งเหล่านี้เกิดขึ้นที่ฝั่งนักเรียน

AI ครู หากต้องการเรียนรู้การให้คำแนะนำแบบเฉพาะบุคคล ก็จำเป็นต้องสังเกตปฏิกิริยาของนักเรียนซ้ำๆ

ในชีวิตจริง การตอบสนองเหล่านี้ส่วนใหญ่มาจากการศึกษาแบบมนุษย์ การปรับกลยุทธ์การสอนแต่ละครั้งต้องจัดให้นักเรียนมีส่วนร่วม รวบรวมข้อมูลการโต้ตอบ และประเมินด้วยมนุษย์

โมเดล AI สามารถอัปเดตได้อย่างรวดเร็ว แต่การรับข้อมูลป้อนกลับจากการศึกษาเชิงมนุษย์นั้นถูกจำกัดโดยรอบระยะเวลาของการทดลอง

Large Model for Education

AI tutor ต้องการรับฟังความคิดเห็นจากนักเรียนเพื่อปรับปรุงการสอน แต่ต้นทุนในการรวบรวมความคิดเห็นที่แท้จริงสูง StudentSim ต้องการแปลงบันทึกของนักเรียนที่แท้จริงให้เป็นข้อมูลย้อนกลับที่สามารถเรียกใช้ซ้ำได้ในระหว่างขั้นตอนการฝึกอบรม

ศึกษา StudentSim ในช่วงไม่กี่วันที่ผ่านมา จากจุดขัดแย้งนี้

ทีมวิจัยต้องการพัฒนาครู AI ให้สามารถเข้าใจจุดแข็งและจุดอ่อนของนักเรียน และให้คำแนะนำที่เหมาะสมกับนักเรียนแต่ละคน ในกระบวนการขับเคลื่อน ทีมได้ลดปัญหานี้ลงมาที่ตัวจำลองนักเรียน: สามารถใช้ข้อมูลนักเรียนจริงในการฝึกฝน AI นักเรียนที่สามารถประเมินและนำกลับมาใช้ใหม่ได้หรือไม่ เพื่อให้ครู AI ได้รับข้อมูลป้อนกลับมากขึ้นในช่วงการฝึกอบรม

Large Model for Education

ลิงก์เอกสารวิจัย: https://arxiv.org/abs/2609.01591

ลิงก์รหัส: https://github.com/microsoft/StudentSim

หน้าหลักเอกสาร Huggingface: https://huggingface.co/papers/2609.01591

เรื่องนี้ไม่ได้เกิดขึ้นอย่างโดดเดี่ยวในงานวิจัยเอไอเอเจนต์ในวันนี้ ผู้จำลองผู้ใช้งานกำลังกลายเป็นทิศทางการวิจัยที่ได้รับความนิยม และถูกนำไปใช้ในสถานการณ์ต่างๆ เช่น บริการลูกค้า อีคอมเมิร์ซ การปรึกษาทางการแพทย์ และการดำเนินการเว็บเพจ นักวิจัยจะสร้างผู้ใช้งานจำลองเพื่อให้เอเจนต์ได้รับประสบการณ์การโต้ตอบที่มากขึ้นก่อนเปิดใช้งานจริง เพื่อทดสอบกลยุทธ์ รูปแบบการพูด และความทนทาน

การจำลองผู้ใช้ในบริบทการศึกษามีความซับซ้อนมากขึ้น นักเรียนมีขอบเขตความรู้ที่ค่อนข้างคงที่ นิสัยผิดพลาด และเส้นทางการเรียนรู้ของตนเอง สำหรับคำถามเดียวกัน บางคนอาจคำนวณเครื่องหมายผิด บางคนเข้าใจผิดแนวคิด บางคนสามารถสรุปคำตอบได้ด้วยตัวเองหลังได้รับคำใบ้ ขณะที่บางคนต้องการคำแนะนำที่ชัดเจนยิ่งขึ้น

ดิจิทัลทวินของนักเรียนมนุษย์ที่ถูกพูดถึงในช่วงไม่กี่วันที่ผ่านมา ก็เกิดขึ้นรอบๆ ความต้องการประเภทนี้

การสร้างแบบจำลองนักเรียนไม่ใช่หัวข้อใหม่

ตั้งแต่การติดตามความรู้แบบเบย์สในปี 1995 จนถึงการติดตามความรู้แบบลึก และการติดตามความรู้แบบให้ความสำคัญ ทิศทางนี้ได้รับการสำรวจโดยผู้ก่อนหน้ามาใกล้เคียง 30 ปี และมีความสุกงอมอย่างมากในการจับพฤติกรรมของนักเรียน

จุดบกพร่องร่วมกันของพวกมันคือ โมเดลยอมรับเฉพาะข้อมูลโครงสร้างเช่น คำถาม สถานะ และค่าทักษะเท่านั้น ไม่มีช่องทางรับคำแนะนำแบบภาษาธรรมชาติ ไม่ว่าครูจะพูดอะไร โมเดลเหล่านี้ไม่สามารถโต้ตอบและเปลี่ยนพฤติกรรมเหมือนนักเรียนได้

การให้โมเดลขนาดใหญ่รับบทเป็นนักเรียนดูเหมือนจะสะดวกมาก แค่เขียนว่า “คุณเป็นเด็กประถมที่มีพื้นฐานคณิตศาสตร์อ่อน” โมเดลก็สามารถเปลี่ยนเป็นน้ำเสียงของเด็กเล็กได้ทันที และแสดงความลังเลและความไม่มั่นใจได้

แต่โทนเสียงและระดับความเข้าใจของตัวละครไม่สอดคล้องกัน

แบบจำลองหนึ่งสามารถตอบคำถามว่า “ฉันไม่ค่อยเข้าใจ” ด้วยน้ำเสียงของเด็กประถม แต่ในประโยคถัดไปกลับให้การวิเคราะห์ระดับแคลคูลัส ดูเหมือนว่ามันกำลังแสดงบทบาทเป็นนักเรียน แต่คำตอบที่ได้ยังคงขึ้นอยู่กับความรู้ของแบบจำลองเอง ซึ่งอาจสูงกว่าระดับความรู้ที่ถูกจำกัดให้มี

เมื่อใช้ในการฝึกอบรมครู AI ความเบี่ยงเบนของระดับความเข้าใจนี้จะก่อให้เกิดปัญหา ติวเตอร์ไม่ได้รับปฏิกิริยาจากนักเรียนที่อยู่ที่ขอบเขตความสามารถปัจจุบัน แต่ได้รับปฏิกิริยาจากโมเดลที่มีความสามารถสูงซึ่งถูกห่อหุ้มด้วยตัวละคร

เช่นเดียวกัน จึงทำให้การใช้คำอธิบายความสามารถเพียงส่วนเดียวเป็นเงื่อนไข เป็นช่องทางที่อ่อนแอสำหรับโมเดลขนาดใหญ่ แนวทางนี้ถูกนำไปใช้อย่างแพร่หลายในบริบทการศึกษาในสองปีที่ผ่านมา รวมถึงข้อมูลการสนทนาเพื่อช่วยเหลือ การเรียนการสอนแบบหลายตัวแทน และการสร้างข้อมูลผู้เรียน พร้อมกันนั้น งานวิจัยชุดหนึ่งที่มุ่งตรวจสอบความถูกต้องของแนวทางนี้ก็เริ่มปรากฏขึ้น โดยตั้งคำถามจากสามมุมมอง ได้แก่ สถาปัตยกรรม มาตรฐานความถูกต้อง และประสบการณ์ของครูในการใช้งาน

ในทางการศึกษา การประเมินว่าการให้คำแนะนำมีประสิทธิภาพหรือไม่ มักไม่สามารถพิจารณาเพียงแค่ผลงานของนักเรียนเมื่อทำงานด้วยตนเองเท่านั้น แต่ต้องพิจารณาด้วยว่านักเรียนสามารถก้าวไปได้ไกลเพียงใดหลังจากได้รับความช่วยเหลือ

สิ่งที่วายกอตสกีเสนอไว้ในบริเวณการพัฒนาใกล้เคียง (zone of proximal development) คือช่องว่างระหว่างสิ่งที่นักเรียนสามารถทำได้ด้วยตัวเองกับสิ่งที่พวกเขาสามารถทำได้ภายใต้การสนับสนุนของครู ซึ่งสะท้อนถึงพื้นที่ที่การสอนสามารถเข้ามาแทรกแซงได้

ความคิดนี้ต่อมาถูกประเมินแบบเชิงพลวัต (dynamic assessment) ให้กลายเป็นขั้นตอนการวัดที่ปฏิบัติได้: ไม่เพียงแต่บันทึกว่านักเรียนตอบถูกหรือไม่ แต่ยังต้องสังเกตว่าหลังจากให้คำใบ้แล้ว ผลงานของเขาเปลี่ยนแปลงไปอย่างไร

วางบนตัวจำลองนักเรียน ความคิดนี้สอดคล้องกับทักษะสองประเภท

ประการแรก ตัวจำลองต้องสามารถเลียนแบบสถานะของนักเรียนเมื่อตอบคำถามด้วยตนเอง รวมถึงขีดจำกัดความสามารถ นิสัยการผิดพลาด และตัวเลือกที่พบบ่อย ประการที่สอง ตัวจำลองต้องสามารถเปลี่ยนแปลงได้เมื่ออ่านคำแนะนำจากครู และแสดงให้เห็นถึงการอัปเดตที่นักเรียนอาจเกิดขึ้นภายใต้การช่วยเหลือ

StudentSim

StudentSim กำหนดความสามารถสองประเภทนี้เป็น behavioral fidelity และ guidance responsiveness และใช้เกณฑ์เหล่านี้ในการฝึกและประเมินระบบจำลองนักเรียนแบบเฉพาะบุคคล

Large Model for Education

เครื่องจำลองนักเรียนต้องตอบคำถามสองข้อพร้อมกัน: เมื่อตอบแยกกัน แสดงพฤติกรรมเหมือนนักเรียนเป้าหมายหรือไม่ และหลังรับคำแนะนำจากครู แสดงการเปลี่ยนแปลงที่เกี่ยวข้องหรือไม่

ขั้นตอนการฝึกอบรมแบ่งเป็นสองขั้นตอน

ขั้นตอนที่หนึ่ง: รวบรวมข้อมูลจากนักเรียนหลายคนในสาขาเดียวกัน เพื่อฝึกโมเดลพฤติกรรมนักเรียนทั่วไป ระยะนี้เรียนรู้ข้อผิดพลาดทั่วไป รูปแบบคำตอบ และเส้นทางการแก้ไขหลังได้รับคำแนะนำ

ขั้นที่สอง ใช้บันทึกของนักเรียนแต่ละคนเพื่อฝึกต่อ เพื่อให้ได้ตัวจำลองที่ปรับแต่งเฉพาะบุคคล บันทึกของนักเรียนแต่ละคนมีน้อย การฝึกโดยตรงอาจทำให้เกิดการโอเวอร์ฟิต; การเรียนรู้รูปแบบของกลุ่มก่อน แล้วจึงปรับให้เข้ากับข้อมูลส่วนบุคคล จะช่วยให้ได้ตัวจำลองที่เสถียรสำหรับนักเรียนแต่ละคน

Large Model for Education

กระบวนการฝึกอบรม

ทีมวิจัยยังได้สร้าง StudentSimEval ซึ่งการประเมินครอบคลุมนักเรียนจริง 60 คน จากสามบริบทได้แก่ หมากรุก การเขียนภาษาอังกฤษเป็นภาษาที่สอง และคณิตศาสตร์พื้นฐาน

ในหมากรุก ตัวจำลองต้องทำนายการเดินของผู้เล่นในเกม และปรับการเดินตามคำแนะนำของโค้ช ในงานเขียนภาษาที่สอง ตัวจำลองต้องสร้างเรียงความที่สอดคล้องกับรูปแบบข้อผิดพลาดของผู้เรียน และแก้ไขส่วนต่างๆ ตามการแก้ไขของครู ในคณิตศาสตร์ ตัวจำลองต้องทำนายคำตอบของนักเรียน และแก้ไขหลังจากอธิบาย

งานเหล่านี้ดูแตกต่างกันมากในแง่ผิวเผิน แต่เป้าหมายการประเมินยังคงเหมือนกัน: ก่อนอื่นดูว่าตัวจำลองดูเหมือนนักเรียนคนนั้นจริงหรือไม่ แล้วจึงดูว่ามันสามารถตอบสนองต่อคำแนะนำได้หรือไม่ วิธีการทั้งหมดใช้บันทึกนักเรียนเดียวกัน และเปรียบเทียบบนบันทึกการทดสอบที่ถูกเก็บไว้เดียวกัน

ในผลการเล่นหมากรุก ค่า F ของ StudentSim อยู่ที่ 0.5150 และค่า R อยู่ที่ 0.9067; สำหรับ GPT-5.4 ค่าทั้งสองอยู่ที่ 0.2316 และ 0.7186 ตามลำดับ; ส่วน Maia2 อยู่ที่ 0.4535 และ 0.2721 ตามลำดับ ในการทดลองด้านการเขียนภาษาที่สองและคณิตศาสตร์ StudentSim ก็มีค่าทั้งสองตัวชี้วัดสูงกว่าฐานข้อมูลเปรียบเทียบ

Large Model for Education

ผลสองมิติจากการประเมินหมากรุกสากล GPT-5.4 มีการตอบสนองตามคำแนะนำที่ดี แต่มีความซื่อสัตย์ทางพฤติกรรมต่ำ; Maia2 ใกล้เคียงกับการเดินของผู้เล่นมากกว่า แต่ขาดช่องทางคำแนะนำด้วยภาษาธรรมชาติ; StudentSim อยู่ในตำแหน่งที่มีคะแนนสูงในทั้งสองตัวชี้วัด

ผลลัพธ์ชุดนี้แสดงการแบ่งหน้าที่อย่างชัดเจน GPT-5.4 สามารถอ่านคำแนะนำ แต่เมื่อจำลองนักเรียนเฉพาะราย ความถูกต้องยังไม่เพียงพอ Maia2 ใกล้เคียงกับวิธีการเดินของผู้เล่นหมากรุกมนุษย์มากกว่า แต่ไม่สามารถรับข้อมูลคำแนะนำจากภาษาธรรมชาติได้ StudentSim ได้รับการฝึกด้วยบันทึกการเรียนรู้จริง และปรับให้เหมาะกับนักเรียนแต่ละคน จึงได้รับการพัฒนาทั้งในด้านพฤติกรรมส่วนบุคคลและการตอบสนองต่อคำแนะนำ

อย่างไรก็ตาม ตัวจำลองนักเรียนเองไม่ใช่เป้าหมาย สิ่งที่ต้องการคือ ฟังก์ชันของมันต้องสามารถนำไปใช้ในโลกแห่งความเป็นจริง เพื่อปรับปรุงโมเดลของครู

ก่อนหน้านี้ การฝึก AI tutor ใช้สัญญาณรางวัลจากบทสนทนาการสอนคุณภาพสูงที่ผู้เชี่ยวชาญระบุไว้ หรือจากผู้ตัดสินแบบโมเดลขนาดใหญ่ทั่วไปที่ใช้มาตราส่วนการให้คะแนน นอกจากนี้ยังมีงานบางชิ้นที่พยายามเชื่อมรางวัลเข้ากับนักเรียนจำลอง แต่ใช้ LLM ที่ทำหน้าที่เป็นนักเรียนโดยไม่ได้จำลองระดับความรู้อย่างแท้จริง ไม่ใช่ตัวจำลองที่ฝึกจากข้อมูลนักเรียนจริง StudentSim นำเสนอวิธีการที่ต่างออกไปในจุดนี้

เอกสารวิจัยยังได้รวม StudentSim เข้าไปในกระบวนการเรียนรู้แบบเสริมแรงของตัวช่วยสอน AI

สถานการณ์การทดลองคือหมากรุก ระบบจะดึงการเดินที่นักเรียนจริงเคยผิดพลาดออกมา ก่อนที่ AI tutor จะสร้างคำแนะนำ จากนั้น StudentSim อ่านคำแนะนำแล้วให้การเดินที่แก้ไขแล้ว

Stockfish ใช้คำนวณการเปลี่ยนแปลงคุณภาพของการเดินที่แก้ไขเมื่อเปรียบเทียบกับการเดินที่ผิดพลาดเดิม คะแนนนี้จะถูกส่งกลับไปยังติวเตอร์เป็นสัญญาณ RL กลุ่มควบคุมประกอบด้วยติวเตอร์ที่ไม่มี RL และติวเตอร์ที่ใช้ GPT-5.4 เป็นตัวจำลองนักเรียนเพื่อให้รางวัล

Large Model for Education

คำแนะนำจากผู้สอน ตัวจำลองนักเรียน AI ที่ถูกระงับให้คำตอบที่แก้ไข ระบบอัปเดตผู้สอนตามการเปลี่ยนแปลงคุณภาพก่อนและหลังการแก้ไข

สามกลุ่มติวเตอร์ใช้โมเดลพื้นฐานเดียวกัน จุดเริ่มต้น SFT และการตั้งค่า GRPO เหมือนกัน แต่แหล่งรางวัลต่างกัน

หลังจากการประเมินแบบไม่รู้ตัวโดยผู้ประเมินหมากรุก ตัวสอนที่ฝึกด้วย StudentSim reward อยู่ในอันดับหนึ่งในด้านความแม่นยำ คุณภาพการให้คำแนะนำ และการให้คะแนนแบบส่วนบุคคล

ผู้เชี่ยวชาญให้คะแนนแบบไม่รู้ตัวในสามมิติ โดยมีลำดับการนำเสนอที่สุ่ม: ความถูกต้องวัดจากสัดส่วนของคำตอบที่ไม่มีข้อผิดพลาดเชิงข้อมูลที่ทำให้เข้าใจผิด ส่วนคุณภาพในการให้คำแนะนำและการปรับแต่งเฉพาะบุคคลให้คะแนนระหว่าง 1 ถึง 5 ตัว tutor ที่ฝึกด้วย StudentSim reward ได้คะแนนสูงสุดในทุกสามมิติ

สิ่งที่น่าสังเกตมากกว่านั้นคือผลการทดลองในกลุ่มย้อนกลับ: ตัวสอนที่ฝึกด้วย GPT-5.4 เป็นตัวจำลองนักเรียน มีความแม่นยำต่ำกว่า StudentSim แถมยังต่ำกว่าฐานรากที่ไม่ได้ใช้ RL เลย เนื่องจากอัตราความผิดพลาดทางข้อเท็จจริงร้ายแรงสูงอย่างชัดเจน ตัวจำลองที่ไม่สอดคล้องกับความเป็นจริงจะผลักครูให้ไปในทิศทางผิด: ตัวจำลองที่ระดับการรับรู้ไม่ตรงกับนักเรียนจริง แต่มีความสามารถในการเข้าใจสูงมาก จะสามารถสรุปคำตอบใดๆ ก็ตามได้แม้จากคำแนะนำที่ผิดเพี้ยนสุดๆ จึงให้รางวัลแบบสุ่มกับคำแนะนำที่ผิดพลาด ทำให้ RL ปรับปรุงไปในทิศทางที่สับสน (หรือแม้แต่ผิดพลาด)

StudentSim ไม่ได้แทนที่การทดลองของนักเรียนจริงในการวิจัยการศึกษา แต่แปลงบันทึกของนักเรียนจริงให้เป็นข้อมูลจำลองที่สามารถเรียกใช้ซ้ำได้ในขั้นตอนการฝึกอบรม ทำให้ AI tutor สามารถผ่านการคัดกรองและปรับปรุงหลายรอบก่อนเข้าสู่การศึกษาแบบมนุษย์

สำหรับระบบครู AI ที่ต้องการข้อเสนอแนะแบบเฉพาะบุคคล ตัวจำลองนักเรียนเหล่านี้ได้สืบทอดแนวคิดของตัวจำลองผู้ใช้ที่กำลังเป็นที่นิยมในช่วงไม่กี่ปีที่ผ่านมา (ทุกคนสามารถถูกจำลองได้ สร้างดิจิทัลทวินของมนุษย์) และเสนอทางด้านวิศวกรรมที่พลิกโฉม:

เรียนรู้จากความผิดพลาดของนักเรียน เรียนรู้ว่านักเรียนเปลี่ยนแปลงอย่างไรภายใต้การแนะนำ เพื่อให้สัญญาณย้อนกลับในระดับเวลาของการเรียนรู้ของเครื่องสำหรับการเรียนรู้แบบเสริมแรงของโมเดลครู

ข้อมูลอ้างอิง: https://arxiv.org/abs/2609.01591

บทความนี้มาจาก微信号 “NewZeal” โดยผู้เขียน: NewZeal; บรรณาธิการ: LRST

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา