StudentSim: Melatih 60 Pelajar Digital dengan Data Sebenar untuk Meningkatkan Pendidikan AI

icon MarsBit
Kongsi
AI summary iconRingkasan
Satu kajian baharu memperkenalkan StudentSim, sebuah simulator pelajar yang dilatih dengan data sebenar untuk meningkatkan sistem tutor AI. Model ini meniru tingkah laku dan respons pelajar, diuji terhadap 60 pelajar dalam catur, penulisan bahasa kedua, dan matematik asas. Ia mengungguli GPT-5.4 dan Maia2 dalam ketepatan tingkah laku dan responsiviti. Penyelidik mengintegrasikan StudentSim ke dalam kerangka pembelajaran penguatan untuk tutor AI, menunjukkan panduan yang lebih baik dalam ujian buta. Pembangunan ini selari dengan trend dalam pengaturan aset digital dan mencerminkan minat yang semakin meningkat terhadap likuiditi dan pasaran kripto.

Guru AI sudah mampu menyelesaikan banyak tugas pengajaran sekali jalan.

Satu soalan matematik, ia boleh menguraikan langkah-langkahnya; satu esei bahasa Inggeris, ia boleh mengenal pasti masalah tatabahasa; satu permainan catur, ia juga boleh menjelaskan strategi langkah seterusnya. Dalam banyak situasi, output model sudah cukup seperti seorang guru bantu yang sabar.

Namun, kesan pengajaran tidak boleh dinilai hanya dari sisi guru. Selepas murid mendengar, adakah mereka memperbaiki kesilapan, adakah mereka hanya mengikuti petunjuk, dan adakah penjelasan yang sama memberi kesan berbeza kepada murid yang berbeza—semua ini berlaku di sisi murid.

Guru AI yang ingin belajar panduan peribadi juga perlu memantau tindak balas pelajar secara berulang-ulang.

Dalam dunia nyata, tindak balas ini terutamanya datang daripada kajian manusia. Setiap penyesuaian strategi pengajaran memerlukan pelajar untuk terlibat, mengumpulkan interaksi, dan dinilai secara manual.

Model AI boleh dikemas kini dengan pantas, tetapi pengambilan maklum balas pendidikan dibatasi oleh tempoh eksperimen kajian manusia.

Model pendidikan

Pembimbing AI memerlukan maklum balas daripada pelajar untuk memperbaiki pengajaran, tetapi kos pengumpulan maklum balas sebenar tinggi. StudentSim ingin menukar rekod pelajar sebenar menjadi maklum balas agen yang boleh dipanggil semula semasa peringkat latihan.

Kaji terkini StudentSim, bermula daripada kontradiksi ini.

Pasukan penyelidik berhasrat untuk meningkatkan guru AI supaya memahami kekuatan dan kelemahan pelajar, serta memberikan panduan yang sesuai kepada setiap pelajar. Semasa proses kemajuan, pasukan memfokuskan masalah ini kepada simulator pelajar: adakah mungkin melatih pelajar AI yang boleh dinilai dan boleh digunakan semula menggunakan data pelajar sebenar, supaya guru AI mendapat lebih banyak maklum balas semasa peringkat latihan?

Model pendidikan

Pautan kertas: https://arxiv.org/abs/2609.01591

Pautan kod: https://github.com/microsoft/StudentSim

Laman utama Kertas Huggingface: https://huggingface.co/papers/2609.01591

Perkara ini tidak berasingan dalam kajian agen AI hari ini. Pengsimulasi pengguna sedang menjadi arah kajian yang popular, memasuki skenario seperti perkhidmatan pelanggan, e-dagang, konsultasi perubatan, dan pengendalian laman web. Para penyelidik akan membina pengguna simulasi supaya agen mengalami lebih banyak interaksi sebelum dilancarkan, untuk menguji strategi, perbualan, dan ketahanannya.

Simulasi pengguna dalam konteks pendidikan lebih kompleks. Pelajar mempunyai sempadan pengetahuan yang relatif stabil, kebiasaan salah, dan lintasan pembelajaran. Untuk soal yang sama, ada yang salah dalam tanda, ada yang salah faham konsep, ada yang boleh menyelesaikan jawapan sendiri selepas menerima petunjuk, dan ada yang memerlukan panduan yang lebih terus.

Digital twin pelajar manusia yang baru-baru ini dibincangkan juga dibangunkan berdasarkan keperluan semacam ini.

Membina model pelajar bukanlah topik baru

Dari pengejaran pengetahuan Bayesian pada tahun 1995, hingga pengejaran pengetahuan mendalam, dan kemudian pengejaran pengetahuan perhatian, arah ini telah dieksplorasi selama hampir 30 tahun dan sangat matang dalam memodelkan perilaku pelajar.

Kekurangan bersama mereka ialah model hanya menerima input terstruktur seperti soalan, keadaan, dan nilai kemampuan, tanpa sebarang entri untuk arahan bahasa semula jadi. Apa sahaja yang dikatakan oleh guru, model jenis ini tidak boleh berinteraksi untuk mengubah prestasi seperti pelajar.

Jika secara langsung meminta model besar berperan sebagai pelajar, kelihatan sangat mudah. Cukup tulis satu ayat, "Kamu adalah seorang pelajar sekolah rendah yang asas matematiknya lemah," dan model segera berpindah ke gaya bahasa pelajar muda, serta menunjukkan keraguan dan ketidakpastian.

Namun, nada dan tahap pemahaman peranan tidak sejajar.

Satu model boleh menjawab "Saya tak faham" dengan gaya kanak-kanak sekolah rendah, tetapi ayat seterusnya memberikan penaakulan tahap kalkulus. Ia kelihatan sedang berperan sebagai pelajar, tetapi responsnya masih dipengaruhi oleh simpanan pengetahuan model itu sendiri, yang mungkin jauh lebih tinggi daripada tahap pengetahuan yang dibataskan kepadanya.

Semasa melatih guru AI, biasa tingkat kognitif ini akan membawa masalah. Tutor tidak menerima tindak balas daripada pelajar pada sempadan kemampuan semasa, tetapi tindak balas daripada model berkeupayaan tinggi yang telah dibungkus dengan persona.

Just because of this, relying solely on a capability description as a condition is a very fragile pathway for large models. This approach has been widely applied to educational scenarios over the past two years, including conversational tutoring corpora, multi-agent classrooms, and learner data generation; at the same time, a group of studies specifically testing its validity are emerging, raising questions from three perspectives: architecture, fidelity benchmarks, and teacher user experience.

Dalam pendidikan, untuk menilai keberkesanan bimbingan, biasanya tidak cukup hanya melihat prestasi pelajar apabila menjawab secara berdikari, tetapi juga perlu melihat sejauh mana pelajar boleh maju setelah menerima bantuan.

Zon pengembangan terdekat (zone of proximal development) yang diajukan oleh Vygotsky membahas perkara ini: jarak antara apa yang boleh dilakukan pelajar secara berdikari dan apa yang boleh mereka lakukan dengan sokongan guru mencerminkan ruang di mana pengajaran boleh diperkenalkan.

Gagasan ini kemudian diubah menjadi prosedur pengukuran yang boleh dilaksanakan melalui penilaian dinamik: bukan sahaja merekod sama ada pelajar menjawab dengan betul atau tidak, tetapi juga memantau bagaimana prestasi mereka berubah selepas diberi petunjuk.

Diletakkan pada simulator pelajar, idea ini berkaitan dengan dua jenis kemahiran.

Pertama, simulasi mesti mampu mereplikasi keadaan pelajar semasa menjawab secara berdikari, termasuk sempadan kemampuan, kebiasaan kesilapan, dan pilihan biasa. Kedua, simulasi mesti mampu menghasilkan perubahan yang sesuai setelah membaca panduan guru, menunjukkan pembaruan yang mungkin berlaku pada pelajar tersebut apabila dibantu.

StudentSim

StudentSim mentakrifkan dua kemampuan ini masing-masing sebagai behavioral fidelity dan guidance responsiveness, dan menggunakan kedua-duanya untuk melatih dan menilai simulator pelajar peribadi.

Model pendidikan

Simulator pelajar perlu menjawab dua soalan secara serentak: adakah ia seperti pelajar sasaran apabila menjawab secara berasingan, dan adakah ia mengalami perubahan yang sesuai selepas menerima panduan daripada guru.

Proses latihan dibahagikan kepada dua langkah.

Langkah pertama menghimpun rekod daripada pelbagai pelajar dalam satu bidang, untuk melatih model tingkah laku pelajar generik. Fasa ini mempelajari kesilapan umum, format jawapan, dan laluan pembaikan selepas panduan.

Langkah kedua ialah meneruskan latihan menggunakan rekod masing-masing pelajar untuk mendapatkan simulator peribadi. Rekod seorang pelajar sahaja adalah sedikit, dan latihan terus mungkin menyebabkan overfitting; dengan mempelajari pola kumpulan terlebih dahulu, kemudian menyesuaikan dengan data peribadi, kita boleh memperoleh simulator yang lebih stabil untuk setiap pelajar.

Model pendidikan

Proses latihan

Pasukan penyelidik juga membina StudentSimEval. Penilaian merangkumi 60 pelajar sebenar, dari tiga skenario: catur, penulisan bahasa Inggeris sebagai bahasa kedua, dan matematik asas.

Dalam catur, simulator perlu meramalkan langkah seorang pemain dalam permainan, kemudian mengubah posisi selepas mendapat panduan daripada pelatih. Dalam penulisan bahasa kedua, simulator perlu menghasilkan esei yang mengikuti corak kesilapan pelajar, kemudian menulis semula petikan berdasarkan semakan guru. Dalam matematik, simulator perlu meramalkan jawapan pelajar, kemudian memperbaikinya selepas penjelasan.

Tugas-tugas ini kelihatan sangat berbeza, tetapi matlamat penilaian tetap sama: pertama, periksa sama ada simulator itu seperti pelajar sebenar, kemudian lihat sama ada ia mampu merespons arahan. Semua kaedah menggunakan rekod pelajar yang sama dan dibandingkan pada rekod ujian held-out yang sama.

Dalam keputusan catur, StudentSim memiliki F sebanyak 0.5150 dan R sebanyak 0.9067; GPT-5.4 masing-masing 0.2316 dan 0.7186; Maia2 masing-masing 0.4535 dan 0.2721. Dalam eksperimen penulisan bahasa kedua dan matematik, StudentSim juga melebihi garis dasar yang berkaitan pada kedua-dua indikator.

Model pendidikan

Hasil dua dimensi dalam penilaian catur. GPT-5.4 memberikan panduan yang baik, tetapi kebolehpercayaan tingkah laku rendah; Maia2 lebih dekat dengan langkah pemain catur, tetapi tidak mempunyai antaramuka panduan bahasa semula jadi; StudentSim berada pada kedudukan tinggi untuk kedua-dua indikator.

Hasil ini menunjukkan pembahagian tugas yang jelas. GPT-5.4 mampu membaca panduan, tetapi kurang setia dalam mensimulasikan pelajar tertentu. Maia2 lebih dekat dengan langkah pemain catur manusia, tetapi tidak mampu menyerap petunjuk pelatih dalam bahasa semula jadi. StudentSim dilatih menggunakan rekod pembelajaran sebenar dan disesuaikan untuk setiap pelajar, sehingga meningkatkan perilaku individu dan respons terhadap panduan secara serentak.

Namun, simulator pelajar itu sendiri bukanlah tujuan; matlamatnya ialah fungsinya perlu dapat diterapkan ke dunia nyata dan digunakan untuk memperbaiki model guru.

Sebelum ini, melatih AI tutor memperoleh isyarat ganjaran daripada dialog bimbingan berkualiti tinggi yang ditandai oleh pakar, dan yang lain daripada penilai model besar umum yang menggunakan skala penilaian. Ada juga usaha untuk menghubungkan ganjaran kepada pelajar simulasi, tetapi menggunakan pelajar LLM yang berperan sebagai pelajar tanpa keaslian tingkah laku kognitif, bukan simulator yang dilatih atas data pelajar sebenar. StudentSim mengusulkan pendekatan yang berbeza dalam hal ini.

Kertas ini selanjutnya memasukkan StudentSim ke dalam proses pembelajaran penguatan tutor AI.

Skenariu uji ialah catur. Sistem terlebih dahulu mengambil langkah salah yang pernah dibuat oleh pelajar sebenar, tutor AI menghasilkan panduan, dan StudentSim memberikan langkah yang telah diperbaiki setelah membaca panduan tersebut.

Stockfish digunakan untuk mengira perubahan kualiti antara langkah koreksi dan langkah kesilapan asal, skor ini dipulangkan kepada tutor sebagai isyarat RL. Kumpulan kawalan termasuk tutor tanpa RL, serta tutor yang menggunakan GPT-5.4 sebagai pemberi ganjaran simulasi pelajar.

Model pendidikan

Panduan Tutor, simulator pelajar AI yang dibekukan memberikan jawapan yang diperbaiki, sistem mengemas kini tutor berdasarkan perubahan kualiti sebelum dan selepas pindaan.

Tiga set tutor menggunakan model asas yang sama, titik permulaan SFT, dan tetapan GRPO, tetapi sumber ganjaran berbeza.

Selepas penilaian buta oleh evaluator catur, tutor yang dilatih dengan reward StudentSim mendapat tempat pertama dalam ketepatan, kualiti bimbingan, dan penilaian peribadi.

Pakar menilai buta tiga dimensi dalam keadaan urutan paparan yang tidak teratur: ketepatan berdasarkan peratusan jawapan yang "tidak mengandungi kesalahan fakta yang menyesatkan", serta kualiti panduan dan personalisasi masing-masing pada skala 1 hingga 5. Tutor yang dilatih dengan StudentSim reward mendapat kedudukan teratas dalam ketiga-tiga dimensi.

Yang lebih perlu diperhatikan ialah set eksperimen yang berlawanan: tutor yang dilatih menggunakan GPT-5.4 sebagai simulator pelajar tidak hanya kalah tepat berbanding StudentSim, tetapi juga lebih rendah daripada garis dasar yang tidak menggunakan RL sama sekali, disebabkan kadar kesalahan fakta serius yang jauh lebih tinggi. Simulator yang tidak setia akan menarik guru ke arah yang salah: simulator yang tahap kognitifnya tidak sepadan dengan pelajar sebenar, tetapi mempunyai kemampuan pemahaman yang sangat hebat, akan mampu menghasilkan jawapan sendiri walaupun arahan yang diberikan sangat tidak masuk akal, lalu memberikan ganjaran rawak kepada arahan yang salah, menyebabkan RL dioptimasi ke arah kekacauan (bahkan kesalahan).

StudentSim tidak menggantikan eksperimen pelajar sebenar daripada penyelidikan pendidikan. Ia mengubah rekod pelajar sebenar menjadi umpan balik simulasi yang boleh dipanggil semula semasa peringkat latihan, membolehkan tutor AI menyelesaikan lebih banyak pusingan penapisan dan pengoptimuman sebelum memasuki kajian manusia.

Bagi sistem guru AI yang memerlukan umpan balik peribadi, simulator pelajar semacam ini, yang melanjutkan aliran pemikiran terkini mengenai simulator pengguna (semua orang boleh disimulasikan, membina digital twin manusia), memberikan satu laluan kejuruteraan yang revolusioner:

Belajar bagaimana pelajar membuat kesilapan, belajar bagaimana pelajar berubah di bawah bimbingan, untuk memberikan isyarat umpan balik pada skala masa pembelajaran mesin bagi pembelajaran penguatan model guru.

Rujukan: https://arxiv.org/abs/2609.01591

Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: Sinzhiyuan; penyunting: LRST

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.