StudentSim:使用真實數據訓練 60 名數位學生,以提升 AI 家教

icon MarsBit
分享
AI summary icon精華摘要
一項新研究推出了 StudentSim,這是一款利用真實數據訓練的學生模擬器,旨在提升 AI 家教系統的表現。該模型模擬學生的行為與回應,並在國際象棋、第二語言寫作和基礎數學等領域對 60 名學生進行測試,其行為準確性與反應能力均優於 GPT-5.4 和 Maia2。研究人員將 StudentSim 整合至強化學習框架中,用於 AI 家教系統,在盲測中展現出更佳的指導效果。此項發展與數位資產監管趨勢一致,並反映市場對流動性與加密貨幣市場日益增長的興趣。

AI 教師已經可以完成不少單次教學任務。

一道數學題,它能拆解步驟;一篇英文作文,它能指出語法問題;一盤棋,它也能講出下一步思路。在許多情境中,模型的輸出已足夠像一位耐心的助教。

但教學效果不能只看教師端。學生聽完之後有沒有改正錯誤,是否只是照著提示走,同一句講解對不同學生是否產生不同效果,這些都發生在學生端。

AI 教師如果要學習個性化指導,也需要反覆觀察學生反應。

在現實中,這些反應主要來自 human study。每次調整教學策略,都要組織學生參與,收集交互,再由人工評估。

AI 模型可以快速更新,但教育反饋的獲取速度受 human study 實驗週期限制。

教育大模型

AI 家教需要學生反饋來改進教學,但真實反饋的收集成本較高。StudentSim 希望將真實學生記錄轉化為訓練階段可反覆調用的代理反饋。

近期研究 StudentSim,從這個矛盾出發。

研究團隊希望提升 AI 教師,使其理解學生的優勢與劣勢,並根據不同學生提供合適的指導。在推進過程中,團隊將問題聚焦於學生模擬器:能否利用真實學生數據訓練出可評估、可重複使用的 AI 學生,讓 AI 教師在訓練階段獲得更多反饋?

教育大模型

論文連結:https://arxiv.org/abs/2609.01591

代碼連結:https://github.com/microsoft/StudentSim

Huggingface 論文主頁:https://huggingface.co/papers/2609.01591

在今天的 AI agent 研究中,這件事並非孤立存在。User simulator 正成為熱門的研究方向,應用於客服、電商、醫療問診、網頁操作等場景。研究者會構建模擬用戶,讓 agent 在上線前經歷更多互動,測試策略、話術和魯棒性。

教育場景中的用戶模擬更為複雜。學生具有相對穩定的知識邊界、錯誤習慣和學習軌跡。同一道題目,有人會算錯符號,有人會誤解概念,有人聽完提示後能自行推導出答案,有人則需要更直接的指導。

近年來被討論的人類學生數位孿生,也正是圍繞此類需求展開。

建模學生並不是新題目

從1995年的貝葉斯知識追蹤,到深度知識追蹤,再到注意力知識追蹤,這一方向已由前人探索近30年,在擬合學生行為方面相當成熟。

它們的共同缺口在於,模型僅接受題目、狀態、能力值等結構化輸入,沒有接收自然語言指導的入口。無論教師說了什麼,這類模型無法互動並像學生一樣改變表現。

如果直接讓大模型扮演學生,看起來很方便。給它寫一句「你是一個數學基礎薄弱的小學生」,模型可以立刻換成低齡學生口吻,也能表現出猶豫和不確定。

但角色的語氣和認知水平並不一致。

一個模型可以用小學生的口吻回答「我不太懂」,下一句卻提供微積分等級的推理。它看起來在扮演學生,實際回饋仍受模型自身知識儲備影響,可能遠遠高於它被限制擁有的知識水平。

在 AI 教師訓練時,這種認知水平偏差會帶來問題。導師獲得的並非某位學生在當前能力邊界下的反應,而是一個經過角色設定包裝的高能力模型的反應。

也正因如此,僅靠一段能力描述作為條件,對大模型而言,是一條非常脆弱的條件通道。這條路徑近兩年被廣泛應用於教育場景,對話輔導語料、多智能體課堂、學習者數據生成都在使用;與此同時,一批專門檢驗其效度的研究也陸續出現,從架構、保真度基準、教師使用體驗三個角度提出質疑。

在教育學中,評估一次指導是否有效,通常不能只看學生獨立作答時的表現,也要看學生在接受幫助後能走多遠。

維果茨基提出的最近發展區(zone of proximal development)討論的就是這件事:學生目前能獨立完成什麼,與在教師支持下能夠完成什麼之間的差距,反映了教學可以介入的空間。

這個想法後來被動態評估(dynamic assessment)落實為可操作的測量程序:不僅記錄學生答對與否,還要在提供提示後觀察其表現的變化。

放在學生模擬器上,這個思想對應兩類能力。

第一,模擬器需能還原學生獨立作答時的狀態,包括能力邊界、錯誤習慣和常見選擇。第二,模擬器需能在讀取教師指導後產生相應變化,展現該學生在協助下可能出現的更新。

StudentSim

StudentSim 將這兩類能力分別定義為 behavioral fidelity 和 guidance responsiveness,並據此訓練和評估個性化學生模擬器。

教育大模型

學生模擬器需要同時回答兩個問題:獨立作答時是否像目標學生,接受教師指導後是否產生相應變化。

訓練流程分為兩步。

第一步彙總該領域內多名學生的記錄,以訓練通用的學生行為模型。此階段學習共同錯誤、回答格式以及指導後的修正路徑。

第二步使用單個學生自己的記錄繼續訓練,以獲得個性化模擬器。單名學生的記錄較少,直接訓練容易過擬合;先學習群體規律,再適配個人數據,可更穩定地為每位學生取得對應的模擬器。

教育大模型

訓練流程

研究團隊同時構建了 StudentSimEval。評估涵蓋來自國際象棋、第二語言英語寫作和基礎數學三個場景的 60 位真實學生。

在國際象棋中,模擬器需預測玩家在棋局中的走法,並在教練指導後調整走位;在二語寫作中,模擬器需生成符合學習者錯誤模式的作文,並根據教師批改修改段落;在數學中,模擬器需預測學生的答案,並在講解後進行修正。

這些任務表面差異很大,但評估目標保持一致:先看模擬器是否像學生本人,再看它能否回應指導。所有方法使用同一份學生記錄,在相同的 held-out 測試記錄上進行比較。

在國際象棋結果中,StudentSim 的 F 為 0.5150,R 為 0.9067;GPT-5.4 分別為 0.2316 和 0.7186;Maia2 分別為 0.4535 和 0.2721。在二語寫作和數學實驗中,StudentSim 在這兩個指標上也超過了對應的基線。

教育大模型

國際象棋評測中的二維結果。GPT-5.4 的響應指導較好,但行為保真度較低;Maia2 更貼近棋手的走法,但缺乏自然語言指導入口;StudentSim 則在兩項指標上均處於較高水平。

這組結果呈現出清晰的分工。GPT-5.4 能閱讀指導,但在模擬具體學生時保真度不足。Maia2 更貼近人類棋手的走法,卻無法吸收自然語言教練的提示。StudentSim 透過真實學習記錄進行訓練,並為每位學生進行適配,在個體行為與指導響應兩方面均獲得提升。

但學生模擬器本身並非目的,最終目標是其功能需能落地至現實世界,並用於改進教師模型。

以往訓練 AI 家教時,獎勵信號部分來自專家標註的優質輔導對話,另一部分則來自使用評分量表的通用大模型裁判。也有研究嘗試將獎勵連接到模擬學生上,但所採用的都是認知水平不真實的角色扮演 LLM 學生,而非在真實學習者數據上訓練的模擬器。StudentSim 在這一點上提出了不同的做法。

論文進一步將 StudentSim 融入 AI 家教的強化學習流程。

實驗場景為國際象棋。系統先取出真實學生曾犯的錯誤走法,AI 教練生成指導,StudentSim 閱讀指導後提供修正走法。

Stockfish 用於計算修正走法相對於原錯誤走法的品質變化,此分數會回傳給 tutor 作為 RL 信號。對照組包括無 RL 的 tutor,以及使用 GPT-5.4 作為學生模擬器獎勵的 tutor。

教育大模型

Tutor 生成指導,凍結的 AI 學生模擬器提供修正答案,系統根據修正前後的品質變化更新 Tutor。

三組 tutor 使用相同的基礎模型、SFT 起點和 GRPO 設定,獎勵來源不同。

國際象棋評估者進行盲評後,StudentSim reward 訓練出的 tutor 在準確性、指導品質和個性化評分上均排在第 1 名。

專家在亂序呈現的條件下盲評三個維度:準確性評估「無誤導性事實錯誤」的回答比例,指導質量與個性化各為1至5分。經StudentSim reward訓練的導師在三個維度上均排名第一。

更值得注意的是反向實驗的結果:使用 GPT-5.4 作為學生模擬器訓練出的導師,其準確性不僅低於 StudentSim,甚至低於完全未進行 RL 的基線,主要問題在於其嚴重事實錯誤率明顯更高。模擬器若缺乏真實性,會將教師引向錯誤方向:一個認知水平不符合真實學生、但理解能力極強的模擬器,即使面對再荒謬的指導也能自行推導出某種答案,並對錯誤指導給予隨機獎勵,導致 RL 向混亂(甚至錯誤)的方向優化。

StudentSim 沒有取代教育研究中的真實學生實驗。它將真實學生記錄轉化為訓練階段可重複調用的模擬回饋,讓 AI 家教在進入人體研究前完成更多輪篩選和優化。

對於需要個性化反饋的 AI 教師系統,此類學生模擬器延續了近期熱門的用戶模擬器的思想脈絡(所有人皆可模擬,構建人類的數位孿生),提供了一條顛覆性的工程路徑:

學習學生如何出錯,學習學生如何在指導下改變,為教師模型的強化學習提供機器學習時間尺度的回饋訊號。

參考資料:https://arxiv.org/abs/2609.01591

本文來自微信公眾號「新智元」,作者:新智元;編輯:LRST

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露