AI-учителя уже могут выполнять множество одноразовых обучающих задач.
Математическая задача — она может разложить решение по шагам; английское сочинение — она может указать на грамматические ошибки; шахматная партия — она может предложить следующий ход. Во многих сценариях вывод модели уже достаточно похож на терпеливого помощника.
Но эффективность обучения нельзя оценивать только со стороны преподавателя. То, исправляют ли студенты ошибки после прослушивания, действуют ли они только по подсказкам, и по-разному ли одна и та же объяснительная фраза влияет на разных студентов — всё это происходит на стороне студента.
AI-учителю, чтобы освоить персонализированное руководство, также необходимо многократно наблюдать за реакцией студентов.
В реальности эти реакции в основном поступают из человеческих исследований. Каждый раз при корректировке обучающей стратегии необходимо привлекать студентов, собирать взаимодействия и проводить оценку вручную.
AI-модели можно быстро обновлять, но получение образовательной обратной связи ограничено циклом человеческих исследований.

AI-репетитору нужны отзывы студентов для улучшения обучения, но сбор реальных отзывов сопряжен с высокими затратами. StudentSim стремится преобразовать записи реальных студентов в агентные отзывы, которые можно многократно использовать на этапе обучения.
Недавние исследования StudentSim, исходя из этого противоречия.
Исследовательская команда стремится улучшить ИИ-учителя, чтобы он мог понимать сильные и слабые стороны студентов и предоставлять подходящие рекомендации для каждого ученика. В процессе продвижения команда сосредоточилась на симуляторе студентов: можно ли с помощью данных реальных студентов обучить ИИ-студентов, которые могут оцениваться и повторно использоваться, чтобы ИИ-учитель получал больше обратной связи на этапе обучения.

Ссылка на статью: https://arxiv.org/abs/2609.01591
Ссылка на код: https://github.com/microsoft/StudentSim
Главная страница статьи Huggingface: https://huggingface.co/papers/2609.01591
Этот вопрос не является изолированным в контексте современных исследований AI-агентов. Симуляторы пользователей становятся популярным направлением исследований и применяются в сценариях, таких как служба поддержки, электронная коммерция, медицинские консультации и взаимодействие с веб-страницами. Исследователи создают симуляторы пользователей, чтобы агенты проходили через большее количество взаимодействий до выхода в продакшн, что позволяет тестировать стратегии, формулировки и устойчивость.
Симуляция пользователей в образовательных сценариях более сложна. У студентов есть относительно стабильные границы знаний, привычки к ошибкам и траектории обучения. Одну и ту же задачу кто-то решает с ошибкой в знаках, кто-то неправильно понимает концепцию, кто-то после подсказки может самостоятельно прийти к ответу, а кому-то нужна более прямая инструкция.
Недавно обсуждаемые цифровые двойники человеческих студентов также разрабатываются вокруг таких потребностей.
Моделирование студентов — не новая тема
От байесовского отслеживания знаний 1995 года до глубокого отслеживания знаний и далее до отслеживания знаний с вниманием — это направление было изучено предшественниками в течение почти 30 лет и весьма зрело в моделировании поведения студентов.
Их общим недостатком является то, что модель принимает только структурированные входные данные, такие как вопросы, состояния и значения способностей, и не имеет входа для приема естественного языка. Независимо от того, что говорит учитель, такие модели не могут взаимодействовать и изменять свое поведение, как это делает ученик.
Если сразу заставить большую модель сыграть ученика, это выглядит удобно. Достаточно написать ей: «Ты — младшеклассник с слабыми математическими знаниями», и модель сразу переключится на манеру речи младшего ученика, а также продемонстрирует колебания и неуверенность.
Однако тон и уровень осведомленности персонажа не совпадают.
Модель может отвечать на вопрос «Я не очень понимаю» простым языком, как школьник, но в следующем предложении приводит рассуждения уровня высшей математики. Она словно играет роль ученика, однако её ответы всё равно определяются собственными знаниями модели, которые могут значительно превышать те, которые ей якобы ограничены.
При обучении ИИ-учителя такой когнитивный дисбаланс вызывает проблемы. Наставник получает не реакцию ученика на границе его текущих способностей, а реакцию модели с высокими способностями, обернутой в персонаж.
Именно поэтому одно лишь описание способностей в качестве условия представляет собой очень хрупкий канал для крупных моделей. В последние два года этот подход широко применялся в образовательных сценариях: диалоговые обучающие корпусы, многоагентные классы и генерация данных обучающихся используются повсеместно; одновременно появляется ряд исследований, специально направленных на проверку их валидности, которые ставят под сомнение этот подход с точки зрения архитектуры, базисов достоверности и опыта использования учителями.
В педагогике оценить эффективность руководства нельзя только по тому, как студент справляется с заданием самостоятельно, но и по тому, насколько далеко он продвигается после получения помощи.
То, о чем говорил Выготский, — зона ближайшего развития, — это разница между тем, что студент может сделать самостоятельно, и тем, что он может сделать при поддержке учителя; эта разница отражает пространство, в которое может вмешаться обучение.
Эта идея позже была реализована в виде динамической оценки как измеримая процедура: необходимо не только фиксировать, правильно ли студент ответил, но и наблюдать, как его производительность изменяется после предоставления подсказок.
На симуляторе для студентов эта идея соответствует двум типам навыков.
Во-первых, симулятор должен воспроизводить состояние студента при самостоятельном выполнении заданий, включая его границы способностей, привычки к ошибкам и типичные выборы. Во-вторых, симулятор должен изменяться после получения инструкций от преподавателя, демонстрируя возможные обновления студента под влиянием помощи.
StudentSim
StudentSim определяет эти два типа способностей как behavioral fidelity и guidance responsiveness и на их основе обучает и оценивает персонализированные студенческие симуляторы.

Симулятор студента должен одновременно отвечать на два вопроса: ведет ли себя при самостоятельном ответе как целевой студент и изменяется ли его поведение после получения руководства от преподавателя.
Процесс обучения состоит из двух шагов.
На первом этапе собираются записи нескольких студентов в рамках одной области для обучения общей модели поведения студентов. На этом этапе изучаются типичные ошибки, форматы ответов и пути коррекции после инструктажа.
На втором этапе продолжите обучение с использованием данных отдельного студента, чтобы получить персонализированный симулятор. Поскольку данные одного студента ограничены, прямое обучение может привести к переобучению; сначала изучите общие закономерности группы, а затем адаптируйтесь к индивидуальным данным — это позволит более стабильно получить симулятор для каждого студента.

Процесс обучения
Исследовательская команда также создала StudentSimEval. Оценка охватывает 60 реальных студентов из трех сценариев: шахматы, написание английского языка как второго языка и базовая математика.
В шахматах симулятор должен предсказать ход игрока в партии и изменить его после инструктажа тренера. При изучении второго языка симулятор должен генерировать сочинения, соответствующие ошибкам учащегося, и переписывать фрагменты после проверки преподавателем. В математике симулятор должен предсказать ответ студента и исправить его после объяснения.
Эти задачи внешне сильно различаются, но цель оценки остаётся одинаковой: сначала проверить, насколько симулятор похож на самого студента, а затем — насколько он способен реагировать на инструкции. Все методы используют один и тот же набор записей студента и сравниваются на одних и тех же удержанных тестовых записях.
В результатах шахмат: у StudentSim F = 0,5150, R = 0,9067; у GPT-5.4 — 0,2316 и 0,7186; у Maia2 — 0,4535 и 0,2721. В экспериментах по письму на втором языке и математике StudentSim также превзошел соответствующие базовые модели по обоим показателям.

Двумерные результаты оценки шахмат. GPT-5.4 лучше следует инструкциям, но имеет низкую поведенческую достоверность; Maia2 ближе к ходам шахматистов, но не имеет входа для естественного языка; StudentSim занимает позицию с высокими показателями по обоим критериям.
Эти результаты демонстрируют четкое разделение ролей. GPT-5.4 может читать инструкции, но при моделировании конкретных студентов обладает недостаточной точностью. Maia2 более точно воспроизводит ходы человеческих шахматистов, но не может усваивать естественно-языковые подсказки тренеров. StudentSim обучен на реальных данных обучения и адаптируется под каждого студента, что позволяет достичь улучшения как в индивидуальном поведении, так и в реакции на инструкции.
Однако сам симулятор студентов не является целью; конечная задача — чтобы его функциональность могла быть применена в реальном мире и использована для улучшения модели преподавателя.
Ранее для обучения ИИ-репетитора сигналы вознаграждения в некоторых работах поступали от экспертов, аннотировавших качественные диалоги репетиторства, а в других — от универсальных крупных моделей, оценивающих по шкалам. Также существовали попытки подключить вознаграждение к симуляторам студентов, однако использовались ролевые модели LLM с нереалистичным уровнем когнитивных способностей, а не симуляторы, обученные на данных реальных учащихся. StudentSim предлагает иной подход в этом аспекте.
Далее статья интегрирует StudentSim в процесс усиленного обучения ИИ-репетитора.
Сценарий эксперимента — шахматы. Система сначала извлекает ошибочные ходы, допущенные реальными студентами, ИИ-репетитор генерирует руководство, а StudentSim, ознакомившись с руководством, предлагает исправленный ход.
Stockfish используется для вычисления изменения качества исправленного хода по сравнению с исходным ошибочным ходом; этот балл возвращается наставнику в качестве сигнала обучения с подкреплением. Контрольная группа включает наставника без обучения с подкреплением, а также наставника, использующего GPT-5.4 в качестве симулятора ученика для оценки.

Руководство по генерации репетитора, замороженный симулятор AI-ученика предоставляет исправленный ответ, система обновляет репетитора на основе изменения качества до и после исправления.
Три группы тьюторов используют одну и ту же базовую модель, точку входа SFT и настройки GRPO, но разные источники наград.
После слепой оценки шахматными оценщиками, тьютор, обученный с помощью StudentSim reward, занял первое место по точности, качеству руководства и персонализации.
Эксперты слепо оценивали три измерения в случайном порядке: точность — по доле ответов, не содержащих вводящих в заблуждение фактических ошибок, а качество руководства и персонализация — по шкале от 1 до 5. Tutor, обученный с использованием StudentSim reward, занял первое место по всем трем измерениям.
Более того, в обратном эксперименте: tutor, обученный с использованием GPT-5.4 в качестве симулятора ученика, показал точность ниже, чем StudentSim, и даже ниже базовой модели без RL. Это связано с явно более высоким уровнем серьезных фактических ошибок. Неточная симуляция вводит учителя в заблуждение: симулятор, чей уровень познаний не соответствует реальным ученикам, но обладает исключительно сильными способностями к пониманию, способен самостоятельно вывести какой-либо ответ даже на самые абсурдные инструкции, и поэтому выдает случайные награды за неверные инструкции — в результате RL оптимизируется в хаотичном (или даже ошибочном) направлении.
StudentSim не заменяет реальные студенты в образовательных исследованиях. Он преобразует реальные записи студентов в симулированную обратную связь, которую можно многократно использовать на этапе обучения, позволяя AI-репетитору пройти больше циклов отбора и оптимизации до начала исследований с участием людей.
Для систем ИИ-учителей, требующих персонализированной обратной связи, такие симуляторы студентов, продолжающие идеологическую линию недавно популярных симуляторов пользователей (все люди могут быть смоделированы, создается цифровой двойник человека), предлагают революционный инженерный путь:
Изучайте, как студенты допускают ошибки, и как они меняются под руководством, чтобы предоставить сигналы обратной связи на масштабе машинного обучения для усиления обучения учебной модели.
Ссылки: https://arxiv.org/abs/2609.01591
Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: Новости ИИ; редактор: LRST
