StudentSim: Навчання 60 цифрових студентів за допомогою реальних даних для покращення AI-тutoring

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Нове дослідження представляє StudentSim — симулятор учнів, навчений на реальних даних для покращення систем штучного інтелекту для навчання. Модель імітує поведінку та відповіді учнів, протестована на 60 учнях у шахах, написанні на другій мові та базовій математиці. Вона перевершила GPT-5.4 та Maia2 за точністю поведінки та відгуком. Дослідники інтегрували StudentSim у рамки підсилювального навчання для AI-репетиторів, що продемонструвало краще супроводження в сліпих тестах. Розробка відповідає тенденціям у регулюванні цифрових активів та відображає зростаючий інтерес до ліквідності та криптовалютних ринків.

AI-викладачі вже можуть виконувати багато одноразових навчальних завдань.

Математична задача — вона може розкласти кроки; англійський твір — вона може вказати на граматичні помилки; шахова партія — вона може запропонувати наступний хід. У багатьох сценаріях вихідні дані моделі вже достатньо схожі на терплячого помічника.

Але ефективність навчання не можна оцінювати лише з боку викладача. Чи виправляють учні помилки після пояснення, чи просто дотримуються підказок, чи одне й те саме пояснення має різний ефект на різних учнів — все це відбувається на стороні учнів.

AI-викладачу, якщо він має вивчати персоналізоване навчання, також потрібно повторно спостерігати за реакцією студентів.

У реальності ці реакції здебільшого походять з human study. Кожного разу, коли вносяться зміни до навчальної стратегії, потрібно залучати студентів, збирати взаємодії та оцінювати їх вручну.

Моделі ШІ можуть швидко оновлюватися, але отримання освітніх відгуків обмежено циклами людських досліджень.

Навчання великих моделей

AI-репетитору потрібні відгуки студентів для покращення навчання, але збір реальних відгуків супроводжується високими витратами. StudentSim прагне перетворити записи реальних студентів на агентські відгуки, які можна повторно використовувати на етапі навчання.

Останні дослідження StudentSim, виходячи з цього суперечного моменту.

Дослідницька команда прагне покращити AI-вчителя, щоб він розумів сильні та слабкі сторони учнів і надавав відповідні рекомендації для кожного учня. У процесі розвитку команда зосередилася на симуляторі учнів: чи можна за допомогою реальних даних учнів навчити AI-учнів, яких можна оцінювати та повторно використовувати, щоб AI-вчитель отримував більше зворотного зв’язку на етапі навчання.

Навчання великих моделей

Посилання на статтю: https://arxiv.org/abs/2609.01591

Посилання на код: https://github.com/microsoft/StudentSim

Головна сторінка статті Huggingface: https://huggingface.co/papers/2609.01591

Цей підхід не є ізольованим у сучасних дослідженнях AI-агентів. Симулятори користувачів стають популярним напрямком досліджень і застосовуються в сценах, таких як служба підтримки, електронна комерція, медичні консультації та взаємодія з веб-сайтами. Дослідники створюють симульованих користувачів, щоб агенти проходили більше взаємодій до запуску, щоб тестувати стратегії, формулювання та стійкість.

Сценарії моделювання користувачів у навчанні складніші. У студентів є відносно стабільні межі знань, помилкові звички та навчальні траєкторії. Одна й та ж задача: хтось помиляється у знаках, хтось неправильно розуміє концепцію, хтось після підказки може самостійно дійти до відповіді, а хтось потребує більш прямої інструкції.

Останнім часом обговорювані цифрові близнюки людських студентів також розробляються з урахуванням таких потреб.

Моделювання студентів — це не нова тема

Від байєсівського слідкування за знаннями 1995 року до глибокого слідкування за знаннями та уважного слідкування за знаннями — цей напрямок був досліджений попередниками майже 30 років і дуже добре вдосконалений у моделюванні поведінки студентів.

Їхньою спільною недоліком є те, що модель приймає лише структуровані вхідні дані, такі як питання, стан і значення здібностей, але не має входу для прийняття природної мови. Незалежно від того, що сказав вчитель, такі моделі не можуть взаємодіяти та змінювати поведінку, як це робить учень.

Якщо безпосередньо дати великої моделі роль учня, це здається зручним. Написавши їй: «Ти — початківець у математиці, учень початкової школи», модель миттєво переключиться на мову молодшого учня та продемонструє коливання та невпевненість.

Але тон і рівень розуміння персонажа не збігаються.

Модель може відповідати дитячим тоном «Я не дуже розумію», але в наступному реченні наводити міркування рівня математичного аналізу. Вона на вигляд грає роль учня, але реальні відповіді все одно визначаються знаннями самої моделі, які можуть бути набагато вищими, ніж ті, які їй обмежено надано.

Під час навчання AI вчителя таке упередження рівня пізнання може призвести до проблем. Тьютор отримує не реакцію студента на межі його поточних здібностей, а реакцію моделі високого рівня, оберненої в персонаж.

Саме через це одного опису здібностей як умови для великих моделей є дуже хрупким каналом умов. Цей підхід протягом останніх двох років активно застосовувався в освітніх сценаріях: діалогові навчальні корпуси, багатоагентні класи та генерація даних учнів — усе це використовує цей підхід; одночасно з’являється низка досліджень, спеціально спрямованих на перевірку його валідності, які ставлять під сумнів його з точки зору архітектури, базисів правдоподібності та досвіду використання вчителями.

У педагогіці оцінка ефективності навчання зазвичай не базується лише на тому, як учень впорався з завданням самостійно, а й на тому, наскільки далеко він зміг просунутися після отримання допомоги.

Виготський розглядав зону ближчого розвитку (zone of proximal development) саме це: різниця між тим, що учень може зробити самостійно, і тим, що він може зробити під підтримкою вчителя, — ця різниця відображає простір, у якому може втрутитися навчання.

Ця ідея пізніше була перетворена на динамічну оцінку (dynamic assessment) у вигляді практичної процедури вимірювання: потрібно не лише фіксувати, чи відповів студент правильно, а й спостерігати, як його продуктивність змінюється після надання підказок.

На симуляторі студентів ця ідея відповідає двом типам здібностей.

По-перше, симулятор має здатність відтворювати стан учня під час самостійної відповіді, включаючи межі здібностей, помилкові звички та поширені вибори. По-друге, симулятор має здатність змінюватися після отримання вказівок від вчителя, демонструючи можливі оновлення учня під впливом допомоги.

StudentSim

StudentSim визначає ці два типи здібностей як behavioral fidelity та guidance responsiveness і на основі цього навчає та оцінює персоналізовані симулятори студентів.

Навчання великих моделей

Симулятор студентів повинен одночасно відповідати на два питання: чи він веде себе як цільовий студент при самостійній відповіді, і чи виникають відповідні зміни після отримання інструкцій від викладача.

Процес навчання складається з двох етапів.

На першому етапі збираються дані про поведінку кількох студентів у певній галузі для навчання універсальної моделі поведінки студентів. На цьому етапі вивчаються типові помилки, формати відповідей та шляхи виправлення після інструктажу.

На другому етапі продовжуйте навчання за допомогою індивідуальних даних кожного учня, щоб отримати персоналізований симулятор. Оскільки дані окремого учня обмежені, пряме навчання може призвести до переоснащення; спочатку вивчення загальних закономірностей групи, а потім адаптація до індивідуальних даних дозволяє більш стабільно отримувати симулятори для кожного учня.

Навчання великих моделей

Процес навчання

Дослідницька команда також створила StudentSimEval. Оцінка охоплює 60 реальних учнів із трьох сценаріїв: шахи, написання англійської мови як другої мови та базова математика.

У шахах симулятор має передбачити хід гравця в партії та змінити його після інструктажу тренера. У письмовій мові як другої мови симулятор має генерувати твори, що відповідають помилковим шаблонам учня, і переписувати фрагменти після перевірки викладачем. У математиці симулятор має передбачити відповідь учня та виправити її після пояснення.

Ці завдання зовні дуже відрізняються, але мета оцінки залишається однаковою: спочатку перевіряється, чи симулятор виглядає як сам студент, а потім — чи він може реагувати на інструкції. Усі методи отримують однаковий запис студента і порівнюються на одних і тих самих тестових записах, що виключені.

У результативних даних шахів: StudentSim має F = 0,5150 та R = 0,9067; GPT-5.4 — 0,2316 та 0,7186; Maia2 — 0,4535 та 0,2721. У експериментах з письмом як другою мовою та математикою StudentSim також перевищує відповідні базові моделі за обома показниками.

Навчання великих моделей

Двовимірні результати оцінки шахів. GPT-5.4 краще відповідає на інструкції, але має нижчу поведінкову відповідність; Maia2 ближче до ходів гравців, але не має входу для природної мови; StudentSim знаходиться на високому рівні за обидва показники.

Цей набір результатів демонструє чітке розподілення обов’язків. GPT-5.4 може читати інструкції, але недостатньо точно моделює поведінку конкретних учнів. Maia2 ближча до ходів людських гравців, але не може засвоювати підказки тренера у природній мові. StudentSim навчений на реальних записах навчання та адаптується під кожного учня, що дозволяє покращити як індивідуальну поведінку, так і відповіді на інструкції.

Проте сам симулятор учнів не є метою; фінальна мета — це те, щоб його функції могли бути реалізовані у реальному світі та використані для покращення моделей викладачів.

Раніше для навчання AI-наставника сигнали нагороди походили з якісних діалогів наставництва, анотованих експертами, або від загальних великих моделей-суддів, що використовували шкали оцінки. Деякі дослідження намагалися підключити нагороду до симулятора учня, але використовували LLM-учнів, які грали ролі без реалістичного відтворення когнітивного рівня, а не симуляторів, навчених на даних реальних учнів. StudentSim пропонує інший підхід у цьому аспекті.

Стаття далі інтегрує StudentSim у процес підсиленого навчання AI-репетитора.

Сценарій експерименту — шахи. Система спочатку вилучає реальні помилкові ходи учнів, AI-наставник генерує рекомендації, а StudentSim після ознайомлення з рекомендаціями надає виправлені ходи.

Stockfish використовується для обчислення зміни якості виправленого ходу щодо початкового помилкового ходу; цей бал повертається до наставника як сигнал RL. Контрольна група включає наставника без RL та наставника, що використовує GPT-5.4 як симулятор учня для нагороди.

Навчання великих моделей

Генерація наставництва, заморожений симулятор AI-учнів надає виправлену відповідь, система оновлює наставника на основі змін якості до та після виправлення.

Три групи тьюторів використовують одну й ту ж базову модель, початкову точку SFT та налаштування GRPO, але різні джерела нагород.

Після сліпого оцінювання шаховим експертом, тьютор, навчений за допомогою StudentSim reward, посів перше місце за точністю, якістю навчання та індивідуальними оцінками.

Експерти сліпо оцінювали три виміри за умови змішаного порядку подання: точність — частка відповідей без вводять в оману фактичних помилок, якість керівництва та персоналізація — кожна за шкалою від 1 до 5. Тьютор, навчений за допомогою StudentSim reward, посів перше місце за всіма трьома вимірами.

Ще більш зауважуваною є група експериментів з оберненим результатом: тьютор, навчений за допомогою GPT-5.4 як симулятора учня, показав точність нижчу не лише від StudentSim, але й від базової моделі без RL. Погіршення було спричинене значно вищим рівнем серйозних фактичних помилок. Неправдоподібний симулятор веде вчителя в неправильному напрямку: симулятор з рівнем когнітивних здібностей, що не відповідає реальному учню, але з надзвичайно сильними здібностями до розуміння, може самостійно вивести якусь відповідь навіть на найбільш абсурдні інструкції, надаючи випадкову нагороду за неправильні інструкції — RL оптимізується в бік хаосу (навіть помилок).

StudentSim не замінює реальні студентські експерименти в освітніх дослідженнях. Він перетворює реальні студентські записи на симульовані відгуки, які можна повторно використовувати на етапі навчання, що дозволяє AI-репетитору провести більше раундів відбору та оптимізації перед початком дослідження з людьми.

Для системи AI-викладачів, які потребують персоналізованої відгуку, такі симулятори студентів продовжують ідеї недавньої популярності симуляторів користувачів (усіх можна симулювати, створюючи цифрових близнюків людини), пропонуючи революційний інженерний підхід:

Вивчайте, як учні помиляються, вивчайте, як учні змінюються під керівництвом, щоб надавати сигнали зворотного зв’язку на масштабі машинного навчання для підсилення моделі викладача.

Джерело: https://arxiv.org/abs/2609.01591

Цей матеріал надійшов із офіційного каналу WeChat «New智元», автор: New智元; редагування: LRST

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.