Крупнейшая академическая конференция по ИИ только что позволила искусственному интеллекту оценивать свои собственные домашние задания. AAAI-26, один из ведущих форумов для исследований в области ИИ, провел пилотную программу, в рамках которой были сгенерированы AI-рецензии на 22 977 основных статей, что сделало ее первым масштабным внедрением AI-оценки рецензентами на крупной академической конференции.
Неожиданность: опросы, проведённые после пилотного проекта, показали, что как авторы, так и члены программного комитета фактически предпочли рецензии, сгенерированные ИИ. В частности, они оценили их выше по технической точности и качеству предложений по исследованиям по сравнению с человеческими рецензиями.
Как работала система двойного слепого AI-ревью
Программа работала в рамках двойного слепого метода, что означало, что авторы и рецензенты не знали личностей друг друга. Рецензии, сгенерированные ИИ, включались вместе как минимум с двумя человеческими рецензиями на каждую статью, создавая параллельное сравнение, которое исследователи могли оценивать без предвзятости в сторону любого из источников.
Один важный дизайн-решение: идентификаторы ИИ были помечены как сгенерированные ИИ. Это не был тест Тьюринга. Целью было дополнить человеческих рецензентов, а не обмануть кого-либо, заставив подумать, что языковая модель — это профессор с постоянной должностью.
Отзывы, подготовленные с помощью ИИ, были созданы с использованием многоэтапной системы на основе LLM, способной обрабатывать статьи менее чем за один день. Участники отметили вспомогательный характер отзывов ИИ и сочли, что они улучшают общий процесс рецензирования, а не ослабляют его.
Почему рецензирование с помощью ИИ важно за пределами академии
Исследование 2023 года от Стэнфорда показало, что текст, сгенерированный ИИ, уже присутствовал в измеримой доле рецензий на ведущих конференциях по машинному обучению, хотя в этом случае рецензенты тайно использовали ChatGPT для составления своих отзывов, а не официально утвержденную систему.
Пилотная программа AAAI-26 приняла противоположный подход. Вместо того чтобы притворяться, что ИИ уже не в комнате, она формализовала процесс, установила ограничения и изучила результаты эмпирически.
Результаты исследования задокументированы в статье arXiv 2604.13940, а публичный выпуск полного набора данных и анализа запланирован на август 2026 года.
22 977 статей, обработанных в рамках этого пилотного проекта, представляют масштаб, которого не достигало ни одно предыдущее исследование экспертной оценки с использованием ИИ. Предыдущие работы проводились в симулированных средах или с небольшими выборками, что затрудняло получение обобщаемых выводов.
