Найбільша академічна конференція з штучного інтелекту дозволила штучному інтелекту оцінити власні домашні завдання. AAAI-26, одна з провідних платформ для досліджень у галузі ШІ, провела пілотну програму, в ході якої було згенеровано 22 977 оглядів від ШІ для статей основної трек-сесії, що стало першим масштабним застосуванням штучного інтелекту для рецензування з науковими колегами на величезній академічній конференції.
Сюрприз: опитування, проведені після пілотного проекту, показали, що автори та члени програмного комітету насправді віддали перевагу оглядам, згенерованим ШІ. Зокрема, вони оцінили їх вище за технічну точність та якість пропозицій щодо досліджень порівняно з людськими.
Як працювала система двохстороннього анонімного AI-огляду
Програма працювала в рамках подвійного сліпого методу, що означає, що автори та рецензенти не знали ідентичності один одного. Рецензії, згенеровані ШІ, розміщувалися поруч із щонайменше двома людськими рецензіями для кожного тексту, створюючи порівняння «бік-до-боку», яке дослідники могли оцінити без упереджень щодо будь-якого джерела.
Одна важлива проектна рішення: ідентифікатори ШІ вказували, що вони згенеровані ШІ. Це не був тест Тюрінга. Метою було доповнити людей-рецензентів, а не обманути когось, щоб він вважав мовну модель професором з постійним трудовим договором.
Відгуки штучного інтелекту були створені за допомогою багатоетапної системи на основі LLM, яка могла обробляти статті за менше ніж один день. Учасники зазначили додатковий характер відгуків штучного інтелекту та вважали, що вони покращують загальний процес оцінки, а не зменшують його якість.
Чому авторський огляд з використанням ШІ має значення поза академічним середовищем
Дослідження 2023 року від Стенфордського університету виявило, що текст, згенерований ШІ, вже з’являвся у помітній частині рецензій на найбільш авторитетних конференціях з машинного навчання, хоча в цьому випадку рецензенти таємно використовували ChatGPT для написання своїх відгуків, а не застосовували офіційно схвалену систему.
Пілотний проект AAAI-26 застосував протилежний підхід. Замість того щоб імітувати, що ШІ ще не в кімнаті, він формалізував процес, встановив обмеження та емпірично вивчив результати.
Результати дослідження задокументовано в статті arXiv 2604.13940, а публічний випуск повного набору даних та аналізу заплановано на серпень 2026 року.
22 977 статей, оброблених у цьому пілотному проекті, представляють масштаб, якого раніше не досягала жодна попередня дослідження з використанням ШІ для рецензування. Попередні дослідження проводилися в симульованих середовищах або з невеликими вибірками, що ускладнювало висновки, що можна узагальнити.
