最大の学術AI会議が、人工知能に自らの課題を採点させた。AI研究の主要な発表の場であるAAAI-26は、22,977本のメイントラック論文投稿に対してAIによるレビューを生成するパイロットプログラムを実施し、大規模な学術会議におけるAI駆動型査読の初の本格的導入となった。
ただし、パイロット実施後に実施された調査によると、著者とプログラム委員会のメンバーの両方がAIが生成したレビューを好んだ。具体的には、技術的な正確性や研究提案の質において、人間が作成したレビューよりも高い評価を得ていた。
ダブルブラインドAIレビュー制度の仕組み
このプログラムはダブルブラインド方式で運営され、著者とレビュー担当者は互いの身元を知らされていませんでした。各論文には、AIが生成したレビューが少なくとも2つの人間によるレビューと並べて配置され、研究者がどちらのソースにも偏ることなく評価できるようにしました。
重要な設計上の選択:AIのレビューは、AIによって生成されたものであることを明示しました。これはチューリングテストではありませんでした。目的は、人間のレビューを補完することであり、言語モデルを常勤教授に偽装することではありません。
AIによるレビューは、1日以内に論文を処理可能なマルチステージのLLMベースのシステムを用いて作成されました。参加者は、AIレビューが補助的なものであると認識し、レビュー全体のプロセスを薄めるのではなく、むしろ強化していると評価しました。
AIのピアレビューが学術界を超えて重要な理由
2023年のスタンフォード大学の研究によると、AIが生成したテキストは、トップレベルの機械学習カンファレンスの査読の一定割合にすでに存在していたが、その場合、公式に承認されたシステムではなく、査読者が自発的にChatGPTを使用してフィードバックを起草していた。
AAAI-26のパイロットは、逆のアプローチを採った。AIがすでにその場に存在しないふりをするのではなく、プロセスを形式化し、周囲にガードレールを設け、結果を実証的に研究した。
研究結果はarXiv論文2604.13940に記録されており、完全なデータセットと分析の公開は2026年8月を予定しています。
このパイロットで処理された22,977本の論文は、これまでのAI支援査読に関するどの研究も達成しなかった規模を示しています。従来の研究はシミュレーション環境や小さなサンプルサイズで行われており、一般化可能な結論を導くのが困難でした。
