最大的學術人工智慧會議剛剛讓人工智慧為自己的作業評分。AAAI-26 作為人工智慧研究的頂尖平台之一,進行了一項試點計劃,為 22,977 篇主會論文投稿生成了 AI 評審意見,成為大型學術會議中首次全面部署 AI 驅動同行評審的案例。
有趣的是:在試點結束後進行的調查發現,作者和項目委員會成員實際上更偏好由 AI 生成的評審意見,特別是在技術準確性和研究建議的質量方面,他們對 AI 評審的評分高於人類評審。
雙盲 AI 審核系統如何運作
該計劃在雙盲框架下運行,意味著作者與審稿人均不知曉彼此的身份。每篇論文的 AI 生成審稿意見均與至少兩份人工審稿意見並列,使研究人員能夠在不受來源偏見影響的情況下進行評估。
一個重要的設計選擇:AI 審查員均明確標示為 AI 生成。這並非圖靈測試,目標是輔助人工審查員,而非讓人誤以為語言模型是資深教授。
AI 評審是透過一個多階段的 LLM 系統生成,可在一天內處理論文。參與者指出,AI 評審具有補充性,並認為它們增強了整體評審過程,而非削弱之。
為何 AI 同儕審查的重要性超越學術界
2023 年一項來自史丹佛大學的研究發現,AI 生成的文本已出現在頂尖機器學習會議的同行評審中,佔可衡量的比例,但當時是評審人員悄悄使用 ChatGPT 撰寫他們的反饋,而非官方授權的系統。
AAAI-26 的試點採取了相反的方法:它並未假裝 AI 不存在於現場,而是將流程正式化、設立相關保障措施,並以實證方式研究結果。
研究結果已記錄於 arXiv 論文 2604.13940,完整數據集與分析預計於 2026 年 8 月公開發布。
本次試點處理的 22,977 篇論文,其規模是以往任何關於 AI 協助同行評審的研究都未曾達到的。先前的研究僅在模擬環境中進行,或使用小樣本,使得難以得出具有普遍性的結論。
