AAAI-26 將試行 AI 同行評審,涵蓋 22,977 篇論文

iconCryptoBriefing
分享
AI summary icon精華摘要
AAAI-26 使用 AI 審閱了 22,977 篇論文,結果顯示其技術準確性高於人工審閱。該系統在自稱為 AI 的情況下,於一天內完成論文處理。研究人員在雙盲設定下比較了 AI 與人工評估。此實驗測試了 AI 在大規模同行評審中的角色。技術指標顯示 AI 工具的效率正在提升。隨著 AI 的採用增加,學術出版中的恐懼與貪婪指數可能發生變化。

最大的學術人工智慧會議剛剛讓人工智慧為自己的作業評分。AAAI-26 作為人工智慧研究的頂尖平台之一,進行了一項試點計劃,為 22,977 篇主會論文投稿生成了 AI 評審意見,成為大型學術會議中首次全面部署 AI 驅動同行評審的案例。

有趣的是:在試點結束後進行的調查發現,作者和項目委員會成員實際上更偏好由 AI 生成的評審意見,特別是在技術準確性和研究建議的質量方面,他們對 AI 評審的評分高於人類評審。

雙盲 AI 審核系統如何運作

該計劃在雙盲框架下運行,意味著作者與審稿人均不知曉彼此的身份。每篇論文的 AI 生成審稿意見均與至少兩份人工審稿意見並列,使研究人員能夠在不受來源偏見影響的情況下進行評估。

廣告

一個重要的設計選擇:AI 審查員均明確標示為 AI 生成。這並非圖靈測試,目標是輔助人工審查員,而非讓人誤以為語言模型是資深教授。

AI 評審是透過一個多階段的 LLM 系統生成,可在一天內處理論文。參與者指出,AI 評審具有補充性,並認為它們增強了整體評審過程,而非削弱之。

為何 AI 同儕審查的重要性超越學術界

2023 年一項來自史丹佛大學的研究發現,AI 生成的文本已出現在頂尖機器學習會議的同行評審中,佔可衡量的比例,但當時是評審人員悄悄使用 ChatGPT 撰寫他們的反饋,而非官方授權的系統。

AAAI-26 的試點採取了相反的方法:它並未假裝 AI 不存在於現場,而是將流程正式化、設立相關保障措施,並以實證方式研究結果。

研究結果已記錄於 arXiv 論文 2604.13940,完整數據集與分析預計於 2026 年 8 月公開發布。

本次試點處理的 22,977 篇論文,其規模是以往任何關於 AI 協助同行評審的研究都未曾達到的。先前的研究僅在模擬環境中進行,或使用小樣本,使得難以得出具有普遍性的結論。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露