Konferensi AI akademik terbesar baru sahaja membenarkan kecerdasan buatan menilai tugasan sendiri. AAAI-26, salah satu tempat utama untuk penyelidikan AI, menjalankan program percontohan yang menghasilkan ulasan AI untuk 22,977 penghantaran laluan utama, menjadikannya pelaksanaan skala penuh pertama ulasan rakan sebaya berkuasakan AI di konferensi akademik utama.
Kejutan: tinjauan yang dijalankan selepas uji coba mendapati bahawa penulis dan ahli jawatankuasa program sebenarnya lebih menyukai ulasan yang dihasilkan oleh AI. Secara khusus, mereka memberi penilaian lebih tinggi kepada ulasan tersebut dari segi ketepatan teknikal dan kualiti cadangan penyelidikan berbanding rakan manusia mereka.
Bagaimana sistem ulasan AI buta-ganda berfungsi
Program ini beroperasi dalam kerangka buta ganda, bermakna penulis dan pemeriksa tidak mengetahui identiti satu sama lain. Ulasan yang dihasilkan oleh AI dimasukkan bersama sekurang-kurangnya dua ulasan manusia untuk setiap kertas, mencipta perbandingan sisi-ke-sisi yang boleh dinilai oleh penyelidik tanpa prasangka terhadap mana-mana sumber.
Satu pilihan reka bentuk penting: pengenalan AI dinyatakan sebagai dihasilkan oleh AI. Ini bukan ujian Turing. Matlamatnya adalah untuk melengkapi pemeriksa manusia, bukan untuk menipu sesiapa supaya berfikir bahawa model bahasa adalah seorang profesor tetap.
Ulasan AI dihasilkan menggunakan sistem berbasis LLM berbilang peringkat yang mampu memproses kertas kerja dalam masa kurang daripada sehari. Peserta mencatat sifat tambahan ulasan AI dan mendapati ia meningkatkan proses ulasan secara keseluruhan, bukan melemahkannya.
Mengapa ulasan rakan sebidang AI penting melebihi akademik
Satu kajian tahun 2023 dari Stanford mendapati bahawa teks yang dihasilkan AI sudah muncul dalam bahagian yang boleh diukur dalam ulasan rakan sebaya di konferens machine learning terkemuka, walaupun dalam kes itu ia adalah para ulas yang secara diam-diam menggunakan ChatGPT untuk menyusun maklum balas mereka, bukan sistem yang disahkan secara rasmi.
Pilot AAAI-26 mengambil pendekatan yang berlawanan. Alih-alih berpura-pura AI tidak berada di ruangan itu, ia merumuskan prosesnya, membina pengawal di sekelilingnya, dan mengkaji keputusannya secara empirik.
Kesimpulan penyelidikan didokumentasikan dalam kertas arXiv 2604.13940, dengan pelepasan awam set data penuh dan analisis yang dijadualkan pada Ogos 2026.
22,977 kertas yang diproses dalam penerbangan ini mewakili skala yang tidak pernah didekati oleh sebarang kajian sebelum ini mengenai semakan rakan sebaya yang dibantu AI. Karya sebelum ini beroperasi dalam persekitaran simulasi atau dengan saiz sampel kecil yang membuatkan sukar untuk menarik kesimpulan yang boleh digeneralisasi.
