AAAI-26 Menguji Ulasan Sejawat AI untuk 22.977 Kertas

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
AAAI-26 menggunakan AI untuk menilai 22,977 kertas, dengan keputusan menunjukkan ketepatan teknikal yang lebih tinggi berbanding penilaian manusia. Sistem yang mengenali dirinya sebagai AI memproses penghantaran dalam masa kurang daripada sehari. Para penyelidik membandingkan penilaian AI dan manusia dalam setup buta ganda. Eksperimen ini menguji peranan AI dalam penilaian rakan sebaya berskala besar. Indikator teknikal menunjukkan peningkatan kecekapan dalam alat AI. Indeks ketakutan dan keserakahan dalam penerbitan akademik mungkin berubah seiring peningkatan penggunaan AI.

Konferensi AI akademik terbesar baru sahaja membenarkan kecerdasan buatan menilai tugasan sendiri. AAAI-26, salah satu tempat utama untuk penyelidikan AI, menjalankan program percontohan yang menghasilkan ulasan AI untuk 22,977 penghantaran laluan utama, menjadikannya pelaksanaan skala penuh pertama ulasan rakan sebaya berkuasakan AI di konferensi akademik utama.

Kejutan: tinjauan yang dijalankan selepas uji coba mendapati bahawa penulis dan ahli jawatankuasa program sebenarnya lebih menyukai ulasan yang dihasilkan oleh AI. Secara khusus, mereka memberi penilaian lebih tinggi kepada ulasan tersebut dari segi ketepatan teknikal dan kualiti cadangan penyelidikan berbanding rakan manusia mereka.

Bagaimana sistem ulasan AI buta-ganda berfungsi

Program ini beroperasi dalam kerangka buta ganda, bermakna penulis dan pemeriksa tidak mengetahui identiti satu sama lain. Ulasan yang dihasilkan oleh AI dimasukkan bersama sekurang-kurangnya dua ulasan manusia untuk setiap kertas, mencipta perbandingan sisi-ke-sisi yang boleh dinilai oleh penyelidik tanpa prasangka terhadap mana-mana sumber.

Iklan

Satu pilihan reka bentuk penting: pengenalan AI dinyatakan sebagai dihasilkan oleh AI. Ini bukan ujian Turing. Matlamatnya adalah untuk melengkapi pemeriksa manusia, bukan untuk menipu sesiapa supaya berfikir bahawa model bahasa adalah seorang profesor tetap.

Ulasan AI dihasilkan menggunakan sistem berbasis LLM berbilang peringkat yang mampu memproses kertas kerja dalam masa kurang daripada sehari. Peserta mencatat sifat tambahan ulasan AI dan mendapati ia meningkatkan proses ulasan secara keseluruhan, bukan melemahkannya.

Mengapa ulasan rakan sebidang AI penting melebihi akademik

Satu kajian tahun 2023 dari Stanford mendapati bahawa teks yang dihasilkan AI sudah muncul dalam bahagian yang boleh diukur dalam ulasan rakan sebaya di konferens machine learning terkemuka, walaupun dalam kes itu ia adalah para ulas yang secara diam-diam menggunakan ChatGPT untuk menyusun maklum balas mereka, bukan sistem yang disahkan secara rasmi.

Pilot AAAI-26 mengambil pendekatan yang berlawanan. Alih-alih berpura-pura AI tidak berada di ruangan itu, ia merumuskan prosesnya, membina pengawal di sekelilingnya, dan mengkaji keputusannya secara empirik.

Kesimpulan penyelidikan didokumentasikan dalam kertas arXiv 2604.13940, dengan pelepasan awam set data penuh dan analisis yang dijadualkan pada Ogos 2026.

22,977 kertas yang diproses dalam penerbangan ini mewakili skala yang tidak pernah didekati oleh sebarang kajian sebelum ini mengenai semakan rakan sebaya yang dibantu AI. Karya sebelum ini beroperasi dalam persekitaran simulasi atau dengan saiz sampel kecil yang membuatkan sukar untuk menarik kesimpulan yang boleh digeneralisasi.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.