AAAI-26 Mengujicoba Tinjauan Sejawat AI untuk 22.977 Makalah

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
AAAI-26 menggunakan AI untuk meninjau 22.977 makalah, dengan hasil menunjukkan akurasi teknis lebih tinggi daripada tinjauan manusia. Sistem yang mengidentifikasi dirinya sebagai AI memproses submisi dalam waktu kurang dari satu hari. Peneliti membandingkan evaluasi AI dan manusia dalam pengaturan ganda-blind. Eksperimen ini menguji peran AI dalam tinjauan sejawat berskala besar. Indikator teknis menunjukkan peningkatan efisiensi dalam alat AI. Indeks takut dan serakah dalam penerbitan akademik mungkin berubah seiring meningkatnya adopsi AI.

Konferensi AI akademik terbesar baru saja membiarkan kecerdasan buatan menilai pekerjaan rumahnya sendiri. AAAI-26, salah satu venue utama untuk penelitian AI, menjalankan program percontohan yang menghasilkan ulasan AI untuk 22.977 submisi makalah jalur utama, menjadikannya penerapan skala penuh pertama dari tinjauan sejawat berbasis AI di konferensi akademik besar.

Kejutan: survei yang dilakukan setelah uji coba menemukan bahwa baik penulis maupun anggota panitia program justru lebih menyukai ulasan yang dihasilkan AI. Secara khusus, mereka memberikan peringkat lebih tinggi pada akurasi teknis dan kualitas saran penelitian dibandingkan dengan ulasan manusia.

Bagaimana sistem tinjauan AI ganda-butawan bekerja

Program ini beroperasi dalam kerangka double-blind, artinya penulis dan reviewer tidak mengetahui identitas satu sama lain. Ulasan yang dihasilkan AI ditempatkan bersama setidaknya dua ulasan manusia untuk setiap makalah, menciptakan perbandingan samping-ke-samping yang dapat dievaluasi oleh peneliti tanpa bias terhadap sumber mana pun.

Iklan

Satu pilihan desain penting: identitas reviewer AI dinyatakan sebagai hasil generasi AI. Ini bukan tes Turing. Tujuannya adalah untuk melengkapi reviewer manusia, bukan untuk menipu siapa pun agar percaya bahwa model bahasa adalah seorang profesor tetap.

Ulasan AI diproduksi menggunakan sistem berbasis LLM multi-tahap yang dapat memproses makalah dalam waktu kurang dari satu hari. Peserta mencatat sifat tambahan dari ulasan AI dan menemukan bahwa ulasan tersebut meningkatkan proses tinjauan secara keseluruhan, bukan melemahkannya.

Mengapa tinjauan sejawat AI penting di luar akademik

Sebuah studi tahun 2023 dari Stanford menemukan bahwa teks yang dihasilkan AI sudah muncul dalam sejumlah terukur dari ulasan sejawat di konferensi pembelajaran mesin terkemuka, meskipun dalam kasus itu para reviewer secara diam-diam menggunakan ChatGPT untuk menyusun umpan balik mereka, bukan sistem yang secara resmi disahkan.

Pilot AAAI-26 mengambil pendekatan yang berlawanan. Alih-alih berpura-pura AI tidak ada di ruangan itu, ia memformalkan prosesnya, membangun batasan-batasan di sekitarnya, dan mempelajari hasilnya secara empiris.

Temuan penelitian didokumentasikan dalam makalah arXiv 2604.13940, dengan rilis publik seluruh dataset dan analisis yang dijadwalkan pada Agustus 2026.

22.977 makalah yang diproses dalam pilot ini mewakili skala yang belum pernah dicapai oleh studi sebelumnya tentang tinjauan sejawat yang dibantu AI. Pekerjaan sebelumnya beroperasi di lingkungan simulasi atau dengan ukuran sampel kecil yang membuat sulit untuk menarik kesimpulan yang dapat digeneralisasi.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.