En büyük akademik Yapay Zeka konferansı, yapay zekanın kendi ödevlerini notlamasına izin verdi. AI araştırmaları için öncü platformlardan biri olan AAAI-26, 22.977 ana kategori makale gönderimine yönelik yapay zeka tabanlı inceleme üretmeyi deneyen bir pilot program çalıştırdı ve bu, büyük bir akademik konferansta yapay zeka destekli eş değerlendirme ilk kez tam ölçekli olarak uygulandı.
Sır: Pilot sonrası yapılan anketler, hem yazarların hem de program komitesi üyelerinin aslında AI tarafından oluşturulan incelemeleri tercih ettiğini gösterdi. Özellikle, insan tarafından yapılan incelemelere kıyasla teknik doğruluk ve araştırma önerilerinin kalitesi açısından daha yüksek puanlar verdiler.
Çift-kör AI inceleme sistemi nasıl çalıştı
Program, yazarların ve inceleyenlerin birbirinin kimliklerini bilmediği çift-kör bir çerçevede çalıştı. Her makale için AI tarafından oluşturulan incelemeler, en az iki insan incelemesiyle birlikte yer aldı ve araştırmacıların her iki kaynak yönünde önyargısız değerlendirebileceği yan-yana bir karşılaştırma sağlandı.
Önemli bir tasarım seçimi: AI inceleyicileri, kendilerinin AI tarafından oluşturulduğunu belirttiler. Bu bir Turing testi değildi. Amacımız, insan inceleyicileri tamamlamaktı, bir dil modelinin kalıcı bir profesör olduğunu düşünmeye zorlamaktan değil.
AI incelemeleri, birkaç aşamalı bir LLM tabanlı sistem kullanılarak bir günde tamamlanabilecek makaleleri işlemek üzere üretildi. Katılımcılar, AI incelemelerinin ek niteliğinde olduğunu ve süreci zayıflatmak yerine genel inceleme sürecini güçlendirdiğini belirtti.
Neden AI eş gözden geçirmenin akademinin ötesinde önemi var
Stanford Üniversitesi'nin 2023 yılında yaptığı bir çalışma, yapay zeka tarafından oluşturulan metinlerin, en üst düzey makine öğrenimi konferanslarında yapılan eş gözden geçirmelerin ölçülebilir bir kısmında zaten yer aldığını ortaya koydu; ancak bu durumda, resmi olarak onaylanmış bir sistem değil, gözden geçirenlerin geri bildirimlerini yazmak için sessizce ChatGPT kullandıklarıydı.
AAAI-26 piloti, yapay zekânın zaten odada olmadığını varsaymak yerine, süreci resmileştirdi, etrafına koruma önlemleri aldı ve sonuçları deneysel olarak inceledi.
Araştırma bulguları, arXiv makalesi 2604.13940'te belgelenmiştir ve tam veri seti ile analizin kamuoyuna açıklanması Ağustos 2026'da planlanmaktadır.
Bu pilot kapsamında işlenen 22.977 makale, daha önceki herhangi bir AI destekli eş değerlendirmesi çalışmasının ulaşamadığı bir ölçek sunmaktadır. Önceki çalışmalar, genellenebilir sonuçlar çıkarmak zor olan simüle ortamlarda veya küçük örneklem boyutlarında yürütülmüştür.
