การประชุมด้านปัญญาประดิษฐ์ที่ใหญ่ที่สุดในวงการวิชาการเพิ่งให้ปัญญาประดิษฐ์ตรวจการบ้านของตัวเองเอง โดย AAAI-26 ซึ่งเป็นหนึ่งในเวทีชั้นนำสำหรับการวิจัยด้านปัญญาประดิษฐ์ ได้ดำเนินโครงการทดลองเพื่อสร้างรีวิวจากปัญญาประดิษฐ์สำหรับผลงานส่งเข้าร่วม 22,977 ชิ้นในเส้นทางหลัก ทำให้เป็นการใช้งานแบบเต็มรูปแบบครั้งแรกของการรีวิวโดยเพื่อนร่วมงานที่ขับเคลื่อนด้วยปัญญาประดิษฐ์ในงานประชุมวิชาการขนาดใหญ่
จุดพลิกผัน: การสำรวจที่ดำเนินการหลังการทดลองพบว่าทั้งผู้เขียนและสมาชิกคณะกรรมการโปรแกรมต่างชื่นชอบบทวิจารณ์ที่สร้างโดย AI มากกว่า โดยเฉพาะอย่างยิ่งพวกเขาให้คะแนนสูงกว่าในด้านความถูกต้องทางเทคนิคและคุณภาพของข้อเสนอแนะด้านการวิจัยเมื่อเทียบกับผู้เขียนบทวิจารณ์ที่เป็นมนุษย์
วิธีการทำงานของระบบตรวจสอบโดย AI แบบสองทางที่ไม่เปิดเผยตัวตน
โปรแกรมนี้ดำเนินการภายใต้กรอบการตรวจสอบแบบสองชั้น หมายความว่าผู้เขียนและผู้ตรวจสอบไม่รู้ตัวตนของกันและกัน บทวิจารณ์ที่สร้างโดย AI ถูกวางไว้ร่วมกับบทวิจารณ์ของมนุษย์อย่างน้อยสองฉบับสำหรับแต่ละบทความ สร้างการเปรียบเทียบแบบคู่ขนานที่นักวิจัยสามารถประเมินได้โดยไม่มีอคติต่อแหล่งใดแหล่งหนึ่ง
ทางเลือกการออกแบบที่สำคัญประการหนึ่ง: ผู้ตรวจสอบ AI ระบุว่าเป็นเนื้อหาที่สร้างโดย AI นี่ไม่ใช่การทดสอบทัวริง เป้าหมายคือเสริมผู้ตรวจสอบมนุษย์ ไม่ใช่เพื่อหลอกให้ใครสักคนคิดว่าโมเดลภาษาคือศาสตราจารย์ผู้มีตำแหน่งถาวร
รีวิวจากปัญญาประดิษฐ์ถูกสร้างขึ้นโดยใช้ระบบฐานโมเดล LLM หลายขั้นตอน ซึ่งสามารถประมวลผลเอกสารได้ภายในหนึ่งวัน ผู้เข้าร่วมสังเกตว่ารีวิวจากปัญญาประดิษฐ์มีลักษณะเสริม และพบว่ามันช่วยเสริมกระบวนการรีวิวโดยรวมแทนที่จะลดคุณค่าลง
เหตุผลที่การทบทวนโดยเพื่อนด้วยปัญญาประดิษฐ์มีความสำคัญเกินกว่าวงการวิชาการ
การศึกษาปี 2023 จากสแตนฟอร์ดพบว่า ข้อความที่สร้างโดย AI ได้ปรากฏในสัดส่วนที่วัดได้ของการทบทวนโดยเพื่อนร่วมงานที่งานประชุมด้านการเรียนรู้ของเครื่องชั้นนำ แม้ว่าในกรณีนี้จะเป็นผู้ทบทวนที่ใช้ ChatGPT อย่างเงียบๆ เพื่อเขียนข้อเสนอแนะของตน มากกว่าระบบอย่างเป็นทางการ
การทดลองของ AAAI-26 ใช้แนวทางที่ตรงกันข้าม แทนที่จะแสร้งทำเป็นว่า AI ไม่ได้อยู่ในห้องนี้ มันได้กำหนดกระบวนการอย่างเป็นทางการ สร้างกรอบการควบคุมรอบๆ มัน และศึกษาผลลัพธ์อย่างเป็นระบบ
ผลการวิจัยได้รับการบันทึกในเอกสาร arXiv 2604.13940 โดยการเปิดตัวชุดข้อมูลและผลการวิเคราะห์อย่างเต็มรูปแบบจะมีขึ้นในเดือนสิงหาคม 2026
เอกสาร 22,977 ฉบับที่ประมวลผลในการทดลองนี้แสดงถึงขนาดที่ไม่มีการศึกษาใดมาก่อนเกี่ยวกับการทบทวนโดยเพื่อนที่ช่วยด้วย AI เคยเข้าถึงมาก่อน งานก่อนหน้านี้ดำเนินการในสภาพแวดล้อมจำลองหรือด้วยขนาดตัวอย่างเล็ก ทำให้ยากต่อการสรุปข้อสรุปที่สามารถนำไปใช้ทั่วไปได้
