Hội nghị AI học thuật lớn nhất vừa cho phép trí tuệ nhân tạo chấm bài tập về nhà của chính nó. AAAI-26, một trong những diễn đàn hàng đầu về nghiên cứu AI, đã triển khai chương trình thí điểm tạo ra các bản đánh giá AI cho 22.977 bài nộp thuộc danh mục chính, trở thành lần triển khai quy mô toàn diện đầu tiên của hệ thống đánh giá đồng đẳng do AI hỗ trợ tại một hội nghị học thuật lớn.
Điểm đặc biệt: các cuộc khảo sát được thực hiện sau giai đoạn thử nghiệm cho thấy cả tác giả lẫn thành viên hội đồng chương trình thực sự ưa thích các bản đánh giá do AI tạo ra. Cụ thể, họ đánh giá chúng cao hơn về độ chính xác kỹ thuật và chất lượng các đề xuất nghiên cứu so với các bản do con người thực hiện.
Cách hệ thống đánh giá AI hai chiều hoạt động
Chương trình hoạt động trong khuôn khổ đôi mù, nghĩa là cả tác giả lẫn người đánh giá đều không biết danh tính của nhau. Các bài đánh giá do AI tạo ra được xếp song song với ít nhất hai bài đánh giá do con người thực hiện cho mỗi bài báo, tạo ra sự so sánh song song mà các nhà nghiên cứu có thể đánh giá mà không bị thiên vị về bất kỳ nguồn nào.
Một lựa chọn thiết kế quan trọng: các đánh giá của AI đã xác nhận là do AI tạo ra. Đây không phải là một bài kiểm tra Turing. Mục tiêu là bổ sung cho các chuyên gia đánh giá con người, chứ không phải lừa ai đó tin rằng một mô hình ngôn ngữ là một giáo sư chính thức.
Các bản đánh giá AI được tạo ra bằng hệ thống dựa trên LLM đa giai đoạn, có thể xử lý các bài báo trong chưa đầy một ngày. Người tham gia nhận thấy tính chất bổ trợ của các bản đánh giá AI và cho rằng chúng đã cải thiện quy trình đánh giá tổng thể thay vì làm suy yếu nó.
Tại sao đánh giá ngang hàng bằng AI lại quan trọng vượt ra ngoài học thuật
Một nghiên cứu năm 2023 của Stanford phát hiện rằng văn bản do AI tạo ra đã xuất hiện trong một tỷ lệ đáng kể các bài đánh giá đồng đẳng tại các hội nghị học máy hàng đầu, mặc dù trong trường hợp đó, các chuyên gia đánh giá đã lặng lẽ sử dụng ChatGPT để soạn thảo phản hồi của họ thay vì một hệ thống được chính thức cho phép.
Phiên bản thí điểm của AAAI-26 đã tiếp cận theo hướng ngược lại. Thay vì giả vờ rằng AI chưa từng hiện diện trong phòng, nó đã chính thức hóa quy trình, thiết lập các giới hạn xung quanh nó và nghiên cứu kết quả một cách thực nghiệm.
Các kết quả nghiên cứu được ghi lại trong bài báo arXiv 2604.13940, với việc công bố đầy đủ bộ dữ liệu và phân tích dự kiến vào tháng 8 năm 2026.
22.977 bài báo được xử lý trong đợt thử nghiệm này đại diện cho quy mô mà chưa có nghiên cứu nào về đánh giá ngang hàng được hỗ trợ bởi AI từng tiếp cận. Các công trình trước đây hoạt động trong môi trường mô phỏng hoặc với kích thước mẫu nhỏ, khiến việc đưa ra các kết luận mang tính khái quát trở nên khó khăn.
