AAAI-26 thử nghiệm đánh giá đồng đẳng bởi AI cho 22.977 bài báo

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
AAAI-26 đã sử dụng AI để đánh giá 22.977 bài báo, với kết quả cho thấy độ chính xác kỹ thuật cao hơn so với đánh giá của con người. Hệ thống, vốn tự nhận là AI, đã xử lý các bài nộp trong chưa đầy một ngày. Các nhà nghiên cứu đã so sánh đánh giá của AI và con người trong một thiết lập đôi mù. Thí nghiệm kiểm tra vai trò của AI trong đánh giá đồng đẳng quy mô lớn. Các chỉ số kỹ thuật cho thấy hiệu quả ngày càng tăng của các công cụ AI. Chỉ số sợ hãi và tham lam trong xuất bản học thuật có thể thay đổi khi việc áp dụng AI gia tăng.

Hội nghị AI học thuật lớn nhất vừa cho phép trí tuệ nhân tạo chấm bài tập về nhà của chính nó. AAAI-26, một trong những diễn đàn hàng đầu về nghiên cứu AI, đã triển khai chương trình thí điểm tạo ra các bản đánh giá AI cho 22.977 bài nộp thuộc danh mục chính, trở thành lần triển khai quy mô toàn diện đầu tiên của hệ thống đánh giá đồng đẳng do AI hỗ trợ tại một hội nghị học thuật lớn.

Điểm đặc biệt: các cuộc khảo sát được thực hiện sau giai đoạn thử nghiệm cho thấy cả tác giả lẫn thành viên hội đồng chương trình thực sự ưa thích các bản đánh giá do AI tạo ra. Cụ thể, họ đánh giá chúng cao hơn về độ chính xác kỹ thuật và chất lượng các đề xuất nghiên cứu so với các bản do con người thực hiện.

Cách hệ thống đánh giá AI hai chiều hoạt động

Chương trình hoạt động trong khuôn khổ đôi mù, nghĩa là cả tác giả lẫn người đánh giá đều không biết danh tính của nhau. Các bài đánh giá do AI tạo ra được xếp song song với ít nhất hai bài đánh giá do con người thực hiện cho mỗi bài báo, tạo ra sự so sánh song song mà các nhà nghiên cứu có thể đánh giá mà không bị thiên vị về bất kỳ nguồn nào.

Quảng cáo

Một lựa chọn thiết kế quan trọng: các đánh giá của AI đã xác nhận là do AI tạo ra. Đây không phải là một bài kiểm tra Turing. Mục tiêu là bổ sung cho các chuyên gia đánh giá con người, chứ không phải lừa ai đó tin rằng một mô hình ngôn ngữ là một giáo sư chính thức.

Các bản đánh giá AI được tạo ra bằng hệ thống dựa trên LLM đa giai đoạn, có thể xử lý các bài báo trong chưa đầy một ngày. Người tham gia nhận thấy tính chất bổ trợ của các bản đánh giá AI và cho rằng chúng đã cải thiện quy trình đánh giá tổng thể thay vì làm suy yếu nó.

Tại sao đánh giá ngang hàng bằng AI lại quan trọng vượt ra ngoài học thuật

Một nghiên cứu năm 2023 của Stanford phát hiện rằng văn bản do AI tạo ra đã xuất hiện trong một tỷ lệ đáng kể các bài đánh giá đồng đẳng tại các hội nghị học máy hàng đầu, mặc dù trong trường hợp đó, các chuyên gia đánh giá đã lặng lẽ sử dụng ChatGPT để soạn thảo phản hồi của họ thay vì một hệ thống được chính thức cho phép.

Phiên bản thí điểm của AAAI-26 đã tiếp cận theo hướng ngược lại. Thay vì giả vờ rằng AI chưa từng hiện diện trong phòng, nó đã chính thức hóa quy trình, thiết lập các giới hạn xung quanh nó và nghiên cứu kết quả một cách thực nghiệm.

Các kết quả nghiên cứu được ghi lại trong bài báo arXiv 2604.13940, với việc công bố đầy đủ bộ dữ liệu và phân tích dự kiến vào tháng 8 năm 2026.

22.977 bài báo được xử lý trong đợt thử nghiệm này đại diện cho quy mô mà chưa có nghiên cứu nào về đánh giá ngang hàng được hỗ trợ bởi AI từng tiếp cận. Các công trình trước đây hoạt động trong môi trường mô phỏng hoặc với kích thước mẫu nhỏ, khiến việc đưa ra các kết luận mang tính khái quát trở nên khó khăn.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.