Ang pinakamalaking akademikong konperensya sa AI ay nagbigay-daan sa artificial intelligence na mag-grade ng sarili nitong takdang-aralin. Ang AAAI-26, isa sa mga pangunahing lugar para sa panel ng AI, ay isinagawa ang isang pilot program na naglikha ng AI reviews para sa 22,977 na pagpapasa sa pangunahing track, gawing unang buong pagpapatupad ng AI-powered peer review sa isang malaking akademikong konperensya.
Ang twist: ang mga survey na ginawa pagkatapos ng pilot ay natuklasan na parehong mga may-akda at mga miyembro ng programa ay mas pinahahalagahan ang mga review na nilikha ng AI. Partikular, mas mataas ang kanilang pagtataya sa teknikal na akurasyon at kalidad ng mga rekomendasyon sa pananaliksik kumpara sa kanilang mga katumbas na tao.
Paano gumana ang double-blind AI review system
Ang programa ay nagtatrabaho sa loob ng isang double-blind na framework, kaya hindi alam ng mga may-akda at mga reviewer ang pagkakakilanlan ng isa’t isa. Ang mga review na ginawa ng AI ay isinama kasama ang hindi bababa sa dalawang tao na review para sa bawat papel, lumikha ng side-by-side na paghahambing na maaaring bigyang-pansin ng mga mananaliksik nang walang bias laban sa anumang pinagmulan.
Isang mahalagang desisyon sa disenyo: ang mga tagapagsuri na AI ay nakikilala bilang AI-generated. Hindi ito isang Turing test. Ang layunin ay upang suportahan ang mga tao na tagapagsuri, hindi upang manlinlang kahit sino na ang isang language model ay isang propesor na may tenure.
Ang mga pagsusuri ng AI ay ginawa gamit ang isang multi-stage na sistema batay sa LLM na nakapag-proseso ng mga papel sa loob ng isang araw. Nakatandaan ng mga kalahok ang supplementary na kalikasan ng mga pagsusuri ng AI at natagpuan nilang ito ay nagpapalakas sa buong proseso ng pagsusuri kaysa magpapalabo dito.
Bakit mahalaga ang peer review ng AI kundi lang sa akademya
Isang pag-aaral noong 2023 mula sa Stanford ay natuklasan na ang teksto na ginawa ng AI ay umiiral na sa isang makabuluhang bahagi ng mga pagsusuri ng mga kaibigan sa mga pinakamataas na konperensya sa machine learning, bagaman sa kaso na iyon, ito ay ang mga pagsusuri na gumagamit nang tahimik ng ChatGPT upang isulat ang kanilang feedback kesa isang opisyally pinapayagan na sistema.
Ang pilot ng AAAI-26 ay gumamit ng magkabilang pagkakataon. Sa halip na magmukhang hindi pa nasa silid ang AI, itinatag nito ang proseso, isinagawa ang mga limitasyon dito, at sinuri ang mga resulta nang empirikal.
Ang mga natuklasan sa pananaliksik ay dokumentado sa arXiv paper 2604.13940, na may pampublikong paglabas ng buong dataset at pagsusuri noong Agosto 2026.
Ang 22,977 na papel na proseso sa pilot na ito ay nagpapakita ng iskala na hindi pa natutugunan ng anumang nakaraang pag-aaral ng AI-assisted na peer review. Ang mga nakaraang pag-aaral ay gumagana sa simulated na mga kapaligiran o may maliit na sample size na nagiging mahirap upang makakuha ng mga pangkalahatang konklusyon.
