La plus grande conférence académique en intelligence artificielle vient de permettre à l’intelligence artificielle de corriger ses propres devoirs. AAAI-26, l’un des principaux forums de recherche en IA, a lancé un programme pilote ayant généré des avis d’experts pour 22 977 soumissions de articles de la voie principale, marquant ainsi le premier déploiement à grande échelle d’une révision par les pairs pilotée par l’IA dans le cadre d’une grande conférence académique.
La surprise : les enquêtes menées après le pilote ont révélé que les auteurs et les membres du comité de programme préféraient en réalité les avis générés par l’IA. Plus précisément, ils les ont notés plus haut en termes de précision technique et de qualité des suggestions de recherche que leurs homologues humains.
Comment le système d'analyse AI à double aveugle fonctionnait
Le programme s'est déroulé dans un cadre en double aveugle, ce qui signifie que les auteurs et les relecteurs ne connaissaient pas l'identité l'un de l'autre. Les avis générés par l'IA ont été intégrés aux côtés d'au moins deux avis humains pour chaque article, créant une comparaison côte à côte que les chercheurs pouvaient évaluer sans préjugé en faveur d'une source ou d'une autre.
Un choix de conception important : les avis de l'IA ont été identifiés comme générés par une IA. Ce n'était pas un test de Turing. L'objectif était de compléter les relecteurs humains, et non de tromper qui que ce soit en faisant croire qu'un modèle linguistique était un professeur titulaire.
Les avis générés par l'IA ont été produits à l'aide d'un système basé sur des LLM en plusieurs étapes, capable de traiter les articles en moins d'une journée. Les participants ont noté le caractère complémentaire des avis de l'IA et les ont trouvés utiles pour améliorer le processus global d'évaluation, plutôt que de le diluer.
Pourquoi la révision par les pairs basée sur l'IA importe au-delà du monde académique
Une étude de 2023 de Stanford a révélé que des textes générés par l'IA apparaissaient déjà dans une fraction mesurable des avis pairs lors des principales conférences d'apprentissage automatique, bien que dans ce cas, les relecteurs utilisaient discrètement ChatGPT pour rédiger leurs commentaires plutôt qu'un système officiellement autorisé.
Le pilote de l'AAAI-26 a adopté une approche opposée. Au lieu de prétendre que l'IA n'est pas déjà présente dans la salle, il a formalisé le processus, établi des garde-fous et étudié les résultats de manière empirique.
Les résultats de la recherche sont documentés dans l'article arXiv 2604.13940, avec une publication publique de l'ensemble du jeu de données et de l'analyse prévue pour août 2026.
Les 22 977 articles traités dans ce pilote représentent une échelle que aucune étude précédente sur la révision par les pairs assistée par l'IA n'a atteinte. Les travaux antérieurs ont été menés dans des environnements simulés ou avec de petits échantillons, rendant difficile la tirage de conclusions généralisables.
