Un chercheur d'OpenAI affirme que les principaux laboratoires d'IA ne lisent plus les articles

icon MarsBit
Partager
AI summary iconRésumé
Un chercheur d'OpenAI affirme que les principaux laboratoires d'IA ne lisent plus les articles en raison de revendications exagérées et d'une faible reproductibilité. Une vérification menée par l'Université de Chicago a révélé que seules 8 des 105 meilleures articles de l'ICML 2026 pouvaient être entièrement vérifiées. L'absence de code, une documentation incomplète et des résultats non reproductibles étaient fréquents. Le coût pour reprodire un article a atteint 2,2 millions de dollars. Les traders évaluant des actifs liés à l'IA devraient examiner attentivement le rapport risque-récompense. Les niveaux de support et de résistance sur le marché pourraient évoluer à mesure que la confiance dans la recherche en IA diminue.

Les gens du laboratoire de pointe ne lisent presque plus d'articles scientifiques ?

Un chercheur d'OpenAI lance une critique générale contre les trois principales conférences : trop de surenchères et de falsifications !

SAI

L'origine de l'affaire est un article ICLR dont les résultats étaient si impressionnants qu'ils semblaient inexpliqués ; les internautes ont étudié le sujet et ont découvert le « secret ».

SAI

Les publications aux conférences de haut niveau sont-elles devenues ainsi ?

SAI

Premièrement, vérifiez si le code est open source ; deuxièmement, examinez si la méthode expérimentale cache des raccourcis douteux ; troisièmement, déterminez si les résultats obtenus soutiennent réellement la conclusion principale — après avoir posé ces questions successives, combien d’articles de conférences de haut niveau résistent-ils à l’épreuve ?

Certaines personnes ont vraiment fait cela.

Sur 105 articles, seulement 8 sont « admis »

En juillet de cette année, SAI, cofondé par Tan Chenhao, professeur adjoint en informatique et en sciences des données à l'Université de Chicago, a annoncé une vaste « expérience de relecture par les pairs ».

Ils ont sélectionné les 168 articles oraux complets de ICML 2026.

Cette année, l'ICML a reçu 23 918 soumissions, et seules 168 ont obtenu une présentation orale, soit environ 0,7 %.

Autrement dit, ce que SAI vérifie est déjà le top sélectionné parmi plus de 20 000 soumissions.

En plus de lire les articles, concevoir des expériences et analyser les résultats comme des relecteurs traditionnels, SAI Review télécharge le code, les modèles et les données, configure l’environnement et exécute les expériences, puis compare les résultats obtenus point par point avec le texte original de l’article.

SAI a examiné les 168 oraux, dont seulement 104 avaient leur code ouvert, et a finalement réussi à reproduire complètement 105 cas.

Parmi celles-ci, seules 34 ont reproduit plus de 40 % des revendications ; seules 8 ont atteint un taux de reproductibilité supérieur à 80 %.

SAI

Quelle que soit le nombre d'affirmations vérifiables dans chaque article — au moins une, trois ou cinq — la médiane des scores de réplication reste constamment entre 28 % et 30 %, avec une distribution globale peu variable.

SAI

Après exclusion des expériences non exécutées, interrompues prématurément ou dépassant les capacités matérielles, la médiane des scores de reproduction reste uniquement entre 42 % et 50 % ; lorsque chaque article contient au moins trois affirmations vérifiables, la médiane se stabilise à 42 %.

J'ai rencontré les problèmes les plus courants dans la reproduction : le code ne s'exécute pas, des fichiers sont manquants, les instructions sont incomplètes, les dépendances sont corrompues, ou les résultats du code ne correspondent pas à ceux de l'article.

Quatre autres articles reposent sur des modèles désormais désactivés. Les chercheurs ultérieurs, même s'ils sont disposés à dépenser de l'argent et du temps, ne pourront jamais reproduire les mêmes résultats.

SAI a également cité deux exemples plus spécifiques.

Un article scientifique présente « l'entraînement de seulement 0,77 % des paramètres du modèle de base » comme principal atout, alors que le point de contrôle publié réellement entraîné représente 6,31 % des paramètres, soit environ huit fois le chiffre revendiqué.

Un autre article présente un tableau de fiabilité évalué par un modèle de jugement, mais ce modèle de jugement n'est pas présent dans le code open source, ni aucun script permettant de calculer les chiffres du tableau.

Médiocre article, rendement élevé, risque faible

Les résultats de la reproduction de SAI sont tout simplement très médiocres.

Pire encore, les problèmes découverts ici ne sont que ceux « qui peuvent être découverts dans certaines conditions ».

Les articles sans code sont directement « inattaquables ».

SAI

Même si le code est entièrement ouvert, vérifier un article scientifique exige un temps, un effort et des fonds considérables, et le résultat final est souvent décevant — on ne peut qu’imaginer la déception.

Selon les estimations basées sur les prix à la demande publiés par Google Cloud pour SAI, le coût médian pour re-exécuter complètement un article oral ICML est d'environ 8 900 dollars américains. Sur les 105 articles, 17 dépassent 100 000 dollars américains, et le plus coûteux approche 2,2 millions de dollars américains.

Plus un article scientifique dépend de puissantes ressources de calcul, plus il est difficile de le reproduire de manière indépendante.

Sans code, personne ne peut vérifier ; avec le code, personne ne peut peut-être pas assumer ce coût.

Ainsi, un article contenant des problèmes peut parfaitement passer la révision, être cité, puis être inclus dans un curriculum vitae, ouvrant la voie à une admission, un poste universitaire ou un emploi dans un grand laboratoire.

Parfois, quelqu'un découvre que les résultats ne correspondent pas, les réunions sont rarement réexaminées, et les articles ne sont pas nécessairement retirés.

C'est ce que les commentaires appellent « faire de mauvaises recherches rapporte, mais coûte presque rien ».

SAI

Ne lisez pas les articles, mais vérifiez les articles lors du recrutement.

Dans le domaine des grands modèles, de nombreuses avancées véritablement importantes ne sont plus publiées sous forme d'articles scientifiques.

En tant qu'ingénieur chez OpenAI, placé à la pointe de l'industrie, il est facile de comprendre ce sentiment. Après tout, avec une puissance de calcul plus importante, des retours d'expérimentation plus rapides et de nombreux résultats internes non publiés, on a la confiance de « ne pas lire les articles scientifiques ».

Mais dire cela, c'est un peu subtil.

Un commentaire ironise sur les gens des entreprises technologiques qui agissent ainsi en « retirant l’échelle après être monté » : recruter des chercheurs dans les universités, s’appuyer sur les résultats accumulés publiquement par le monde académique, arracher les talents et les GPU en payant des prix plus élevés, de moins en moins soumis à l’évaluation par les pairs, puis se tourner vers le monde académique pour déclarer que la recherche scientifique est « principalement une arnaque ».

SAI

Un peu acerbe, mais effectivement juste.

Les personnes de ces laboratoires de pointe peuvent « ne pas lire d'articles scientifiques », mais ceux qui souhaitent y entrer doivent d'abord publier des articles.

Pour les étudiants et jeunes chercheurs sans expérience industrielle, les articles de conférences de haut niveau restent la preuve la plus directe de leurs compétences en recherche.

Postuler à un doctorat, chercher un poste universitaire ou intégrer un laboratoire de pointe comme OpenAI repose sur la publication d'articles pour attirer l'attention.

Les professionnels de l'industrie, une fois entrés dans de grands laboratoires, méprisent les publications, mais utilisent toujours le nombre d'articles, le niveau des conférences et les performances en citations pour sélectionner ceux qui sont à l'extérieur.

Le mémoire se retrouve donc dans une position embarrassante : sa crédibilité dans la diffusion des connaissances est remise en question, mais sa valeur dans la compétition pour les talents n'a pas disparu du tout.

Ainsi, « le grand laboratoire ne lit plus d’articles » semble un peu prétentieux et arrogant, car ceux qui ont réellement le droit de ne pas lire d’articles ont souvent déjà franchi ce seuil grâce à des articles.

Of course, not all students are meticulously crafted academic villains.

Un chercheur universitaire a plaisanté en disant qu’il souhaiterait que ses étudiants aient déjà la capacité d’écrire un article exagéré voire falsifié.

SAI

Certains s'efforcent d'être des fraudeurs académiques, tandis que d'autres luttent encore avec LaTeX.

Lien de référence :

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074

https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886

Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.