🔺 Nous avons rejoint 20 jours en retard. Six jours plus tard, nous sommes #71. Nous avons participé au Défi de reproduction d’agents ICML 2026 20 jours après son lancement, avec moins d’une semaine pour construire, tester, documenter, publier et défendre notre travail. Six jours plus tard, AITrailblazer est classé #71 sur 350 participants — environ les 20 % meilleurs — avec 44 points sur 6 reproductions de papiers évaluées. Ce score représente 22 affirmations de recherche vérifiées ou infirmées de manière indépendante. Trois de nos carnets de laboratoire ont obtenu une note parfaite de 10/10. Un a obtenu 8/10. Un autre détient actuellement 6/10. Notre audit partiel d’audit des preuves avec Tool-Guard libéré a obtenu zéro point — et nous a appris l’une des leçons les plus importantes de tout le défi. Il existe une différence fondamentale entre vérifier les résultats publiés par un auteur et reproduire indépendamment ces résultats. Nous n’avions pas 26 jours pour étudier le classement, sélectionner des affirmations faciles, optimiser notre processus et améliorer progressivement nos soumissions. Nous n’avions que six jours. Pendant ces six jours, nous avons dû trouver des articles adaptés, comprendre leurs affirmations centrales, localiser le code et les données publiés, concevoir des tests indépendants, exécuter des expériences, préserver les preuves, calculer des hachages, documenter les limites, publier des espaces publics Trackio, et attendre un juge indépendant. Nous nous sommes concentrés sur ce que la reproduction scientifique devrait vraiment signifier : Des preuves publiques et inspectables. Des méthodes exécutables. Des calculs déterministes autant que possible. Des hachages exacts et une traçabilité prouvée. Des contrôles négatifs conçus pour détecter les accords erronés. Une séparation claire entre les preuves indépendantes et les artefacts publiés par les auteurs. Une documentation honnête de ce que nous avons — ou n’avons pas — pu reproduire. Cet accomplissement compte parce que l’IA peut produire des explications convaincantes extrêmement rapidement. Mais le progrès scientifique ne vient pas d’explications qui semblent simplement correctes. Il vient d’affirmations qui survivent à des tests indépendants. Il vient aussi de résultats négatifs documentés avec le même soin que les confirmations réussies. Le défi reconnaît ce principe en attribuant des points égaux aux affirmations vérifiées et infirmées. C’est important. Un résultat rigoureux montrant qu’une affirmation ne se reproduit pas peut être aussi précieux pour la science qu’une confirmation réussie. Il empêche la fausse confiance, révèle les hypothèses cachées et donne aux chercheurs futurs une base plus solide. Notre situation actuelle démontre également pourquoi l’infrastructure de reproductibilité est essentielle. Notre dernière mise à jour Prediction-Powered Inference est publique, en bonne santé, et a été détectée avec succès par le juge automatique. Cependant, les trois tentatives d’évaluation ont échoué car le routeur d’inference Hugging Face a renvoyé des erreurs HTTP 504 côté serveur. Nous avons demandé une réexécution administrative sans modifier les preuves, sans demander un verdict manuel, ni soumettre un résultat alternatif. Jusqu’à ce que cette évaluation automatique soit rétablie, le classement continue d’afficher nos 44 points actuels et notre position #71. Le classement final pourrait encore changer. D’autres participants continuent de soumettre leur travail. Notre mise à jour PPI pourrait encore être réévaluée. Le classement reste actif à mesure que la date limite approche. Mais quel que soit le classement final, atteindre la position #71 sur 350 après avoir rejoint 20 jours en retard — et le faire en seulement six jours — est déjà un accomplissement méritant reconnaissance. Nous n’avons pas simplement généré des résumés d’articles de recherche. Nous avons construit un registre public et inspectable montrant ce qui a résisté, ce qui a échoué, comment nous l’avons testé, et où les preuves s’arrêtent. C’est ce que la reproductibilité devrait ressembler à. Classement en direct : https://t.co/ALGcVy1Qng Notre reproduction la plus forte 10/10 — CoopEval : https://t.co/FW8JxWV4b6 Nous avons rejoint 20 jours en retard. Nous avions six jours. Nous sommes arrivés dans les 20 % meilleurs. La reproductibilité bat la hype. Les preuves s’accumulent. #ICML2026 #AIResearch #Reproducibility #OpenScience
DeltaSignalPartager
Source:Afficher l'original
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations.
Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.