Claude a cette fois-ci véritablement dominé le classement de la programmation IA !
Sur le classement MirrorCode vient d'être mis à jour, Claude Fable 5 reprend la première place avec un taux de réussite absolu de 64 %.
GPT-5.6 Sol, qui le suit de près, n'a obtenu qu'un tiers de son score !
Classé quatrième, GPT-5.5 est encore plus mal loti : non seulement son score n'est que de 10 %, mais il est aussi dominé par son prédécesseur GPT-5.4.

Plus surprenant encore, lors de l'utilisation de langages à forte consommation de ressources comme Go, le taux de résolution de Fable 5 est de 64 % ; en passant au langage peu courant Ada, le résultat reste élevé à 61 %.
Sachez que dans le monde open source, le corpus Python est environ 230 fois plus important que celui d'Ada.
Mais ici, à Fable 5, les résultats n'ont diminué que de 3 points de pourcentage.

C'est plus intéressant.
Si le modèle s'appuyait principalement sur la mémoire de la grammaire et des formulations courantes des langues populaires, alors le passage à Ada devrait entraîner une baisse des performances.
Mais le résultat actuel pointe vers une autre possibilité —
Le modèle le plus puissant a déjà dépassé l'influence des données d'entraînement spécifiques et commence à apprendre à construire un projet logiciel complet depuis zéro.
Bloqué à la ligne de passage à 100 %, test limite de 10 milliards de tokens
Plus précisément, MirrorCode complet comprend 25 programmes cibles, couvrant des domaines tels que les outils Unix, les interpréteurs, les requêtes de données, la bioinformatique, la cryptographie et les outils de compression.
Ici, le modèle est placé dans un environnement isolé, sans accès à Internet, sans possibilité de consulter le code source du projet original ni de télécharger des dépendances tierces. Il ne dispose que de la documentation de haut niveau, d'une partie des tests visibles et d'un programme original qu'il peut appeler répétitivement.
Ensuite, il doit continuer à entrer des données dans le programme d'origine, observer les sorties pour deviner la logique interne, puis Cliquez ici Écrivez un nouveau programme comportementalement cohérent.
Sélectionnez 15 cibles Medium et Large parmi les derniers classements. Chaque cible est implémentée avec deux langages, chaque langage étant exécuté trois fois.
De plus, le taux de completion des tests visibles et des tests cachés doit atteindre 100 % pour être considéré comme réussi ; 99,9 % ne suffit pas.
Même en omettant un seul cas limite, l'ensemble de l'exécution est considéré comme un échec.

Pour forcer le modèle à combler les dernières lacunes, MirrorCode a augmenté le budget par session à 10 milliards de tokens, avec une durée maximale d'exécution continue de 7 jours.
La tâche la plus coûteuse dans l'article est encore plus impressionnante : le modèle a fonctionné pendant 19 jours consécutifs, avec un coût unique de 2600 dollars.
Pendant ces 19 jours, le modèle exécutera répétitivement le programme d'origine, comparera les résultats, ajoutera des fonctionnalités, puis relancera les tests. En cas d'erreur, il recherchera la cause ; si les sorties ne correspondent pas, il changera d'hypothèse ; une fois une partie validée, il passera à la prochaine lacune.
L'ensemble du processus ressemble davantage à un débogage qui dure plusieurs jours qu'à une simple génération.

L'exemple de gotree est le plus intuitif.
Cet outil de bioinformatique comportait à l'origine environ 16 000 lignes de code Go et plus de 40 commandes.
Claude Opus 4.7 a passé 2000 sur 2001 tests en 14 heures et à un coût de 251 dollars, avec un taux de réussite de 99,95 %.
Bien qu'il ait manqué une frontière peu connue concernant le traitement des dates, il a été arrêté par la ligne de passage à 100 % de MirrorCode, mais il a réduit le volume de travail initialement estimé sur une semaine à quelques dizaines d'heures —
Epoch estime que, sans l'utilisation de l'IA, des ingénieurs humains mettraient au moins 2 à 17 semaines pour accomplir la même tâche.
Dans le désert de corpus, Fable 5 n'a perdu que 3 points.
Le papier MirrorCode a utilisé le mélange d'entraînement public de StarCoder comme référence.
Python représente environ 8 %, tandis qu'Ada ne représente que 0,034 %, soit environ 230 fois plus pour le premier que pour le second.

Bien sûr, nous ne pouvons pas savoir combien de code Ada les modèles propriétaires ont vu. Mais en se basant sur l'écosystème ouvert, la rareté d'Ada est suffisamment évidente.
Cette langue est principalement utilisée dans les domaines de l'aérospatiale, de la défense et d'autres systèmes critiques pour la sécurité. Elle ne peut en aucun cas rivaliser avec Python, JavaScript ou Go en termes de taille de la communauté, de nombre de tutoriels ou de projets open source.
Et Fable 5 ne traduit évidemment pas le code Go ligne par ligne en Ada.
C’est plutôt une question de comprendre d’abord comment le programme d’origine fonctionne, puis de réécrire le même comportement dans un autre langage.

En comparaison, les autres modèles ne sont pas aussi stables.
GPT-5.6 est passé de 24 % à 19 %, GPT-5.4 de 21 % à 12 %, et GPT-5.5 est tombé de 17 % à 5 %. Dès le changement de langue, l'écart s'est immédiatement amplifié.
Confier l'ensemble du projet à l'IA
Aujourd'hui, Cursor a permis à des centaines d'agents de collaborer pendant près d'une semaine pour écrire depuis zéro plus d'un million de lignes de code de navigateur réparties sur 1 000 fichiers.
Anthropic a fait s'exécuter en parallèle 16 agents Claude pendant près de 2 000 sessions, aboutissant à la création d'un compilateur C de 100 000 lignes capable de compiler le noyau Linux 6.9.
Parmi les échantillons d'utilisateurs individuels de Codex divulgués par OpenAI à ce jour en mai, 70,2 % ont soumis au moins une tâche estimée à plus d'une heure de travail humain ; 25,6 % ont soumis des tâches dépassant huit heures.
Les unités que les gens confient à l'IA passent d'un morceau de code, d'un bogue, à une après-midi, une semaine, voire un projet entier.
64 % de MirrorCode constitue une quantification de ce type de « mandat de projet ».
Il indique que, tant que l'objectif est suffisamment clair et que les résultats peuvent être vérifiés automatiquement, les modèles de pointe sont déjà capables d'accomplir seuls une partie des logiciels de taille moyenne à grande.
Pour chaque personne qui délègue son travail à l’IA, le changement est déjà à nos portes —
Avant, vous deviez surveiller chaque ligne de code que vous écriviez ; désormais, vous ne vérifierez probablement que les points clés pour vous assurer qu'il ne dévie pas.
Le code deviendra de plus en plus bon marché.
Ceux qui savent expliquer clairement les problèmes et vérifier précisément les résultats deviendront de plus en plus précieux.
Références : https://epoch.ai/MirrorCode
Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI ; éditeur : Moïse
