Juste maintenant, le dernier défi de niveau 4 de FrontierMath a été résolu par GPT-6 Astra.
À ce jour, tous les problèmes de ce test de recherche, autrefois considéré comme un cauchemar mathématique pour les grands modèles, ont été résolus au moins une fois par une IA.
Epoch AI a également officiellement conclu que FrontierMath Tier 4 est saturé.

Bien que l'illustration ci-dessus montre qu'Astra n'a pas encore atteint directement 100 %, le résultat publié par OpenAI lui-même est de 97,6 %.
Mais selon l'algorithme d'Epoch, « résolu entièrement » signifie que, après avoir cumulé les tentatives provenant de différents modèles et à différents moments, chaque question du Tier 4 a déjà été résolue avec succès.
Et ce que Astra a vaincu, c'était précisément la dernière barrière qui n'avait pas encore été franchie par l'IA.
(En termes simples, Astra a peut-être commis une erreur lors d'un certain test, mais la question à laquelle elle a répondu correctement n'avait pas été résolue auparavant)

Pour être honnête, ce rythme de développement est tout simplement incroyable.
Si vous suivez les évaluations de modèles, vous savez que lors du lancement du Tier 4 le 11 juillet 2025, le meilleur résultat sur le classement était d'environ 5 %.
À peine un an et deux mois après, ce mur autrefois infranchissable est devenu un marchepied, et le dernier problème difficile à contourner par une IA via un raccourci a été franchi.
L'auteur de la question, Jay Pantone, professeur adjoint en mathématiques à l'université Marquette, a également déclaré que les IA précédentes cherchaient toujours des raccourcis numériques, mais que cette fois-ci, la solution de l'IA était très proche de la sienne.

Cependant, alors que GPT-6 Astra a récemment lancé une offensive massive contre le monde des mathématiques, résolvant des problèmes du millénaire presque tous les deux jours, Pantone déclare qu'il lui est désormais difficile d'être surpris !
On peut dire que les mathématiques sont devenues l’un des domaines où Astra a le plus marqué sa présence récemment.
De moins de 2 % à l'ajout d'une « ligne de défense de niveau recherche » dédiée
FrontierMath a été publié pour la première fois le 7 novembre 2024, et son objectif même était d'éviter que les benchmarks mathématiques soient trop rapidement saturés par l'IA.
À l'époque, des benchmarks mathématiques traditionnels comme GSM8K et MATH devenaient de plus en plus difficiles pour distinguer les modèles de pointe ; Epoch AI a donc collaboré avec plus de 60 mathématiciens pour concevoir une série de questions originales jamais rendues publiques auparavant.
Parmi eux, on trouve Terence Tao, Timothy Gowers, Richard Borcherds, lauréats de la médaille Fields.
Après avoir examiné certains de ces problèmes de niveau recherche, Terence Tao a déclaré directement que ces questions étaient « extrêmement difficiles » et a estimé que les problèmes les plus difficiles de niveau Tier 3 pourraient encore faire planter l'IA pendant plusieurs années.

Après le premier tour de tests, comme prévu, la précision du modèle leader était inférieure à 2 %.
Au départ, la base de questions principale de FrontierMath comprenait 300 questions, réparties en trois niveaux de difficulté : Tier 1, Tier 2 et Tier 3.

Le niveau 1 est approximativement équivalent à des problèmes de licence de haut niveau et à des épreuves de mathématiques olympiques, tout en autorisant l'utilisation d'outils plus avancés ; le niveau 2 atteint le niveau de doctorat avancé ; le niveau 3 s'approche davantage des problèmes de recherche exploratoire rencontrés au début du doctorat.
Mais avec l'apparition des modèles d'inférence, ces trois premiers niveaux sont devenus de plus en plus insuffisants ; ainsi, en 2025, Epoch a ajouté un nouveau niveau : Tier 4.
Le niveau 4 est principalement conçu par des professeurs de mathématiques et des post-doctorants, chacun menant une étude à court terme d'environ quelques semaines autour de sa propre orientation de recherche, avant de condenser les résultats en une question pouvant être vérifiée automatiquement.

Au départ, le niveau 4 comprenait 50 questions. Elles couvrent des domaines tels que l'analyse, la théorie des nombres, les mathématiques combinatoires, la topologie, la géométrie algébrique...
Au moment de sa sortie, au cours de tous les tests effectués jusqu'alors, seulement trois questions avaient été résolues, et ces solutions reposaient sur certaines hypothèses correctes mais non suffisamment démontrées.
À cet égard, Epoch a également indiqué sur la page publique d'exemples de questions du site officiel : certaines de ces questions pourraient ne pas être résolues par l'IA pendant des décennies.

(This sentence is now being repeatedly beaten to death)
Cependant, à mesure que les modèles deviennent de plus en plus puissants, un autre problème est apparu : la base de questions elle-même commence à ne plus résister aux tests de l'IA.
OpenAI a découvert lors des tests que les erreurs dans FrontierMath étaient plus nombreuses que prévu.
Ensuite, l'Epoch a lancé une audit indépendant, utilisant d'abord GPT-5.5 et Claude Opus 4.7 pour identifier les points suspects, puis les a soumis à des mathématiciens pour une vérification point par point. La version v2 a finalement été lancée en juin 2026, avec 12 questions corrigées et 7 supprimées au niveau Tier 4, laissant 43 questions.
Après révision, les performances du modèle ont continué d'augmenter.
GPT-5.6 Sol atteint 83,0 %, Claude Fable 5 atteint 90,2 %, et GPT-6 Astra atteint désormais 97,6 %.

Plus important encore, Astra a également résolu la seule question précédemment jamais résolue par une IA.

À ce jour, chaque question du niveau 4 a déjà été résolue au moins une fois par l'IA. Cette ligne de défense de niveau recherche, spécialement conçue pour les modèles les plus puissants, a finalement été contournée.
Cependant, cela ne signifie pas que « les mathématiques ont été résolues par l'IA ». Au contraire, FrontierMath a déjà commencé à passer à la prochaine étape.
Le projet inclut désormais, en plus des niveaux 1 à 4, de vrais problèmes ouverts ainsi que la formalisation des problèmes d’Erdős dans Lean sous le nom de FrontierMath Erdős.

Le premier teste directement le modèle sur des problèmes de recherche non résolus par la communauté mathématique ; le second exige que l'IA rédige une preuve complète vérifiable formellement.
Cette fois-ci, Astra n'a résolu que 2 problèmes sur les 68 de FrontierMath Erdős.
L'histoire continue~
Cet article provient du compte officiel WeChat « Quantum Bit », auteur : henry
