Le plus récent modèle de raisonnement d'OpenAI, GPT-6 Astra, a été lancé le 3 septembre avec un score de 97,6 % sur FrontierMath Tier 4 (v2). C'est le genre de chiffre qui vous fait faire un double-take, surtout lorsque vous apprenez qu'une version interne antérieure du modèle peinait à atteindre 17 % aux évaluations de capacité mathématique.
La trajectoire passant de 17 % à 47 % en interne, puis presque à la perfection sur les benchmarks publics, condense ce qui serait normalement perçu comme des années de progrès en un seul cycle de développement.
Le blitz de référence
Sur ARC-AGI-3, mesuré dans le cadre d'évaluation interne d'OpenAI, Astra a obtenu un score de 99,9 %. Sur ExploitBench, elle a atteint un score parfait de 100 %. GPQA Diamond, un benchmark de raisonnement scientifique de niveau master, a obtenu 96,0 %. Terminal-Bench Science 0.1 a donné un score de 64,6 %.
Le résultat du niveau 4 (v2) de FrontierMath est toutefois le chiffre principal. GPT-5.6 Sol, prédécesseur d’Astra, a obtenu 83,0 % sur le même benchmark. Les 97,6 % d’Astra représentent une amélioration de 14,6 points de pourcentage.
De 17 % à un niveau mondial
Les versions initiales du modèle qui deviendrait Astra géraient environ 17 % aux évaluations de compétences mathématiques. Grâce à des améliorations itératives, ce chiffre est passé à environ 47 % avant que le modèle ne soit affiné davantage pour sa sortie publique.
OpenAI a également reconnu Astra pour avoir apporté de nouvelles perspectives sur les écarts entre nombres premiers, un domaine particulièrement difficile de la théorie des nombres qui occupe les mathématiciens humains depuis des siècles.
Qui a accès, et quand
Le déploiement d'Astra a suivi une approche en étapes. Certaines organisations ont obtenu un accès le jour du lancement, avec une disponibilité élargie étendue aux abonnés de ChatGPT Plus, Pro, Business et Enterprise peu après. L'accès à l'API est disponible directement auprès d'OpenAI, ainsi qu'à travers Azure et AWS Bedrock.
Le paysage concurrentiel
Des évaluations indépendantes ont placé Astra parmi les meilleurs modèles d'IA actuellement disponibles, bien que certaines évaluations notent que certaines variantes de Claude d'Anthropic le dépassent dans les tests d'intelligence plus larges.
Le passage de 83,0 % à 97,6 % sur FrontierMath en une génération de modèle suggère que le plafond du raisonnement mathématique par IA, s'il existe, n'a pas encore été atteint.
