GPT-6 Astra d'OpenAI obtient 97,6 % sur FrontierMath Niveau 4

iconCryptoBriefing
Partager
AI summary iconRésumé
GPT-6 Astra d'OpenAI a obtenu 97,6 % sur FrontierMath Tier 4 (v2), une avancée majeure par rapport à une version interne qui avait obtenu 17 % aux tests de mathématiques. Le modèle a également atteint 99,9 % sur ARC-AGI-3, 100 % sur ExploitBench et 96,0 % sur GPQA Diamond. Astra a surpassé son prédécesseur, GPT-5.6 Sol, de 14,6 points de pourcentage sur le même benchmark. Cette actualité sur chaîne marque une mise à jour clé dans le cycle d'annonces de lancement du jeton. Astra est désormais disponible pour les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise, ainsi que pour les partenaires API.

Le plus récent modèle de raisonnement d'OpenAI, GPT-6 Astra, a été lancé le 3 septembre avec un score de 97,6 % sur FrontierMath Tier 4 (v2). C'est le genre de chiffre qui vous fait faire un double-take, surtout lorsque vous apprenez qu'une version interne antérieure du modèle peinait à atteindre 17 % aux évaluations de capacité mathématique.

La trajectoire passant de 17 % à 47 % en interne, puis presque à la perfection sur les benchmarks publics, condense ce qui serait normalement perçu comme des années de progrès en un seul cycle de développement.

Le blitz de référence

Sur ARC-AGI-3, mesuré dans le cadre d'évaluation interne d'OpenAI, Astra a obtenu un score de 99,9 %. Sur ExploitBench, elle a atteint un score parfait de 100 %. GPQA Diamond, un benchmark de raisonnement scientifique de niveau master, a obtenu 96,0 %. Terminal-Bench Science 0.1 a donné un score de 64,6 %.

Publicité

Le résultat du niveau 4 (v2) de FrontierMath est toutefois le chiffre principal. GPT-5.6 Sol, prédécesseur d’Astra, a obtenu 83,0 % sur le même benchmark. Les 97,6 % d’Astra représentent une amélioration de 14,6 points de pourcentage.

De 17 % à un niveau mondial

Les versions initiales du modèle qui deviendrait Astra géraient environ 17 % aux évaluations de compétences mathématiques. Grâce à des améliorations itératives, ce chiffre est passé à environ 47 % avant que le modèle ne soit affiné davantage pour sa sortie publique.

OpenAI a également reconnu Astra pour avoir apporté de nouvelles perspectives sur les écarts entre nombres premiers, un domaine particulièrement difficile de la théorie des nombres qui occupe les mathématiciens humains depuis des siècles.

Qui a accès, et quand

Le déploiement d'Astra a suivi une approche en étapes. Certaines organisations ont obtenu un accès le jour du lancement, avec une disponibilité élargie étendue aux abonnés de ChatGPT Plus, Pro, Business et Enterprise peu après. L'accès à l'API est disponible directement auprès d'OpenAI, ainsi qu'à travers Azure et AWS Bedrock.

Le paysage concurrentiel

Des évaluations indépendantes ont placé Astra parmi les meilleurs modèles d'IA actuellement disponibles, bien que certaines évaluations notent que certaines variantes de Claude d'Anthropic le dépassent dans les tests d'intelligence plus larges.

Le passage de 83,0 % à 97,6 % sur FrontierMath en une génération de modèle suggère que le plafond du raisonnement mathématique par IA, s'il existe, n'a pas encore été atteint.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.