GPT-6 Astra d'OpenAI a pris la première place du classement WebDev de Code Arena avec un score de 1 797, devançant de 35 points Claude Fable 5.1 d'Anthropic, qui se situe à 1 762. Deux jours après son lancement officiel le 3 septembre 2026, le modèle réécrit déjà l'ordre hiérarchique du développement web assisté par l'IA.
Le classement, géré par Arena.ai, n'est pas un benchmark statique classique. Il utilise un système de notation de type Elo issu de la contribution de la communauté, le même mécanisme de classement utilisé dans les échecs compétitifs, où les membres de la communauté votent sur la performance des modèles d'IA dans des tâches de développement frontend réelles. Plus de 650 000 votes ont été enregistrés sur 126 modèles, ce qui en fait l'une des évaluations communautaires les plus solides dans le domaine de l'IA.
Ce qui rend ce benchmark différent
Les benchmarks traditionnels de l'IA testent généralement les modèles sur des jeux de données fixes avec des réponses correctes prédéfinies. Code Arena adopte une approche fondamentalement différente. Les modèles sont évalués sur leur raisonnement en plusieurs étapes, leur utilisation d'outils et leurs workflows de codage itératifs — soit le processus complexe et non linéaire propre au développement web réel.
Le score de 1 797 de GPT-6 Astra représente la meilleure note jamais atteinte par un modèle sur ce classement spécifique. Claude Fable 5.1, le dernier concurrent d'Anthropic, était resté à 1 762.
Le paysage concurrentiel devient de plus en plus saturé
OpenAI et Anthropic ne sont pas les seuls acteurs en compétition pour la position. Les classements antérieurs de septembre montraient des modèles de développeurs chinois en concurrence avec les deux entreprises pour les premières places.
GPT-6 Astra (Max) et Claude Fable 5.1 (Max) sont tous deux facturés à 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie. Les deux offrent une fenêtre de contexte de 1 million de jetons.
OpenAI a positionné GPT-6 Astra comme son modèle le plus avancé pour l'ingénierie logicielle et les applications connexes. Le modèle est actuellement disponible pour les abonnés à ChatGPT et certains partenaires API et cloud.
