Décryptage Beating AI : depuis le lancement de GPT-6 Astra par OpenAI le 3 septembre, plusieurs données de référence d'évaluation de modèles ont été continuellement ajustées. Certaines modifications ont amélioré les performances d'Astra, tandis que d'autres ont fait chuter les résultats de modèles concurrents, suscitant des interrogations sur le « doping des classements » et la transparence des évaluations. Ainsi, le taux d'hallucinations d'Astra a été réduit de 4,2 % à 2 %, tandis que celui de GPT-5.6 Sol est passé de 12,2 % à 9,4 %, avant de revenir respectivement à 4,2 % et 12,2 %. En évaluation mathématique, le score de Fable 5.1 d'Anthropic est tombé de 87,8 % à 78 %, puis est remonté à 83 % ; celui de GPT-5.6 Sol est passé de 83 % à 80,5 %, avant de retrouver 83 %. De plus, le score d'Astra sur l'évaluation ARC-AGI-3 est passé de 98,6 % dans la version brouillon avant le lancement à 99,99 % sur la page finale, et son score en programmation a été légèrement relevé de 57,7 % à 57,9 %. OpenAI affirme que les résultats d'évaluation peuvent être influencés par la version du modèle, la configuration des outils, le niveau d'inférence et les exécutions de test, et que ces ajustements visent à refléter plus précisément les performances optimales du modèle. Toutefois, des chercheurs de l'Université de Stanford estiment que la réexécution fréquente des évaluations pourrait correspondre à ce qu'on appelle le « Benchmaxxing » : l'ajustement des conditions de test pour maximiser les scores de référence. Les professionnels soulignent qu'avec l'intensification de la concurrence entre modèles d'IA, les données d'évaluation sont devenues un outil essentiel pour mesurer les capacités des modèles et conquérir le marché. La transparence et la reproductibilité des tests de référence suscitent désormais une attention croissante.
OpenAI ajuste les données d'évaluation de GPT-6 Astra, suscitant des préoccupations concernant la transparence
MarsBitPartager
OpenAI aurait modifié les données d'évaluation de GPT-6 Astra, suscitant des inquiétudes concernant la transparence. Le taux d'hallucinations d'Astra est passé de 4,2 % à 2 %, tandis que des concurrents comme Anthropic et GPT-5.6 Sol ont vu leurs scores en mathématiques diminuer. OpenAI affirme que ces modifications reflètent une performance précise, mais des chercheurs de Stanford mettent en garde contre le « benchmaxxing ». Alors que les altcoins à suivre gagnent en popularité amid market shifts, des données fiables restent essentielles. Les tendances des données sur l'inflation soulignent également la nécessité de benchmarks clairs et reproductibles dans les secteurs de l'IA et de la crypto.
Source:Afficher l'original
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations.
Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.