Aujourd’hui, Anthropic a lancé Claude Fable 5.1 / Mythos 5.1 (un même modèle, avec différents niveaux de sécurités). Cette mise à jour mineure apporte des améliorations modérées des performances, mais nous intéresse surtout pour son gain de stabilité et sa réduction de prix. Voici les mises à jour officielles : 1. Meilleures capacités agentic pour la recherche scientifique Terminal-Bench-Science est passé de 24,7 % avec Fable 5 à 52,6 %, soit presque un doublement, et dépasse largement Opus 5 à 29,0 %. 2. Codage et tâches longues sans supervision Terminal-Bench 4.0 est passé de 42,0 % à 55,8 % (Mythos 5.1 atteint 60,9 %) ; CursorBench 3.2.0 atteint 73,4 %. Millennium l’a utilisé pour identifier un plantage d’une probabilité d’un millionième, non détecté par l’équipe pendant quatre à cinq ans et manqué par d’autres modèles. 3. Prix réduit d’environ 25 % Les lectures en cache (cache read) ont été réduites de 75 %, passant à 0,25 $/million de tokens ; le coût total pour une charge typique a diminué d’environ 25 %, jusqu’à 45 % dans les scénarios agentic intensifs. Les coûts d’entrée à 10 $ et de sortie à 50 $/million de tokens restent inchangés. 4. Des performances suffisantes même en mode faible effort En mode Low/Medium, les résultats sont déjà proches ou supérieurs à Fable 5, mais à un coût bien inférieur — idéal pour les scénarios sensibles au prix, où un downgrade direct est possible. 5. Réduction significative des faux positifs des garde-fous Les blocages des garde-fous de sécurité réseau dans Claude Code ont diminué en moyenne de 60 %. Il est désormais autorisé d’utiliser ce modèle pour identifier des vulnérabilités (l’écriture d’exploits, les tests d’intrusion et le scan binaire restent interdits et redirigés vers Opus). Les déclenchements indésirables pour les questions biologiques légitimes (biologie fondamentale, questions médicales) ont diminué de 85 %. 6. Solution de conservation des données pour les entreprises Le nouveau système Enterprise Frontier Safeguards (EFS) stocke les données sur le cloud du client, et non chez Anthropic — équivalent à une absence totale de conservation des données. Ce service sera déployé progressivement cet automne ; avant cela, les clients éligibles peuvent déjà l’utiliser avec une conservation nulle des données. 7. Meilleure alignement par rapport à la génération précédente Moins de tentatives pour sortir de l’environnement de test afin d’accéder à des ressources externes, moins d’excuses basées sur des raisonnements comme « ceci est une simulation/évaluation », une réduction des tentatives et du taux de réussite de reward hacking, et c’est actuellement le modèle le plus résistant aux injections de prompts. Deux autres points à noter : Les nouveaux comptes API ne permettent plus d’éditer manuellement l’historique des réflexions de Claude dans les conversations multiround (pour prévenir le distillation), et les sorties incluront un filigrane texte invisible requis par la loi européenne sur l’IA — sans impact sur la qualité du contenu ni aucune information utilisateur.
Dr.RPartager
Source:Afficher l'original
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations.
Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.