Anthropic lance Claude Sonnet 5.5 avec une sortie 30 % plus rapide et une réduction des coûts

iconMetaEra
Partager
AI summary iconRésumé
Anthropic a annoncé le lancement de Claude Sonnet 5.5, un nouveau projet de jeton optimisé pour les tâches à haute fréquence. Le modèle offre une sortie 30 % plus rapide et jusqu'à 30 % de coût par tâche inférieur à Sonnet 5. Les informations chainées montrent qu'il a obtenu 70,6 % sur Terminal-Bench 4.0, surpassant à la fois Sonnet 5 et Opus 5.5. Toutefois, sous un raisonnement maximal, il utilise plus de jetons et coûte jusqu'à 50 % plus cher. Anthropic recommande Sonnet 5.5 pour les tâches bien définies, tandis qu'Opus gère les travaux complexes.
Anthropic lance Claude Sonnet 5.5, visant à comprimer les capacités proches de celles du modèle phare Opus 5.5 dans un modèle Agent quotidien moins coûteux et adapté aux appels fréquents. Le prix de l'API reste à 2 $ et 10 $ par million de tokens en entrée/sortie, mais l'entreprise affirme une augmentation de la vitesse de sortie de plus de 30 %, ainsi qu'une réduction du nombre de tokens nécessaires pour accomplir des tâches typiques, ce qui permet une baisse maximale de 30 % du coût par tâche. Dans les tests officiels, il obtient 70,6 % sur Terminal‑Bench 4.0, dépassant les 10,3 % de Sonnet 5 et les 66,4 % d'Opus 5.5 ; il atteint également 1844 Elo sur la tâche professionnelle GDPval‑AA, proche des 1846 d'Opus. Toutefois, « Opus à moitié prix » n'est pas une conclusion complète : Artificial Analysis a constaté que Sonnet 5.5 génère en moyenne environ 193 000 tokens de sortie par question à son niveau maximal de puissance d'inférence, ce qui en fait la configuration la plus gourmande en tokens testée, augmentant ainsi le coût par question d'environ 50 % par rapport à Sonnet 5 ; les tests réels de revue de code par CodeRabbit montrent également que, bien que Sonnet 5.5 soit environ deux fois plus rapide que sa génération précédente, il continue à manquer des problèmes complexes que Opus parvient à détecter. Il s'agit donc davantage d'un nouveau modèle principal adapté aux tâches claires et répétables, que d'une substitution complète à Opus.

Auteur et source de l'article : Anthropic

Anthropic réoriente Sonnet en tant que agent principal pour un usage quotidien

Sonnet 5.5 est le deuxième modèle de la série Claude 5.5. Contrairement à Opus 5.5, publié il y a une semaine et destiné aux tâches ouvertes et complexes, Anthropic le positionne comme un outil pour les tâches quotidiennes aux frontières bien définies et nécessitant de nombreuses exécutions répétées : corriger des erreurs de programme, examiner du code, investiguer des documents, ainsi que générer des documents, des présentations et des tableurs.

Le modèle prend en charge l'entrée texte et image, offre un contexte de 1 million de tokens, et est disponible sur le site web et les applications mobiles de Claude, ainsi que via l'API Anthropic, AWS, Google Cloud et Microsoft Azure. Le nom de l'API estclaude-sonnet-5-5. Anthropic n'a pas divulgué le nombre de paramètres, l'architecture du modèle, les données d'entraînement ni la puissance de calcul utilisée pour l'entraînement ; il est donc impossible de déterminer si les améliorations proviennent de l'entraînement de base, de l'entraînement postérieur, de la stratégie d'inférence ou de l'optimisation de la chaîne d'outils Agent.

La différence avec Opus ne se limite pas à une « capacité inférieure et un prix plus bas ». Anthropic souhaite établir une nouvelle répartition des rôles entre les modèles : Opus prend en charge les tâches complexes où la définition du problème est incomplète et nécessite un jugement continu, tandis que Sonnet exécute rapidement les tâches déjà bien définies et permet d'augmenter le nombre d'appels à moindre coût.

70,6 % contre 10,3 %, c'est la donnée la plus frappante et la plus nécessitant une compréhension prudente

Sonnet 5.5 obtient 70,6 % sur le test Terminal‑Bench 4.0 publié par Anthropic, contre 10,3 % pour Sonnet 5, dépassant même Opus 5.5 avec 66,4 %. Ce benchmark exige que l'Agent accomplisse des tâches professionnelles en plusieurs étapes dans un environnement de ligne de commande, reflétant ainsi la coordination entre la rédaction de code, les opérations en terminal et l'utilisation d'outils.

Les améliorations pour les autres projets n'ont pas été aussi spectaculaires, mais restent nettes. CursorBench 4.0 est passé de 34,1 % avec Sonnet 5 à 55,5 %, soit environ deux points de pourcentage en dessous de Opus 5.5 à 57,8 % ; Humanity’s Last Exam avec outils est passé de 54,9 % à 64,5 % ; OSWorld 2.1 pour les opérations informatiques est passé de 57,0 % à 80,1 %, près de 81,8 % d'Opus.

Dans la tâche de connaissances professionnelles GDPval-AA, Sonnet 5.5 obtient 1844 Elo, tandis qu'Opus 5.5 obtient 1846 ; dans l'évaluation des travaux de connaissances prolongées AA-Briefcase, les scores sont respectivement de 1811 et 1822. Anthropic en conclut que certaines tâches professionnelles bien définies n'exigent plus systématiquement l'appel du modèle phare.

Cependant, ces chiffres ne peuvent pas être simplement regroupés pour affirmer que « Sonnet dépasse Opus ». Les intensités d'inférence utilisées par les différents projets ne sont pas identiques, et Anthropic a clairement indiqué qu'Opus reste nettement plus puissant pour les tâches nécessitant une prise de décision prolongée ou la gestion d'objectifs ouverts.

Un contre-exemple intéressant provient de FrontierCode. Sonnet 5.5 obtient 52,1 % sous une intensité d'inférence Xhigh, mais ce score chute à 46,2 % lorsqu'on passe en mode Max. Anthropic explique que le modèle déclenche plus fréquemment plusieurs sous-agents d'analyse de code en mode Max, ce qui a entraîné deux fois un dépassement du temps imparti ou une modification de code en dehors du périmètre de la tâche, aboutissant finalement à un échec lors de l'évaluation.

Ce résultat montre qu'une plus grande quantité de raisonnement et de nombreux agents ne garantissent pas nécessairement de meilleures réponses. Le modèle peut perdre des points en raison d'une vérification excessive, d'une extension du champ d'application ou de l'épuisement de son budget temporel.

Aucun token n'a été dévalué, pourquoi l'officiel affirme-t-il que le coût de la tâche est réduit de 30 % ?

Le prix public de Sonnet 5.5 est identique à celui de Sonnet 5 : 2 $ par million de tokens d'entrée, 10 $ par million de tokens de sortie, 2,5 $ pour l'écriture dans le cache et 0,2 $ pour la lecture du cache, soit la moitié des prix correspondants d'Opus 5.5.

Ce que Anthropic désigne comme « jusqu'à 30 % moins cher par tâche unique » ne correspond pas à une baisse des tarifs de l'API, mais à une réduction du nombre d'étapes et de tokens nécessaires pour accomplir le même travail. L'entreprise affirme que la vitesse de génération a augmenté de plus de 30 % ; Slack a observé une réduction d'environ 14 % des tokens de sortie lors de tests internes, Atlassian a déclaré que la vitesse des agents a augmenté jusqu'à 30 %, et Lovable a rapporté une réduction d'environ un tiers des appels d'outils et une division par deux du nombre d'exécutions Shell.

Lorsqu'elle a été testée sur 2 441 tâches de questions-réponses, d'extraction, d'analyse et de prévision financières, Sonnet 5.5 a utilisé en moyenne environ 121 000 tokens par tâche, contre 497 000 pour Sonnet 5. Étant donné que ces tests sont privés et réalisés par des partenaires, la difficulté des tâches, les invites et les sorties complètes ne peuvent pas être vérifiées par le public, mais les résultats convergent tous vers un changement : le nouveau modèle effectue moins de recherches répétées, de lectures redondantes ou de raisonnements internes excessivement longs.

Cela est particulièrement important pour les agents. Dans les discussions traditionnelles, afficher plusieurs centaines de tokens en une seule fois a un impact limité ; en revanche, un agent à long terme répètera la lecture du contexte, l'appel d'outils et la correction des résultats, et une redondance à une étape peut, après des dizaines d'itérations, se transformer en une différence significative en termes de temps et de coûts.

L'intensité maximale d'inférence révèle une autre vérité sur les coûts

Les tests indépendants d'Artificial Analysis ont attribué à Sonnet 5.5 en configuration d'inférence maximale un score de 56, ne devançant que de 2 points Opus 5.5 avec 58 points dans son indice intelligent global.

Mais le prix à payer pour atteindre ce résultat est élevé : Sonnet 5.5 génère en moyenne environ 193 000 tokens de sortie par test, le niveau le plus élevé mesuré par l'organisation, soit environ 60 % de plus que Opus 5.5 Max et Sonnet 5 Max, et sept fois plus que GPT‑6 Astra Max. Son coût estimé par question atteint 7,60 dollars, soit environ 50 % de plus que Sonnet 5.

Cela ne contredit pas directement l'affirmation d'Anthropic selon laquelle les coûts des tâches peuvent diminuer jusqu'à 30 %. Les conclusions officielles décrivent principalement des charges de travail typiques et une faible intensité d'inférence ; Artificial Analysis mesure les performances lorsqu'Max est activé pour atteindre les limites de capacité.

Les deux ensembles de résultats montrent ensemble que la puissance d'inférence est devenue une composante intégrante des modèles. Sonnet 5.5 en mode Low ou Medium pourrait offrir un rapport qualité-prix extrêmement élevé ; si l'on augmente la puissance d'inférence jusqu'à Max pour rattraper Opus, bien qu'il soit plus économique par token, il pourrait perdre son avantage coûts en raison d'une production excessive.

Artificial Analysis a également constaté que la précision des connaissances factuelles de Sonnet 5.5 est d'environ 54 %, inférieure aux 66 % d'Opus ; les projets de raisonnement scientifique sont également en retard d'environ six points de pourcentage. L'idée selon laquelle Sonnet 5.5 est « proche d'Opus » repose principalement sur les opérations terminales d'Agent et certaines tâches de connaissance, et ne peut pas être étendue à toutes les capacités.

Dans les audits de code réels, l'avantage en vitesse est valide, et l'écart entre les modèles phares persiste.

CodeRabbit a effectué un ensemble de tests de jour de publication en utilisant des erreurs connues provenant de projets open source réels.

Sur les 13 cas d'audit de code difficiles, Sonnet 5.5 avec l'inférence a identifié 6 problèmes, contre 4 pour Sonnet 5 ; la précision des commentaires pertinents est respectivement de 41,2 % et 40,0 %. Toutefois, Opus 5.5 en mode standard a identifié 8 problèmes, et en mode Max, 10, ce qui montre que l'écart reste net dans les tâches d'audit complexes.

Dans un autre ensemble de tests impliquant 44 Pull Requests réels, Sonnet 5.5 a nécessité en moyenne 6 minutes et 33 secondes par revue, contre 13 minutes et 31 secondes pour Sonnet 5. Ce dernier génère 24 % de commentaires en moins et un tiers environ des remarques triviales de la génération précédente ; selon les prix publics, l'appel au modèle principal coûte en moyenne environ 0,46 $, contre 1,16 $ pour Sonnet 5.

Cependant, la note complète de couverture des erreurs pour ces 44 PR n'était pas encore terminée au moment de la publication de l'article, donc il n'est pour l'instant possible de confirmer qu'elle est plus rapide et produit moins de sortie, mais pas si les commentaires omis ont laissé passer davantage de problèmes réels. L'échantillon de 13 cas difficiles est également petit ; CodeRabbit lui-même a souligné qu'il suffit à observer la tendance, mais pas à déterminer un classement général.

Une répartition plus raisonnable des tâches serait : Sonnet 5.5 effectue une revue rapide et standard pour chaque PR ; les modifications impliquant la sécurité, l'architecture centrale ou des erreurs ayant un coût élevé sont escaladées vers Opus ou des experts humains.

La conception visuelle commence à devenir un argument de vente pour les modèles de travail universels

Anthropic a également souligné les capacités de conception visuelle de Sonnet 5.5. La démonstration officielle a demandé à Sonnet 5 et 5.5 de créer, dans un seul fichier HTML, un vol de 400 étourneaux, des dunes de sable façonnées par le vent et une horloge composée de 24 petites cloches. Le nouveau modèle génère plus rapidement, avec une animation, des niveaux et une finition d'interface supérieures.

Il peut également générer des présentations selon des modèles. Lors d’un test interne, Anthropic a fourni à deux experts les documents de résultats trimestriels d’une entreprise cotée, la transcriptions de l’appel téléphonique et un modèle de présentation de dix diapositives ; les deux experts ont jugé que la première version de Sonnet 5.5 pouvait être envoyée directement.

Ces exemples restent des cas d'affichage choisis par les fabricants et ne reflètent pas la capacité du modèle à comprendre de manière stable chaque modèle d'entreprise. La précision des données des graphiques complexes, les normes de marque et les sources citées doivent encore être vérifiées manuellement, mais ils illustrent une nouvelle direction de la concurrence des modèles : ne pas seulement générer du contenu correct, mais aussi fournir des interfaces et des documents proches du produit final.

L'amélioration des capacités de sécurité signifie également que certaines demandes seront prises en charge par l'ancien modèle.

Sonnet 5.5 est le premier modèle Sonnet à intégrer dès sa sortie une protection réseau de pointe. Anthropic indique que ses capacités de sécurité réseau approchent celles d'Opus 5, permettant ainsi la poursuite normale des correctifs de vulnérabilités ordinaires, tandis que les demandes de sécurité à plus haut risque sont transmises de manière transparente à Sonnet 5.

L'entreprise a également testé ces comportements dans environ 1 850 scénarios, notamment la désinformation des utilisateurs, la violation de leurs intérêts, l'assistance à des abus à haut risque et la contournement des limites environnementales. Selon l'entreprise, le nouveau modèle est au moins aussi bon que Sonnet 5 sur la plupart des indicateurs, et c'est le modèle Claude le moins enclin à tester activement les limites du conteneur.

Cependant, ces évaluations sont principalement des tests automatisés internes à Anthropic et ne constituent pas une preuve complète des risques dans des environnements réels. L'entreprise reconnaît elle-même qu'aucun ensemble de tests ne peut détecter tous les modes d'échec.

Sonnet 5.5 est le premier Sonnet à intégrer un classificateur anti-distillation et à élargir le mécanisme de « conservation du contenu de réflexion » pour empêcher le transfert du contexte d'inférence entre comptes. Son impact sur les développeurs ordinaires est limité, mais certains flux de travail impliquant la migration de conversations Claude Code entre comptes nécessitent des ajustements.

Le véritable changement n'est pas d'être en tête du classement, mais que le « modèle suffisamment puissant » devienne le choix par défaut

Sonnet 5.5 n'a pas dévoilé de nouvelle architecture de modèle, ni surpassé globalement Opus. Son importance réside surtout dans le fait qu'il déplace une grande partie des tâches précédemment réservées aux modèles phares vers des modèles de milieu de gamme, plus rapides et dont le prix par token est divisé par deux.

Pour les systèmes de service client, de revue de code, d’enquête documentaire et de production de documents qui s’exécutent des milliers de fois par jour, la décision de déploiement ne repose généralement pas sur le meilleur score individuel, mais sur le nombre d’étapes nécessaires pour chaque tâche, le nombre de tokens, le temps d’attente, et la possibilité de remonter les erreurs. La valeur de Sonnet 5.5 se concentre précisément sur ces indicateurs.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.