Anthropic a lancé Claude Opus 5.5 le 22 septembre, le premier modèle de la série Claude 5.5. Le principal atout présenté par l'entreprise est direct : il atteint le niveau de Claude Fable 5.1 pour la plupart des tâches, tout en réduisant les coûts d'exécution de 40 % par rapport à la génération précédente Opus 5. Mais ce qui rend ce lancement vraiment intéressant, ce n'est pas seulement le prix ou les classements, mais le fait qu'Anthropic ait déplacé davantage l'accent des tests vers les tâches de longue durée, les opérations irréversibles et la protection contre les injections de prompts.
L'entreprise affirme qu'Opus 5.5 offre une amélioration significative dans les tâches complexes de codage, de recherche et de travail spécialisé. Parmi les premiers testeurs, une équipe a réussi à migrer environ 680 000 lignes de code en moins d'une journée ; Anthropic souligne également que le modèle maintient un contexte plus long et une continuité de planification. Les cas présentés illustrent la limite des capacités, mais ne doivent pas être considérés comme des délais moyens de livraison pour tous les projets. La structure de la base de code, la couverture des tests et l'analyse humaine influencent les résultats.
Réduire les coûts ne signifie pas une « version bon marché du haut de gamme », mais plutôt redéfinir les limites d'utilisation des modèles.
Par le passé, Opus était généralement réservé aux tâches les plus complexes et les plus coûteuses, tandis que les tâches quotidiennes étaient confiées à des modèles plus rapides. Si Opus 5.5 parvient réellement à approcher les performances de Fable 5.1 à un coût inférieur, les entreprises pourraient utiliser le modèle phare pour un volume bien plus important d'analyses de code, d'analyse de documents et de processus de recherche, et non plus uniquement pour quelques demandes à forte valeur ajoutée.
La réduction de 40 % des coûts est une déclaration officielle d'Anthropic par rapport à Opus 5 et ne signifie pas que la facture de chaque entreprise diminuera de 40 %. Les frais réels dépendent de la longueur des entrées et sorties, du cache, du nombre d'appels d'outils et de la nécessité de réessayer la tâche. Des modèles plus puissants peuvent également consommer davantage de tokens totaux en raison de tâches plus longes qui leur sont attribuées. Les acheteurs doivent tester le « coût total pour accomplir une tâche » avec leur propre charge de travail, plutôt que de comparer uniquement les prix unitaires.
La capacité à accomplir des tâches longues doit également être évaluée selon la qualité des résultats. Une grande migration de code peut générer de nombreux changements apparemment raisonnables, mais le véritable coût inclut les tests de régression, les conflits de dépendances, le déploiement et le rollback. Si le modèle oblige les ingénieurs à passer plusieurs jours à corriger des problèmes marginaux, l'avantage en vitesse s'érode. L'évaluation la plus précieuse doit enregistrer à la fois le taux de réussite, le nombre d'interventions humaines et les erreurs irréversibles, et non seulement la quantité de code générée.
Anthropic affirme qu'Opus 5.5 a été soumis à des tests pré-publication par des évaluateurs externes tels que Frontier Design et METR. La participation externe augmente la crédibilité, mais ne signifie pas que tous les rapports, les données brutes et les environnements de test ont été entièrement rendus publics. Les utilisateurs doivent toujours distinguer les résultats déclarés par l'entreprise, les résultats d'évaluations indépendantes et les résultats de reproduction dans leur propre environnement.
Les tests de sécurité commencent à se concentrer sur les scénarios d'accidents réels, et non seulement sur le taux de refus aux questions courtes.
Anthropic indique qu'Opus 5.5 a obtenu le meilleur résultat de l'entreprise lors de ses audits automatisés de comportement. Les tests couvrent des milliers de scénarios simulés, en mettant l'accent sur la capacité du modèle à éviter des actions irréversibles, à ne pas franchir les limites définies par l'utilisateur, et à rester fidèle à la tâche originale face à des injections de prompts. L'entreprise a également intégré à l'évaluation des tâches impossibles, des tâches de durée plus longue et des scénarios basés sur des incidents réels.
C’est une leçon indispensable à apprendre après le déploiement en production des IA agents. Les tests de sécurité traditionnels se concentrent souvent sur la question de savoir si le modèle répondra à certains types de questions sensibles, mais les agents capables de naviguer sur le web, d’exécuter des commandes en terminal et de modifier des fichiers présentent des risques bien plus liés à leurs chaînes d’actions : ils peuvent continuer à exécuter des tâches sur la base de prémisses erronées, ou interpréter du texte malveillant présent sur une page web comme des instructions. Un simple clic erroné ou une élévation de privilèges est bien plus difficile à réparer qu’une réponse inappropriée.
« Moins de débordements » ne signifie toujours pas « pas de débordements ». Anthropic reconnaît explicitement les limites du modèle. Lors du déploiement en entreprise, il reste nécessaire d’appliquer le principe du moindre privilège, de requérir une confirmation des opérations, de maintenir des journaux traçables, ainsi que des mécanismes de sandbox et de rollback. En particulier, pour les modifications de bases de données de production, de paiements et d’infrastructure, l’approbation humaine ne doit pas être supprimée simplement parce que le score de sécurité du modèle a augmenté.
Il s'agit du premier modèle publié par Anthropic après avoir proposé de « ralentir le rythme des avancées ». L'entreprise cherche à transmettre le message qu'elle continue d'améliorer ses capacités, tout en intégrant des évaluations externes et des tests de sécurité plus proches des scénarios réels dans son processus de publication. Toutefois, la véracité de cet engagement dépendra de la diffusion continue de cas d'échec, de méthodes de test et d'effets de correction, et non du seul score maximal atteint lors d'une seule publication.
Pour les utilisateurs, ce qui rend Opus 5.5 le plus intéressant à tester, ce n’est pas la qualité esthétique de ses réponses, mais sa capacité à rester sous contrôle lors de tâches complexes s’étalant sur plusieurs heures, impliquant plusieurs outils et étapes, et à s’arrêter en cas d’informations insuffisantes. La concurrence sur le marché des modèles passe de « qui répond le plus intelligemment » à « qui peut accomplir des tâches complexes à un coût maîtrisé ». La baisse des prix permet à davantage de personnes d’essayer ces modèles, mais la sécurité et la discipline ingénierie déterminent si ces essais pourront véritablement entrer en production.
Pendant la période d'essai, les entreprises peuvent établir un ensemble simple mais rigoureux de comparaisons : utiliser les mêmes tâches réelles pour comparer Opus 5, Opus 5.5 et les modèles à moindre coût, en enregistrant le temps de réalisation, les coûts totaux, le taux de réussite aux tests, la quantité de modifications humaines et le nombre d'actions à risque élevé. Seule une amélioration simultanée de ces indicateurs rend la mise à niveau commercialement significative. Les démonstrations à la date de publication sont adaptées pour découvrir les possibilités, tandis que des évaluations internes continues sur plusieurs semaines sont nécessaires pour décider des autorisations et du budget.
