Utilisation des jetons Claude Code jusqu'à 30 fois supérieure à celle des autres dans le test du cadre d'agent

icon MarsBit
Partager
AI summary iconRésumé
Les nouveaux listings de jetons ont récemment fait l'objet d'un test de référence réalisé par l'équipe Composio, qui a comparé l'utilisation des jetons sur trois frameworks d'agents — Claude Code, Hermes et Kimi Code — en utilisant le modèle Kimi K3 sur 28 tâches identiques. Les annonces de lancement des jetons soulignent que Claude Code a utilisé jusqu'à 30 fois plus de jetons que les autres, avec une médiane de 340 000 jetons contre 61 000 pour Kimi Code. Les coûts ont atteint 2 $ par tâche pour Claude Code, contre 0,22 $ pour Kimi Code. Ce test démontre que la conception des agents influence fortement l'efficacité et le coût en jetons.

Tout le monde dit que Claude Code gaspille des jetons, mais combien en consomme-t-il exactement ? Enfin, quelqu'un a calculé le chiffre exact.

Récemment, une expérience comparative intéressante a été menée par l'équipe de Composio. Ils ont utilisé le même modèle Kimi K3, exécuté séparément dans trois frameworks d'agent différents (harness) —— Claude Code, Hermes et Kimi Code —— Au total, 28 tâches identiques ont été testées.

Orchestration de modèles

En conséquence, les trois harness ont des taux de réussite similaires pour accomplir la tâche : Kimi Code a réussi 22 sur 28, Hermes 21 et Claude Code 20. L'écart n'est pas important.

Ce qui fait vraiment la différence, c'est la consommation de tokens. Pour une même tâche, l'utilisation de tokens peut varier jusqu'à 30 fois selon le harness utilisé !

En médiane, Kimi Le code utilise environ 61 000 tokens, Hermes environ 67 000, tandis que Claude Code atteint directement 340 000, soit environ Kimi Six fois le code.

Orchestration de modèles

Appuyez sur Kimi Le coût est calculé à 3 dollars par million de tokens d'entrée (les tokens d'entrée représentent généralement environ 95 % dans les flux de travail des agents), le coût moyen par tâche est d'environ : Kimi Code à 0,22 $, Hermes à 0,28 $, Claude Code à 2 $. L'écart est évident.

Les vitesses sont également différentes. En termes de temps médian, Hermes est le plus rapide, à 179 secondes ; Kimi 297 secondes ; Claude Code 348 secondes.

Ainsi, le plus rapide est Hermes, le plus économe en tokens est Kimi Code, les deux ne se chevauchent pas.

L'équipe de Composio en déduit une conclusion directe : si vous souhaitez réduire les coûts des agents, examinez d'abord quel harness vous utilisez, plutôt que de vous précipiter pour changer de modèle. Selon leurs données, le harness seul peut faire varier les coûts jusqu'à 9 fois, tandis que les performances des modèles sont en réalité similaires.

Orchestration de modèles

Sebastian Raschka a également posté après avoir vu ce résultat, disant que cela correspond à ses observations précédentes avec Qwen3.6 : Claude Code utilise souvent deux à trois fois plus de tokens que beaucoup d'autres harness, tout en ayant un taux de réussite similaire.

Orchestration de modèles

Il a évoqué plusieurs causes possibles : est-ce dû à une faible optimisation ? À un bogue ? Ou est-ce délibérément conçu ainsi (car cela pourrait aider sur des tâches plus complexes) ? Il a indiqué qu’il devait consacrer davantage de temps à une analyse approfondie.

Il a ensuite ajouté les observations qu'il avait faites en écrivant son article sur les agents de codage locaux le mois dernier. À l'époque, il avait analysé pourquoi Claude Code utilisait plus de jetons et avait constaté que la différence provenait principalement des jetons d'entrée, et non des jetons de sortie. Autrement dit, Claude n'écrivait pas deux fois plus de contenu. Les journaux indiquent que le harnais de Claude réintroduit répétitivement davantage de contexte dans le modèle au cours d'interactions multiples, y compris les messages précédents, les appels d'outils, les sorties de commandes et le contenu des fichiers. Par exemple, lors d'une exécution, Claude a utilisé environ 578 000 jetons d'entrée, mais seulement environ 4 500 jetons de sortie, répartis sur 25 cycles. La meilleure explication est donc que le harnais de Claude accumule ou inclut un historique de prompt plus vaste lors de l'exécution en plusieurs étapes d'un agent.

Orchestration de modèles

These test results appear to reveal a trend that cannot be ignored: the importance of harness is now on par with the model itself.

Un article récent (de Writer, une entreprise qui développe une plateforme d'agents IA pour les entreprises) révèle systématiquement cela : il démontre par des expériences à variables contrôlées qu'changer la couche de harness coûte moins cher que de changer le modèle, et que tous les modèles en bénéficient.

Orchestration de modèles

Plus précisément, ils ont mené une expérience rigoureuse « à variables contrôlées » : en gardant fixes 22 tâches d'entreprise et 6 modèles de base (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), ils n'ont remplacé que la couche d'orchestration — en substituant le cycle d'agent de production traditionnel par le Harness propre à Writer.

Les résultats de l'expérience montrent une réduction moyenne de 41 % du coût par tâche (de 0,21 $ à 0,12 $), une diminution de 44 % du délai médian (de 48 secondes à 27 secondes), et une réduction de 38 % de la consommation de tokens (de 14,2k à 8,8k), tandis que la qualité de réalisation des tâches reste globalement stable (0,78 à 0,81, considérée comme sans différence significative en raison de la taille échantillonnale réduite). En termes de rapport qualité-prix, la qualité obtenue par dollar dépense augmente de 82 %, et le nombre de tâches accomplies par million de tokens passe de 54,9 à 92,0.

Donc, après que le modèle est devenu « eau, électricité, gaz », le harness est-il l’air conditionné qui détermine votre facture d’électricité ? Autrement dit : auparavant, on disait « le modèle est le produit », maintenant c’est « le harness est le produit » ?

Orchestration de modèles

Since harness is so important, shouldn't the subsequent accounting be more detailed?

Quelqu'un a souligné qu'il était nécessaire d'ajouter la « taxe harness » aux benchmarks existants. Cela est particulièrement pertinent compte tenu du fait que, dès lors que les appels d'outils et les réessais entrent en boucle, cette taxe ne croît pas de manière linéaire.

Orchestration de modèles

Autrement dit, dans les futures compétitions d’agents, la première mi-temps se jouera sur la capacité à le faire, et la seconde mi-temps sur qui le fera le plus économiquement — et le secret de l’économie ne réside pas dans le modèle, mais dans le harness.

Orchestration de modèles

Avez-vous eu une expérience similaire lors de l'exécution de l'Agent ? N'hésitez pas à en discuter dans les commentaires.

Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.