ChainThink, le 30 juillet, l'infrastructure d'agents AI Composio a connecté la même version de Kimi K3 à Kimi Code, Hermes et Claude Code pour exécuter 28 tâches identiques.
Les nombres d'achèvements des trois cadres d'exploitation sont respectivement de 22, 21 et 20, avec une petite différence, mais des écarts marqués en termes de consommation de jetons et de coûts.
Les tests montrent que les médianes de tokens pour les tâches individuelles de Kimi Code, Hermes et Claude Code sont respectivement de 61 000, 67 000 et 340 000 ;
Composio estime que le coût moyen par tâche est d'environ 0,22 $, 0,28 $ et 2 $. La consommation de tokens par tâche individuelle peut varier jusqu'à 30 fois.
En termes de vitesse, le temps médian pour une tâche unique est de 179 secondes pour Hermes, 297 secondes pour Kimi Code et 348 secondes pour Claude Code.
Une autre étude de Writer a également montré qu'en remplaçant uniquement le cadre d'exécution sur 22 tâches d'entreprise et 6 modèles, la consommation de tokens a diminué de 38 %, le coût par tâche de 41 %, et le temps écoulé de 44 %, tandis que la qualité de la production restait globalement stable.
