ChainThink, 1er août : l'infrastructure d'agents IA Composio élargit son test en connectant le même Kimi K3 à six cadres d'agents pour accomplir 26 tâches identiques.
La comparaison porte sur le cadre d'exécution, les modèles sous-jacents étant tous des Kimi K3. Les résultats des tests montrent que Kimi Code a accompli 21 tâches, se classant premier ; Hermes en a accompli 20 ;
Pi Agent et Claude Code ont chacun accompli 19 tâches ; OpenCode en a accompli 18 ; Codex en a accompli 17.
Selon les prix officiels de Kimi K3, Hermes et Pi Agent ont le coût moyen par tâche le plus bas, à respectivement 0,39 $ et 0,40 $ ;
Claude Code coûte 1,47 dollar, soit environ 3,8 fois le prix d'Hermes. En termes de vitesse, le temps médian pour accomplir une tâche unique est de 161,7 secondes pour Pi Agent et de 347,6 secondes pour Claude Code.
Les tests montrent que, sous le même modèle, le changement de cadre entraîne une différence maximale de 4 tâches réussies, un coût moyen près de quatre fois plus élevé et un temps d'exécution plus de deux fois plus long.
