Mensaje de ChainThink, 1 de agosto: la empresa de infraestructura de AI Agent Composio amplió su prueba, conectando el mismo Kimi K3 a 6 marcos de Agent y completando 26 tareas idénticas.
El objeto de comparación es el marco de ejecución; todos los modelos subyacentes son Kimi K3. Los resultados de las pruebas muestran que Kimi Code completó 21 tareas, ocupando el primer lugar; Hermes completó 20.
Pi Agent y Claude Code completaron 19 tareas cada uno; OpenCode completó 18; Codex completó 17.
Según el precio oficial de Kimi K3, Hermes y Pi Agent tienen el costo promedio más bajo por tarea, respectivamente de $0.39 y $0.40;
Claude Code cuesta 1.47 dólares, aproximadamente 3.8 veces el costo de Hermes. En cuanto a la velocidad, el tiempo mediano por tarea individual de Pi Agent es de 161.7 segundos, mientras que Claude Code es de 347.6 segundos.
Las pruebas muestran que, al cambiar el marco bajo el mismo modelo, el número de tareas exitosas varía como máximo en 4, el costo promedio difiere en casi 4 veces y el tiempo consumido aumenta más del doble.
