ChainThink mensagem, 1º de agosto, a empresa de infraestrutura de AI Agent Composio ampliou seu teste, integrando o mesmo Kimi K3 a seis quadros de Agent e concluindo 26 tarefas idênticas.
O objeto de comparação neste teste é o framework de execução, com todos os modelos subjacentes sendo Kimi K3. Os resultados mostram que o Kimi Code concluiu 21 tarefas, ocupando o primeiro lugar; o Hermes concluiu 20 tarefas;
Pi Agent e Claude Code completaram 19 tarefas cada; OpenCode completou 18; Codex completou 17.
Segundo a estimativa de preço oficial do Kimi K3, Hermes e Pi Agent têm o menor custo médio por tarefa, respectivamente de US$ 0,39 e US$ 0,40;
Claude Code custa US$ 1,47, cerca de 3,8 vezes o valor do Hermes. Em termos de velocidade, o Pi Agent tem uma mediana de tempo de 161,7 segundos por tarefa individual, enquanto o Claude Code tem 347,6 segundos.
Os testes mostraram que, ao trocar o framework sob o mesmo modelo, o número de tarefas bem-sucedidas variou em até 4 itens, o custo médio variou em quase quatro vezes e o tempo gasto variou em mais de duas vezes.
