ChainThink 消息,8 月 1 日,AI Agent 基礎設施公司 Composio 擴大測試,將同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 項相同任務。
本次比較對象為運行框架,底層模型均為 Kimi K3。測試結果顯示,Kimi Code 完成 21 項任務,排名第 1 名;Hermes 完成 20 項;
Pi Agent 和 Claude Code 均完成 19 項;OpenCode 完成 18 項;Codex 完成 17 項。
根據 Kimi K3 官方價格估算,Hermes 和 Pi Agent 每項任務的平均成本最低,分別為 0.39 美元和 0.40 美元;
Claude Code 價為 1.47 美元,約為 Hermes 的 3.8 倍。在速度方面,Pi Agent 單項任務的中位耗時為 161.7 秒,Claude Code 為 347.6 秒。
測試顯示,在同一模型下更換框架,成功任務數最多相差 4 項,平均成本相差近 4 倍,耗時相差超過 2 倍。
