ChainThink 消息,7 月 30 日,AI Agent 基礎設施公司 Composio 將同一款 Kimi K3 分別接入 Kimi Code、Hermes 和 Claude Code,執行 28 項相同任務。
三套運行框架的完成數分別為 22 項、21 項和 20 項,差距較小,但 Token 用量和成本差異明顯。
測試顯示,Kimi Code、Hermes、Claude Code 的單項任務 Token 中位數分別為 6.1 萬、6.7 萬和 34 萬;
Composio 評估,每項任務的平均成本約為 0.22 美元、0.28 美元和 2 美元。個別任務的 Token 使用量最多相差 30 倍。
在速度方面,Hermes 的單項任務中位耗時為 179 秒,Kimi Code 為 297 秒,Claude Code 為 348 秒。
Writer 的另一項研究也顯示,在 22 項企業任務和 6 款模型上僅替換運行框架後,Token 用量下降 38%,單項成本下降 41%,耗時下降 44%,完成質量基本持平。
