ChainThinkのメッセージによると、8月1日、AI Agentインフラ企業Composioがテストを拡大し、同一のKimi K3を6つのAgentフレームワークに接続し、26の同じタスクを完了しました。
今回の比較対象は実行フレームワークであり、底層モデルはすべてKimi K3です。テスト結果によると、Kimi Codeは21のタスクを完了し、1位となりました。Hermesは20のタスクを完了しました。
Pi Agent と Claude Code はそれぞれ19項目を完了;OpenCode は18項目を完了;Codex は17項目を完了。
Kimi K3の公式価格に基づくと、HermesとPi Agentの1タスクあたりの平均コストが最も低く、それぞれ0.39ドルと0.40ドルです;
Claude Codeは1.47ドルで、Hermesの約3.8倍です。速度面では、Pi Agentの単一タスクの中央値所要時間は161.7秒、Claude Codeは347.6秒です。
テスト結果によると、同じモデルでフレームワークを変更した場合、成功したタスク数は最大で4件の差があり、平均コストは約4倍、所要時間は2倍以上異なりました。
