ChainThinkのメッセージによると、7月30日、AI Agentインフラ企業Composioは、Kimi K3をKimi Code、Hermes、Claude Codeにそれぞれ接続し、28の同じタスクを実行しました。
3つの運用フレームワークの完了数はそれぞれ22件、21件、20件で、差は小さいですが、トークン使用量とコストの差は明確です。
テスト結果によると、Kimi Code、Hermes、Claude Code の単一タスクにおけるトークン中央値はそれぞれ6.1万、6.7万、34万です。
Composioは、各タスクの平均コストをそれぞれ0.22ドル、0.28ドル、および2ドルと推定しています。個々のタスクにおけるトークン使用量の差は最大で30倍です。
速度面では、Hermesの単一タスクの中央値所要時間は179秒、Kimi Codeは297秒、Claude Codeは348秒です。
Writerの別の研究では、22の企業タスクと6つのモデルで実行フレームワークを置き換えた結果、トークン使用量が38%減少し、単一タスクのコストが41%低下し、所要時間が44%短縮され、完了品質はほぼ同等でした。
