大家都說 Claude Code 浪費 Token,究竟有多費?這回終於有人算出數來了。
最近有個挺有意思的對比實驗,來自 Composio 團隊。他們用同一個模型 Kimi K3,分別放進三個不同的 agent 框架(harness)裡跑 ——Claude Code、Hermes 和 Kimi Code—— 總共測試了 28 個完全相同的任務。

結果,三個 harness 完成任務的成功率差不多: Kimi Code 在 28 個中成功 22 個,Hermes 為 21 個,Claude Code 為 20 個。差距不算大。
真正拉開差距的,是 token 消耗。同樣一個任務,用不同 harness 跑下來,token 用量最多能差到 30 倍!
從中位數來看, Kimi Code 大約用 6.1 萬 token,Hermes 大概 6.7 萬,而 Claude Code 直接飆到 34 萬,差不多是 Kimi 6 倍的 Code。

按 Kimi K3 的價格為每百萬個輸入 token 3 美元(agent 工作流程中輸入 token 通常佔約 95%),每個任務的平均成本約為: Kimi Code 為 0.22 美元,Hermes 為 0.28 美元,Claude Code 則高達 2 美元。差距十分明顯。
在速度方面也有所不同,中位數耗時方面,Hermes 最快,為 179 秒; Kimi Code 297 秒;Claude Code 348 秒。
所以最快的是 Hermes,最省 token 的是 Kimi Code,兩者並不重合。
Composio 團隊由此得出一個直接的結論:如果你想降低 agent 的成本,先看看用的是哪個 harness,而不是急著換模型。他們的數據顯示,harness 本身就能將成本拉開 9 倍,而模型的能力表現其實差不多。

Sebastian Raschka 在看到這個結果後也發帖表示,這與他之前使用 Qwen3.6 所觀察到的情況類似:Claude Code 在成功率相近的情況下,token 使用量往往是其他許多 harness 的 2 到 3 倍。

他提出了幾個可能的原因:是沒有怎麼優化?有 bug?還是故意設計成這樣(因為在更困難的任務上可能有幫助)?他表示需要再花時間仔細查一下。
接著他補充了上個月撰寫本地 coding agent 文章時的觀察。當時他分析過為什麼 Claude Code 使用更多 token,發現差異主要出現在輸入 token,而非輸出 token。也就是說,Claude 並沒有多寫一倍的內容。日誌顯示,Claude 的 harness 在多輪互動中會反覆將更多上下文塞回模型,包括之前的消息、工具調用、命令輸出和檔案內容。舉個例子,某次 Claude 跑完大約用了 57.8 萬輸入 token,但輸出只有大約 4500 token,跨了 25 輪。因此更可能的解釋是,Claude 的 harness 在多步 agent 運行時,會累積或計入更大的 prompt 端歷史。

These test results appear to reveal a trend that cannot be ignored: the importance of harness is now on par with the model itself.
最近的一篇論文(來自專注於企業級 AI Agent 平台的 Writer 公司)系統性地揭示了這一點:它透過控制變量實驗證明,更換 harness 層比更換模型更能降低成本,且所有模型均受益。

具體來說,他們進行了一項嚴格的「控制變量」實驗:在 22 個企業任務和 6 個基礎模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)保持不變的前提下,僅替換編排層——將傳統的生產級智能體循環替換為 Writer 自家的 Harness。
實驗結果顯示:每項任務的平均成本降低 41%(0.21 美元→0.12 美元),中位延遲縮短 44%(48 秒→27 秒),Token 消耗量減少 38%(14.2k→8.8k),而任務完成質量基本持平(0.78→0.81,因樣本量較小可視為無顯著差異)。在性價比方面,每美元成本所能獲得的質量提升高達 82%,同時每百萬 Token 能完成的任務數從 54.9 跃升至 92.0。
所以,在模型變成「水電煤」之後,harness 才是那個決定你電費帳單的空調?換句話說:以前有人說「模型即產品」,現在是「harness 即產品」?

Since harness is so important, shouldn't the subsequent accounting be more detailed?
有人指出,我們有必要在現有的 benchmark 中加入「harness 稅」這一項。尤其是考慮到一旦工具調用和重試進入 loop,這筆稅不是線性增長。

換句話說,未來的 agent 競賽,上半場比的是「能不能做」,下半場比的將是「做同樣的事,誰更省」—— 而省錢的秘密,不在模型,在 harness。

在運行 Agent 的過程中,你有沒有類似的體驗?歡迎在評論區討論。
本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:機器之心
