Claude Code 代幣使用量在代理框架測試中高達其他模型的 30 倍

icon MarsBit
分享
AI summary icon精華摘要
新代幣上線方面,Composio 團隊最近進行了一項基準測試,比較了三種代理框架——Claude Code、Hermes 和 Kimi Code——在 28 個相同任務中使用 Kimi K3 模型的代幣使用情況。代幣發行新聞指出,Claude Code 使用的代幣數量最多達到其他框架的 30 倍,中位數為 340,000 個代幣,而 Kimi Code 僅為 61,000 個代幣。Claude Code 的成本高達每項任務 $2,而 Kimi Code 僅為 $0.22。該測試表明,代理設計對代幣效率和成本有顯著影響。

大家都說 Claude Code 浪費 Token,究竟有多費?這回終於有人算出數來了。

最近有個挺有意思的對比實驗,來自 Composio 團隊。他們用同一個模型 Kimi K3,分別放進三個不同的 agent 框架(harness)裡跑 ——Claude Code、Hermes 和 Kimi Code—— 總共測試了 28 個完全相同的任務。

Model Orchestration

結果,三個 harness 完成任務的成功率差不多: Kimi Code 在 28 個中成功 22 個,Hermes 為 21 個,Claude Code 為 20 個。差距不算大。

真正拉開差距的,是 token 消耗。同樣一個任務,用不同 harness 跑下來,token 用量最多能差到 30 倍!

從中位數來看, Kimi Code 大約用 6.1 萬 token,Hermes 大概 6.7 萬,而 Claude Code 直接飆到 34 萬,差不多是 Kimi 6 倍的 Code。

Model Orchestration

按 Kimi K3 的價格為每百萬個輸入 token 3 美元(agent 工作流程中輸入 token 通常佔約 95%),每個任務的平均成本約為: Kimi Code 為 0.22 美元,Hermes 為 0.28 美元,Claude Code 則高達 2 美元。差距十分明顯。

在速度方面也有所不同,中位數耗時方面,Hermes 最快,為 179 秒; Kimi Code 297 秒;Claude Code 348 秒。

所以最快的是 Hermes,最省 token 的是 Kimi Code,兩者並不重合。

Composio 團隊由此得出一個直接的結論:如果你想降低 agent 的成本,先看看用的是哪個 harness,而不是急著換模型。他們的數據顯示,harness 本身就能將成本拉開 9 倍,而模型的能力表現其實差不多。

Model Orchestration

Sebastian Raschka 在看到這個結果後也發帖表示,這與他之前使用 Qwen3.6 所觀察到的情況類似:Claude Code 在成功率相近的情況下,token 使用量往往是其他許多 harness 的 2 到 3 倍。

Model Orchestration

他提出了幾個可能的原因:是沒有怎麼優化?有 bug?還是故意設計成這樣(因為在更困難的任務上可能有幫助)?他表示需要再花時間仔細查一下。

接著他補充了上個月撰寫本地 coding agent 文章時的觀察。當時他分析過為什麼 Claude Code 使用更多 token,發現差異主要出現在輸入 token,而非輸出 token。也就是說,Claude 並沒有多寫一倍的內容。日誌顯示,Claude 的 harness 在多輪互動中會反覆將更多上下文塞回模型,包括之前的消息、工具調用、命令輸出和檔案內容。舉個例子,某次 Claude 跑完大約用了 57.8 萬輸入 token,但輸出只有大約 4500 token,跨了 25 輪。因此更可能的解釋是,Claude 的 harness 在多步 agent 運行時,會累積或計入更大的 prompt 端歷史。

Model Orchestration

These test results appear to reveal a trend that cannot be ignored: the importance of harness is now on par with the model itself.

最近的一篇論文(來自專注於企業級 AI Agent 平台的 Writer 公司)系統性地揭示了這一點:它透過控制變量實驗證明,更換 harness 層比更換模型更能降低成本,且所有模型均受益。

Model Orchestration

具體來說,他們進行了一項嚴格的「控制變量」實驗:在 22 個企業任務和 6 個基礎模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)保持不變的前提下,僅替換編排層——將傳統的生產級智能體循環替換為 Writer 自家的 Harness。

實驗結果顯示:每項任務的平均成本降低 41%(0.21 美元→0.12 美元),中位延遲縮短 44%(48 秒→27 秒),Token 消耗量減少 38%(14.2k→8.8k),而任務完成質量基本持平(0.78→0.81,因樣本量較小可視為無顯著差異)。在性價比方面,每美元成本所能獲得的質量提升高達 82%,同時每百萬 Token 能完成的任務數從 54.9 跃升至 92.0。

所以,在模型變成「水電煤」之後,harness 才是那個決定你電費帳單的空調?換句話說:以前有人說「模型即產品」,現在是「harness 即產品」?

Model Orchestration

Since harness is so important, shouldn't the subsequent accounting be more detailed?

有人指出,我們有必要在現有的 benchmark 中加入「harness 稅」這一項。尤其是考慮到一旦工具調用和重試進入 loop,這筆稅不是線性增長。

Model Orchestration

換句話說,未來的 agent 競賽,上半場比的是「能不能做」,下半場比的將是「做同樣的事,誰更省」—— 而省錢的秘密,不在模型,在 harness。

Model Orchestration

在運行 Agent 的過程中,你有沒有類似的體驗?歡迎在評論區討論。

本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:機器之心

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露