Semua orang berkata bahawa Claude Code membuang-buang token, seberapa banyaknya? Akhirnya ada orang yang mengira nombornya.
Baru-baru ini, terdapat eksperimen perbandingan yang menarik daripada pasukan Composio. Mereka menggunakan model yang sama Kimi K3, dijalankan secara berasingan dalam tiga kerangka agen yang berbeza —— Claude Code, Hermes dan Kimi Kod—— Telah menguji 28 tugas yang sama persis.

Hasilnya, tiga harness berjaya menyelesaikan tugas dengan kadar yang hampir sama: Kimi Kod berjaya 22 daripada 28, Hermes 21, dan Claude Code 20. Perbezaannya tidak besar.
Yang benar-benar menciptakan perbezaan ialah penggunaan token. Untuk tugas yang sama, penggunaan token boleh berbeza sehingga 30 kali ganda bergantung pada harness yang digunakan!
Dari median, Kimi Kod menggunakan sekitar 61,000 token, Hermes sekitar 67,000, manakala Claude Code terus melonjak kepada 340,000, hampir Kimi 6 kali ganda kod.

Klik Kimi Harga K3 dihitung pada kadar 3 dolar AS setiap juta token input (token input dalam alur kerja agen biasanya mengambil kira-kira 95%), kos purata setiap tugas ialah: Kimi Kod 0.22 dolar, Hermes 0.28 dolar, sedangkan Claude Code mencapai 2 dolar. Perbezaannya jelas.
Dari segi kelajuan, ia juga berbeza. Masa median terpendek ialah Hermes, 179 saat; Kimi Kod 297 saat; Kod Claude 348 saat.
Jadi yang paling pantas ialah Hermes, yang paling menjimatkan token ialah Kimi Kod, keduanya tidak bertindih.
Pasukan Composio menyimpulkan secara langsung: jika anda ingin mengurangkan kos agen, lihat terlebih dahulu harness yang digunakan, bukan segera menukar model. Data mereka menunjukkan bahawa harness itu sendiri boleh membezakan kos sebanyak 9 kali ganda, manakala prestasi model sebenarnya hampir sama.

Sebastian Raschka juga memposting setelah melihat hasil ini, mengatakan bahawa ia serupa dengan pemerhatian sebelumnya beliau terhadap Qwen3.6: Claude Code sering menggunakan token 2 hingga 3 kali ganda berbanding banyak harness lain, dengan kadar kejayaan yang serupa.

Dia mengemukakan beberapa kemungkinan sebab: adakah ia kurang dioptimumkan? Adakah terdapat ralat? Atau sengaja direka begitu (kerana mungkin membantu dalam tugas yang lebih sukar)? Dia menyatakan perlu meluangkan masa untuk menyemaknya dengan teliti.
Selepas itu, beliau menambahkan pemerhatian semasa menulis artikel tentang agen coding tempatan bulan lalu. Semasa itu, beliau menganalisis mengapa Claude Code menggunakan lebih banyak token, dan mendapati perbezaan utama berlaku pada token input, bukan token output. Dengan kata lain, Claude tidak menghasilkan kandungan sebanyak dua kali ganda. Log menunjukkan bahawa harness Claude akan mengulang kali memasukkan lebih banyak konteks semula ke dalam model semasa interaksi berbilang langkah, termasuk mesej sebelumnya, panggilan alat, output arahan, dan kandungan fail. Sebagai contoh, dalam satu sesi, Claude menggunakan kira-kira 578,000 token input, tetapi hanya menghasilkan kira-kira 4,500 token output, melalui 25 langkah. Oleh itu, penjelasan yang lebih mungkin ialah harness Claude akan mengumpul atau memasukkan sejarah prompt yang lebih besar semasa pelaksanaan agen berbilang langkah.

Keputusan ujian ini kelihatannya mengungkap satu trend yang tidak boleh diabaikan: kepentingan harness sudah setara dengan model itu sendiri.
Kertas kerja terkini (daripada Writer, sebuah syarikat yang membina platform AI Agent perniagaan) secara sistematis mengungkapkan ini: ia membuktikan melalui eksperimen pemboleh ubah kawalan bahawa menukar lapisan harness lebih berkesan dalam mengurangkan kos berbanding menukar model, dan semua model mendapat keuntungan.

Secara khusus, mereka menjalankan eksperimen "kawal pemboleh ubah" yang ketat: dengan 22 tugas perniagaan dan 6 model asas (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) tetap, mereka hanya menggantikan lapisan pengaturan—menggantikan kitar agen pengeluaran tradisional dengan Harness buatan Writer sendiri.
Keputusan eksperimen menunjukkan: kos purata setiap tugas berkurang 41% (USD 0.21 → USD 0.12), median latensi dipersingkat 44% (48 saat → 27 saat), penggunaan Token berkurang 38% (14.2k → 8.8k), sementara kualiti penyelesaian tugas kekal hampir sama (0.78 → 0.81, dianggap tiada perbezaan signifikan kerana saiz sampel kecil). Dari segi nilai, peningkatan kualiti per dolar meningkat sebanyak 82%, sementara bilangan tugas yang dapat diselesaikan per juta Token meningkat dari 54.9 kepada 92.0.
Jadi, selepas model menjadi “air, listrik, dan gas”, harness lah yang menjadi penghawa dingin yang menentukan bil elektrik anda? Dengan kata lain: dahulu ada yang berkata “model adalah produk”, sekarang “harness adalah produk”?

Since harness is so important, shouldn't the subsequent accounting be more detailed?
Seseorang menunjukkan bahawa kita perlu menambahkan pos "cukai harness" ke dalam benchmark yang ada. Terutamanya mengingat bahawa apabila pemanggilan alat dan percubaan semula memasuki gelung, cukai ini bukan meningkat secara linear.

Dengan kata lain, dalam pertandingan agen masa depan, babak pertama menilai “bolehkah ia dilakukan”, sedangkan babak kedua akan menilai “siapa yang lebih berjimat ketika melakukan perkara yang sama” — dan rahsia berjimat bukan terletak pada model, tetapi pada harness.

Semasa menjalankan Agent, adakah anda pernah mengalami pengalaman serupa? Sila bincang di ruangan komen.
Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Machine Heart
