Penggunaan Token Claude Code sehingga 30 kali lebih tinggi daripada yang lain dalam ujian Kerangka Agen

icon MarsBit
Kongsi
AI summary iconRingkasan
Pendaftaran token baru baru ini diuji oleh pasukan Composio, yang membandingkan penggunaan token di antara tiga kerangka agen—Claude Code, Hermes, dan Kimi Code—menggunakan model Kimi K3 pada 28 tugas yang sama. Berita pelancaran token menunjukkan bahawa Claude Code menggunakan sehingga 30 kali lebih banyak token berbanding yang lain, dengan median 340,000 token berbanding 61,000 untuk Kimi Code. Kos mencapai $2 setiap tugas untuk Claude Code, berbanding $0.22 untuk Kimi Code. Ujian ini menunjukkan bahawa rekabentuk agen memberi kesan besar terhadap kecekapan dan kos token.

Semua orang berkata bahawa Claude Code membuang-buang token, seberapa banyaknya? Akhirnya ada orang yang mengira nombornya.

Baru-baru ini, terdapat eksperimen perbandingan yang menarik daripada pasukan Composio. Mereka menggunakan model yang sama Kimi K3, dijalankan secara berasingan dalam tiga kerangka agen yang berbeza —— Claude Code, Hermes dan Kimi Kod—— Telah menguji 28 tugas yang sama persis.

Pengaturan model

Hasilnya, tiga harness berjaya menyelesaikan tugas dengan kadar yang hampir sama: Kimi Kod berjaya 22 daripada 28, Hermes 21, dan Claude Code 20. Perbezaannya tidak besar.

Yang benar-benar menciptakan perbezaan ialah penggunaan token. Untuk tugas yang sama, penggunaan token boleh berbeza sehingga 30 kali ganda bergantung pada harness yang digunakan!

Dari median, Kimi Kod menggunakan sekitar 61,000 token, Hermes sekitar 67,000, manakala Claude Code terus melonjak kepada 340,000, hampir Kimi 6 kali ganda kod.

Pengaturan model

Klik Kimi Harga K3 dihitung pada kadar 3 dolar AS setiap juta token input (token input dalam alur kerja agen biasanya mengambil kira-kira 95%), kos purata setiap tugas ialah: Kimi Kod 0.22 dolar, Hermes 0.28 dolar, sedangkan Claude Code mencapai 2 dolar. Perbezaannya jelas.

Dari segi kelajuan, ia juga berbeza. Masa median terpendek ialah Hermes, 179 saat; Kimi Kod 297 saat; Kod Claude 348 saat.

Jadi yang paling pantas ialah Hermes, yang paling menjimatkan token ialah Kimi Kod, keduanya tidak bertindih.

Pasukan Composio menyimpulkan secara langsung: jika anda ingin mengurangkan kos agen, lihat terlebih dahulu harness yang digunakan, bukan segera menukar model. Data mereka menunjukkan bahawa harness itu sendiri boleh membezakan kos sebanyak 9 kali ganda, manakala prestasi model sebenarnya hampir sama.

Pengaturan model

Sebastian Raschka juga memposting setelah melihat hasil ini, mengatakan bahawa ia serupa dengan pemerhatian sebelumnya beliau terhadap Qwen3.6: Claude Code sering menggunakan token 2 hingga 3 kali ganda berbanding banyak harness lain, dengan kadar kejayaan yang serupa.

Pengaturan model

Dia mengemukakan beberapa kemungkinan sebab: adakah ia kurang dioptimumkan? Adakah terdapat ralat? Atau sengaja direka begitu (kerana mungkin membantu dalam tugas yang lebih sukar)? Dia menyatakan perlu meluangkan masa untuk menyemaknya dengan teliti.

Selepas itu, beliau menambahkan pemerhatian semasa menulis artikel tentang agen coding tempatan bulan lalu. Semasa itu, beliau menganalisis mengapa Claude Code menggunakan lebih banyak token, dan mendapati perbezaan utama berlaku pada token input, bukan token output. Dengan kata lain, Claude tidak menghasilkan kandungan sebanyak dua kali ganda. Log menunjukkan bahawa harness Claude akan mengulang kali memasukkan lebih banyak konteks semula ke dalam model semasa interaksi berbilang langkah, termasuk mesej sebelumnya, panggilan alat, output arahan, dan kandungan fail. Sebagai contoh, dalam satu sesi, Claude menggunakan kira-kira 578,000 token input, tetapi hanya menghasilkan kira-kira 4,500 token output, melalui 25 langkah. Oleh itu, penjelasan yang lebih mungkin ialah harness Claude akan mengumpul atau memasukkan sejarah prompt yang lebih besar semasa pelaksanaan agen berbilang langkah.

Pengaturan model

Keputusan ujian ini kelihatannya mengungkap satu trend yang tidak boleh diabaikan: kepentingan harness sudah setara dengan model itu sendiri.

Kertas kerja terkini (daripada Writer, sebuah syarikat yang membina platform AI Agent perniagaan) secara sistematis mengungkapkan ini: ia membuktikan melalui eksperimen pemboleh ubah kawalan bahawa menukar lapisan harness lebih berkesan dalam mengurangkan kos berbanding menukar model, dan semua model mendapat keuntungan.

Pengaturan model

Secara khusus, mereka menjalankan eksperimen "kawal pemboleh ubah" yang ketat: dengan 22 tugas perniagaan dan 6 model asas (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) tetap, mereka hanya menggantikan lapisan pengaturan—menggantikan kitar agen pengeluaran tradisional dengan Harness buatan Writer sendiri.

Keputusan eksperimen menunjukkan: kos purata setiap tugas berkurang 41% (USD 0.21 → USD 0.12), median latensi dipersingkat 44% (48 saat → 27 saat), penggunaan Token berkurang 38% (14.2k → 8.8k), sementara kualiti penyelesaian tugas kekal hampir sama (0.78 → 0.81, dianggap tiada perbezaan signifikan kerana saiz sampel kecil). Dari segi nilai, peningkatan kualiti per dolar meningkat sebanyak 82%, sementara bilangan tugas yang dapat diselesaikan per juta Token meningkat dari 54.9 kepada 92.0.

Jadi, selepas model menjadi “air, listrik, dan gas”, harness lah yang menjadi penghawa dingin yang menentukan bil elektrik anda? Dengan kata lain: dahulu ada yang berkata “model adalah produk”, sekarang “harness adalah produk”?

Pengaturan model

Since harness is so important, shouldn't the subsequent accounting be more detailed?

Seseorang menunjukkan bahawa kita perlu menambahkan pos "cukai harness" ke dalam benchmark yang ada. Terutamanya mengingat bahawa apabila pemanggilan alat dan percubaan semula memasuki gelung, cukai ini bukan meningkat secara linear.

Pengaturan model

Dengan kata lain, dalam pertandingan agen masa depan, babak pertama menilai “bolehkah ia dilakukan”, sedangkan babak kedua akan menilai “siapa yang lebih berjimat ketika melakukan perkara yang sama” — dan rahsia berjimat bukan terletak pada model, tetapi pada harness.

Pengaturan model

Semasa menjalankan Agent, adakah anda pernah mengalami pengalaman serupa? Sila bincang di ruangan komen.

Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Machine Heart

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.