Herkes Claude Code'un Token'ları harcadığını söylüyor, gerçekten ne kadar harcıyor? Bu sefer nihayet biri sayıları hesapladı.
Composio ekibinden son zamanlarda ilginç bir karşılaştırmalı deney oldu. Aynı modeli kullandılar Kimi K3, üç farklı agent çerçevesine (harness) yerleştirilerek çalıştırılır — Claude Code, Hermes ve Kimi Kod—— Tamamen aynı 28 görev test edildi.

Sonuç olarak, üç harness'in görevi başarıyla tamamlama oranları neredeyse aynı: Kimi Code, 28 tanesinden 22'si başarılı, Hermes 21, Claude Code 20. Fark büyük değil.
Farkı gerçekten yaratan, token tüketimidir. Aynı bir görev, farklı harness'lerle çalıştırıldığında, token tüketimi en fazla 30 kat kadar farklılık gösterebilir!
Medyan olarak, Kimi Kod yaklaşık 61.000 token, Hermes yaklaşık 67.000 token, Claude Code ise doğrudan 340.000 token'e ulaşıyor, bu da yaklaşık olarak Kimi Kodun 6 katı.

Tıklayın Kimi K3, milyon girdi token başına 3 dolar fiyatla hesaplanır (agent iş akışındaki girdi token'ları genellikle %95 civarını oluşturur); ortalama her görevin maliyeti: Kimi Kod 0,22 dolar, Hermes 0,28 dolar, Claude Code ise 2 dolar. Fark açıkça görülüyor.
Hız açısından da farklılık vardır. Medyan süre açısından Hermes en hızlıdır, 179 saniye; Kimi Kod 297 saniye; Claude Kod 348 saniye.
En hızlı olan Hermes, en az token tüketen ise Kimi Kod, ikisi de çakışmıyor.
Composio ekibi, ajan maliyetlerini düşürmek istiyorsanız, model değiştirmekten ziyade hangi donanımın kullanıldığını incelemeniz gerektiğini doğrudan çıkarıyor. Verilerine göre, donanım tek başına maliyetleri 9 kat kadar farklılaştırabiliyor, model performansları ise neredeyse aynı kalıyor.

Sebastian Raschka, bu sonucu gördükten sonra benzer bir gözlem yaptığını paylaştı: Claude Code, başarı oranları benzerken, token tüketimi diğer birçok harness'in 2 ila 3 katıydı.

Bazı olası nedenleri sundu: iyileştirilmemiş mi? Hata mı var? Yoksa kasıtlı olarak böyle mi tasarlandı (çünkü daha zor görevlerde yardımcı olabilir mi)? Daha dikkatli incelemek için daha fazla zaman harcaması gerektiğini belirtti.
Ardından, geçen ay yerel coding agent makalesini yazarken yaptığı gözlemleri ekledi. O zaman Claude Code'un neden daha fazla token kullandığını analiz etti ve farkların çoğunlukla giriş token'larında, çıkış token'larında değil olduğunu fark etti. Yani, Claude'nin iki kat daha fazla içerik yazmadığı anlamına geliyor. Günlük kayıtları, Claude'nin harness'ının çoklu etkileşimler sırasında önceki mesajları, araç çağrılarını, komut çıktılarını ve dosya içeriklerini dahil olmak üzere daha fazla bağlamı modele tekrar tekrar eklediğini gösteriyor. Örneğin, bir seferinde Claude yaklaşık 578.000 giriş token'ı kullandı ancak çıkış sadece yaklaşık 4.500 token oldu ve bu 25 tur boyunca gerçekleşti. Bu nedenle daha olası açıklama, Claude'nin harness'ının çok adımlı agent çalıştırması sırasında daha büyük bir prompt geçmişini biriktirdiği veya dahil ettiği.

Bu test sonuçları, harness'in önemini modelin kendisiyle eşit hale getirdiğini gösteriyor.
Yazan (kurumsal AI Agent platformu yapan bir şirket) tarafından yapılan son bir makale, kontrol değişkenli deneylerle, model değiştirmekten daha fazla maliyet tasarrufu sağlamak için bir harness katmanını değiştirmenin daha etkili olduğunu ve tüm modellerin bundan fayda sağladığını sistematik olarak ortaya koydu.

Özellikle, 22 iş görevi ve 6 temel model (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) sabit tutularak, geleneksel üretim seviyesi ajan döngüsünü Writer'ın kendi Harness sistemine değiştirerek titiz bir "değişken kontrol" deneyi gerçekleştirdiler.
Deneysel sonuçlar, her bir görevin ortalama maliyetinin %41 azaldığını (0,21 ABD doları → 0,12 ABD doları), medyan gecikmenin %44 kısaldığını (48 saniye → 27 saniye), Token tüketiminin %38 azaldığını (14,2k → 8,8k) ve görev tamamlama kalitesinin temelde sabit kaldığını gösterdi (0,78 → 0,81; örneklem boyutu küçük olduğu için anlamlı bir fark olarak kabul edilmez). Maliyet-verimlilik açısından, her ABD doları maliyetle elde edilen kalite artışı %82'ye ulaştı ve her milyon Token ile tamamlanan görev sayısı 54,9'dan 92,0'a yükseldi.
Yani model “su, elektrik, doğalgaz” haline geldikten sonra, harness mı sizin elektrik faturanızı belirleyen klima? Başka bir deyişle: eskiden bazıları “model ürün” diyordu, şimdi “harness ürün”?

Harness bu kadar önemliyken, sonraki hesaplamalar da daha detaylı yapılmalı değil mi?
Bazıları, mevcut benchmark'lara "harness vergisi" eklenmesi gerektiğini belirtti. Özellikle araç çağrısı ve yeniden deneme döngüye girdiğinde bu verginin doğrusal olarak artmadığı göz önünde bulundurulduğunda.

Yani gelecekteki agent yarışmalarında ilk yarı "yapılabilir mi" üzerine, ikinci yarı ise "aynı işi kim daha az maliyetle yapar" üzerine olacak—ve tasarrufun sırrı modelde değil, harness'ta yatıyor.

Agent çalıştırırken benzer bir deneyim yaşadınız mı? Yorumlarda tartışın.
Bu yazı, WeChat hesabından "Makine Kalbi" (ID: almosthuman2014) tarafından paylaşılmıştır, yazar: Makine Kalbi
