يقول الجميع إن Claude Code يستهلك عملات Token بشكل مفرط، فكم يستهلك بالضبط؟ أخيرًا، تمكن أحدهم من حساب الرقم.
كان هناك تجربة مقارنة مثيرة للاهتمام مؤخرًا من فريق Composio. لقد استخدموا نفس النموذج كيمي K3، ضعها في ثلاثة أطر agent مختلفة —— Claude Code و Hermes و كيمي الرمز—— تم اختبار 28 مهمة متطابقة تمامًا.

نتيجةً لذلك، فإن معدل نجاح إكمال المهمة من قبل ثلاثة harness تقريبًا متساوٍ: كيمي Code نجح في 22 من أصل 28، وHermes في 21، وClaude Code في 20. الفرق ليس كبيرًا.
ما يُحدث الفرق الحقيقي هو استهلاك الرموز. نفس المهمة، عند تشغيلها باستخدام مُحَمِّلات مختلفة، يمكن أن يختلف استهلاك الرموز بنسبة تصل إلى 30 ضعفًا!
من حيث الوسيط، كيمي يستخدم الكود حوالي 61 ألف رمز، وهيرميس حوالي 67 ألف رمز، بينما يصعد كلاود كود مباشرة إلى 340 ألف رمز، وهو ما يقارب كيمي ستة أضعاف كود.

اضغط كيمي يتم حساب سعر K3 بـ 3 دولارات لكل مليون مُدخل token (حيث تشكل مُدخلات token في سير عمل العامل عادةً حوالي 95%)، وبالتالي فإن تكلفة كل مهمة متوسطة تقريبًا: كيمي كود 0.22 دولار، هيرميس 0.28 دولار، بينما وصل كود كلاود إلى 2 دولار. الفرق واضح.
كما تختلف السرعة. متوسط الوقت المستغرق، هيرميس الأسرع، 179 ثانية؛ كيمي الكود 297 ثانية؛ كلوود كود 348 ثانية.
إذًا الأسرع هو Hermes، والأقل استهلاكًا للرموز هو كيمي الرمز، وكلاهما غير متداخل.
خلص فريق Composio إلى استنتاج مباشر: إذا كنت ترغب في خفض تكلفة الوكلاء، فابدأ بفحص Harness الذي تستخدمه، وليس بالانتقال بسرعة إلى نموذج آخر. فبياناتهم تُظهر أن Harness وحده يمكنه أن يُحدث فرقًا في التكلفة يصل إلى 9 مرات، بينما تتشابه أداءات النماذج بشكل كبير.

بعد رؤية هذا الناتج، نشر سيباستيان راشكا أيضًا منشورًا قال فيه إنه يشبه ملاحظاته السابقة التي قام بها باستخدام Qwen3.6: يُستخدم عدد الرموز في Claude Code عادةً ضعفين إلى ثلاثة أضعاف عدد الرموز في العديد من harnesses الأخرى، مع كفاءة نجاح مشابهة.

لقد طرح عدة أسباب محتملة: هل هو نتيجة عدم تحسينه جيدًا؟ أم وجود عطل؟ أم أنه تم تصميمه بهذه الطريقة عن قصد (لأنه قد يكون مفيدًا في المهام الأصعب)؟ وأعرب عن الحاجة إلى تخصيص وقت إضافي للتحقق بدقة.
ثم أضاف ملاحظاته من الشهر الماضي عند كتابته لمقال عن وكيل البرمجة المحلي. حينها، حلل سبب استخدام Claude Code لعدد أكبر من الرموز، ووجد أن الفرق يكمن أساسًا في رموز الإدخال، وليس رموز الإخراج. بمعنى آخر، لم تكتب Claude محتوىً ضعفَي الكمية. أظهرت السجلات أن واجهة Claude تعيد باستمرار إدخال سياقات إضافية إلى النموذج خلال التفاعلات المتعددة، بما في ذلك الرسائل السابقة، واستدعاءات الأدوات، ومخرجات الأوامر، ومحتوى الملفات. على سبيل المثال، في إحدى المرات، استخدمت Claude حوالي 578 ألف رمز إدخال، لكن الإخراج كان حوالي 4500 رمز فقط، عبر 25 جولة. لذا، التفسير الأكثر احتمالًا هو أن واجهة Claude تتراكم أو تُدرج سجلًا أكبر للواجهة التمهيدية أثناء تشغيل الوكيل متعدد الخطوات.

تُظهر هذه النتائج الاختبارية اتجاهًا لا يمكن تجاهله: أهمية harness أصبحت على قدم المساواة مع النموذج نفسه.
كشفت ورقة بحثية حديثة (من Writer، وهي شركة تعمل على منصة وكلاء ذكاء اصطناعي للشركات) بشكل منهجي أن تغيير طبقة harness يحقق تقليل تكاليف أكبر مقارنة بتغيير النموذج، وأن جميع النماذج تستفيد من ذلك.

على وجه التحديد، أجرَوا تجربة "تحكم في المتغيرات" صارمة: مع ثبات 22 مهمة مؤسسية و6 نماذج أساسية (Claude Sonnet 4.6 وGemini 3.1 وGemini Flash 3.5 وQwen 3.6 وGLM 5.1 وPalmyra X6)، قاموا باستبدال طبقة التوجيه فقط — واستبدال دورة الوكلاء الإنتاجية التقليدية بـ Harness الخاص بـ Writer.
أظهرت نتائج التجربة: انخفاض متوسط تكلفة كل مهمة بنسبة 41% (من 0.21 دولار إلى 0.12 دولار)، وتقليص الوسيط التأخيري بنسبة 44% (من 48 ثانية إلى 27 ثانية)، وانخفاض استهلاك الرموز بنسبة 38% (من 14.2k إلى 8.8k)، بينما ظلت جودة إنجاز المهام تقريبًا ثابتة (من 0.78 إلى 0.81، ويمكن اعتبار الفرق غير ذي دلالة إحصائية بسبب حجم العينة الصغير). من حيث كفاءة التكلفة، ارتفع تحسن الجودة لكل دولار إلى 82%، وزاد عدد المهام المنجزة لكل مليون رمز من 54.9 إلى 92.0.
إذًا، بعد أن أصبح النموذج "الكهرباء والماء والغاز"، فإن harness هو المكيف الذي يحدد فاتورة كهربائك؟ بعبارة أخرى: سابقًا، كان البعض يقول "النموذج هو المنتج"، والآن "harness هو المنتج"؟

Since harness is so important, shouldn't the subsequent accounting be more detailed?
أشار البعض إلى أننا بحاجة إلى إضافة بند "ضريبة harness" إلى المعايير المرجعية الحالية، خاصةً مع الأخذ في الاعتبار أن هذه الضريبة لا تزداد بشكل خطي بمجرد دخول استدعاء الأداة وإعادة المحاولة في حلقة.

بعبارة أخرى، في مسابقة الوكلاء المستقبلية، سيكون النصف الأول مقارنةً بـ "القدرة على القيام بذلك"، بينما سيكون النصف الثاني مقارنةً بـ "من يفعل نفس الشيء بأقل تكلفة" — وسر التوفير لا يكمن في النموذج، بل في harness.

هل مررت بتجربة مشابهة أثناء تشغيل Agent؟ نرحب بالنقاش في قسم التعليقات.
هذا المقال من حساب ويشات الرسمي "Machine Heart" (ID: almosthuman2014)، الكاتب: Machine Heart
