استخدام رمز Claude Code أعلى بـ 30 مرة من غيره في اختبار إطار العمل العامل

icon MarsBit
مشاركة
AI summary iconملخص
شهدت قوائم الرموز الجديدة اختبارًا مرجعيًا حديثًا من فريق Composio، قارن استخدام الرموز عبر ثلاثة أطر عمل للوكلاء—Claude Code وHermes وKimi Code—باستخدام نموذج Kimi K3 على 28 مهمة متطابقة. تبرز أخبار إطلاق الرمز أن Claude Code استخدم ما يصل إلى 30 مرة أكثر من الرموز مقارنة بالآخرين، بمتوسط 340,000 رمز مقابل 61,000 لـ Kimi Code. ووصلت التكاليف إلى 2 دولار لكل مهمة لـ Claude Code، مقارنة بـ 0.22 دولار لـ Kimi Code. يُظهر الاختبار أن تصميم الوكيل يؤثر بشكل كبير على كفاءة الرموز والتكلفة.

يقول الجميع إن Claude Code يستهلك عملات Token بشكل مفرط، فكم يستهلك بالضبط؟ أخيرًا، تمكن أحدهم من حساب الرقم.

كان هناك تجربة مقارنة مثيرة للاهتمام مؤخرًا من فريق Composio. لقد استخدموا نفس النموذج كيمي K3، ضعها في ثلاثة أطر agent مختلفة —— Claude Code و Hermes و كيمي الرمز—— تم اختبار 28 مهمة متطابقة تمامًا.

ترتيب النماذج

نتيجةً لذلك، فإن معدل نجاح إكمال المهمة من قبل ثلاثة harness تقريبًا متساوٍ: كيمي Code نجح في 22 من أصل 28، وHermes في 21، وClaude Code في 20. الفرق ليس كبيرًا.

ما يُحدث الفرق الحقيقي هو استهلاك الرموز. نفس المهمة، عند تشغيلها باستخدام مُحَمِّلات مختلفة، يمكن أن يختلف استهلاك الرموز بنسبة تصل إلى 30 ضعفًا!

من حيث الوسيط، كيمي يستخدم الكود حوالي 61 ألف رمز، وهيرميس حوالي 67 ألف رمز، بينما يصعد كلاود كود مباشرة إلى 340 ألف رمز، وهو ما يقارب كيمي ستة أضعاف كود.

ترتيب النماذج

اضغط كيمي يتم حساب سعر K3 بـ 3 دولارات لكل مليون مُدخل token (حيث تشكل مُدخلات token في سير عمل العامل عادةً حوالي 95%)، وبالتالي فإن تكلفة كل مهمة متوسطة تقريبًا: كيمي كود 0.22 دولار، هيرميس 0.28 دولار، بينما وصل كود كلاود إلى 2 دولار. الفرق واضح.

كما تختلف السرعة. متوسط الوقت المستغرق، هيرميس الأسرع، 179 ثانية؛ كيمي الكود 297 ثانية؛ كلوود كود 348 ثانية.

إذًا الأسرع هو Hermes، والأقل استهلاكًا للرموز هو كيمي الرمز، وكلاهما غير متداخل.

خلص فريق Composio إلى استنتاج مباشر: إذا كنت ترغب في خفض تكلفة الوكلاء، فابدأ بفحص Harness الذي تستخدمه، وليس بالانتقال بسرعة إلى نموذج آخر. فبياناتهم تُظهر أن Harness وحده يمكنه أن يُحدث فرقًا في التكلفة يصل إلى 9 مرات، بينما تتشابه أداءات النماذج بشكل كبير.

ترتيب النماذج

بعد رؤية هذا الناتج، نشر سيباستيان راشكا أيضًا منشورًا قال فيه إنه يشبه ملاحظاته السابقة التي قام بها باستخدام Qwen3.6: يُستخدم عدد الرموز في Claude Code عادةً ضعفين إلى ثلاثة أضعاف عدد الرموز في العديد من harnesses الأخرى، مع كفاءة نجاح مشابهة.

ترتيب النماذج

لقد طرح عدة أسباب محتملة: هل هو نتيجة عدم تحسينه جيدًا؟ أم وجود عطل؟ أم أنه تم تصميمه بهذه الطريقة عن قصد (لأنه قد يكون مفيدًا في المهام الأصعب)؟ وأعرب عن الحاجة إلى تخصيص وقت إضافي للتحقق بدقة.

ثم أضاف ملاحظاته من الشهر الماضي عند كتابته لمقال عن وكيل البرمجة المحلي. حينها، حلل سبب استخدام Claude Code لعدد أكبر من الرموز، ووجد أن الفرق يكمن أساسًا في رموز الإدخال، وليس رموز الإخراج. بمعنى آخر، لم تكتب Claude محتوىً ضعفَي الكمية. أظهرت السجلات أن واجهة Claude تعيد باستمرار إدخال سياقات إضافية إلى النموذج خلال التفاعلات المتعددة، بما في ذلك الرسائل السابقة، واستدعاءات الأدوات، ومخرجات الأوامر، ومحتوى الملفات. على سبيل المثال، في إحدى المرات، استخدمت Claude حوالي 578 ألف رمز إدخال، لكن الإخراج كان حوالي 4500 رمز فقط، عبر 25 جولة. لذا، التفسير الأكثر احتمالًا هو أن واجهة Claude تتراكم أو تُدرج سجلًا أكبر للواجهة التمهيدية أثناء تشغيل الوكيل متعدد الخطوات.

ترتيب النماذج

تُظهر هذه النتائج الاختبارية اتجاهًا لا يمكن تجاهله: أهمية harness أصبحت على قدم المساواة مع النموذج نفسه.

كشفت ورقة بحثية حديثة (من Writer، وهي شركة تعمل على منصة وكلاء ذكاء اصطناعي للشركات) بشكل منهجي أن تغيير طبقة harness يحقق تقليل تكاليف أكبر مقارنة بتغيير النموذج، وأن جميع النماذج تستفيد من ذلك.

ترتيب النماذج

على وجه التحديد، أجرَوا تجربة "تحكم في المتغيرات" صارمة: مع ثبات 22 مهمة مؤسسية و6 نماذج أساسية (Claude Sonnet 4.6 وGemini 3.1 وGemini Flash 3.5 وQwen 3.6 وGLM 5.1 وPalmyra X6)، قاموا باستبدال طبقة التوجيه فقط — واستبدال دورة الوكلاء الإنتاجية التقليدية بـ Harness الخاص بـ Writer.

أظهرت نتائج التجربة: انخفاض متوسط تكلفة كل مهمة بنسبة 41% (من 0.21 دولار إلى 0.12 دولار)، وتقليص الوسيط التأخيري بنسبة 44% (من 48 ثانية إلى 27 ثانية)، وانخفاض استهلاك الرموز بنسبة 38% (من 14.2k إلى 8.8k)، بينما ظلت جودة إنجاز المهام تقريبًا ثابتة (من 0.78 إلى 0.81، ويمكن اعتبار الفرق غير ذي دلالة إحصائية بسبب حجم العينة الصغير). من حيث كفاءة التكلفة، ارتفع تحسن الجودة لكل دولار إلى 82%، وزاد عدد المهام المنجزة لكل مليون رمز من 54.9 إلى 92.0.

إذًا، بعد أن أصبح النموذج "الكهرباء والماء والغاز"، فإن harness هو المكيف الذي يحدد فاتورة كهربائك؟ بعبارة أخرى: سابقًا، كان البعض يقول "النموذج هو المنتج"، والآن "harness هو المنتج"؟

ترتيب النماذج

Since harness is so important, shouldn't the subsequent accounting be more detailed?

أشار البعض إلى أننا بحاجة إلى إضافة بند "ضريبة harness" إلى المعايير المرجعية الحالية، خاصةً مع الأخذ في الاعتبار أن هذه الضريبة لا تزداد بشكل خطي بمجرد دخول استدعاء الأداة وإعادة المحاولة في حلقة.

ترتيب النماذج

بعبارة أخرى، في مسابقة الوكلاء المستقبلية، سيكون النصف الأول مقارنةً بـ "القدرة على القيام بذلك"، بينما سيكون النصف الثاني مقارنةً بـ "من يفعل نفس الشيء بأقل تكلفة" — وسر التوفير لا يكمن في النموذج، بل في harness.

ترتيب النماذج

هل مررت بتجربة مشابهة أثناء تشغيل Agent؟ نرحب بالنقاش في قسم التعليقات.

هذا المقال من حساب ويشات الرسمي "Machine Heart" (ID: almosthuman2014)، الكاتب: Machine Heart

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.