رسالة ChainThink، 1 أغسطس، قام مزود بنية تحتية لوكيلات الذكاء الاصطناعي Composio بتوسيع الاختبار، وربط نفس كيمى K3 بستة أطر وكيل، وأكمل 26 مهمة متطابقة.
المقارنة تمت على مستوى الإطار التشغيلي، مع استخدام نموذج أساسي واحد وهو Kimi K3. أظهرت نتائج الاختبار أن Kimi Code أكمل 21 مهمة، متقدماً في المرتبة الأولى؛ بينما أكمل Hermes 20 مهمة؛
أكمل Pi Agent و Claude Code 19 مهمة؛ أكمل OpenCode 18 مهمة؛ أكمل Codex 17 مهمة.
وفقًا للتقييم السعري الرسمي لـ Kimi K3، فإن Hermes و Pi Agent لديهما أقل تكلفة متوسطة لكل مهمة، على التوالي 0.39 دولار و0.40 دولار؛
يبلغ سعر Claude Code 1.47 دولار، أي ما يقارب 3.8 ضعف سعر Hermes. من حيث السرعة، فإن الوقت الوسيط لإنجاز مهمة واحدة من قبل Pi Agent هو 161.7 ثانية، بينما يبلغ وقت Claude Code 347.6 ثانية.
أظهرت الاختبارات أنه عند تغيير الإطار ضمن نفس النموذج، يختلف عدد المهام الناجحة بنسبة تصل إلى 4 مهام، ويختلف التكلفة المتوسطة بأكثر من أربع مرات، ويختلف الوقت المستهلك بأكثر من مرتين.
