مقياس Ramp SWE-Bench: كلاود فايل 5 يتصدر بمستوى نجاح 87.5%

iconKuCoinFlash
مشاركة
AI summary iconملخص
رامب، شركة التكنولوجيا المالية التي تبلغ قيمتها مليار دولار، أطلقت معيار SWE-Bench لوكالات البرمجة بالذكاء الاصطناعي، والذي يضم 80 مهمة خلفية من بيئات إنتاجية حقيقية. حصل كلوود فابل 5 من أنثروبيك على 87.5٪، وهي أعلى نسبة بين 14 نموذجًا. وتشير أخبار الذكاء الاصطناعي والعملات المشفرة إلى كفاءة تكلفة كلوود أوبوس 4.8 عند 1.09 دولار لكل تشغيل. وتبع النماذج المحلية كيمي K2.6 وGLM 5.1 بنسبة 72.5٪ و71.25٪ على التوالي. وتصدر نموذج GPT-5.4 Mini النماذج الخفيفة بنسبة 58.75٪. ولاحظت رامب أن التوازنات بين الأداء والسرعة والتكلفة هي عوامل رئيسية للنشر. تبقى أخبار أسعار الفائدة محورًا منفصلًا للمتداولين.
ME AI رسالة، وفقًا لمراقبة Beating، أطلقت الشركة الناشئة في التكنولوجيا المالية Ramp معيار اختبار خاص لوكيلات البرمجة الذكية المتقدمة يُسمى Ramp SWE-Bench. يحتوي Ramp SWE-Bench على 80 مهمة تطوير خلفية مستمدة من بيئة الإنتاج الحقيقية لـ Ramp، بهدف معالجة مشكلات تسرب البيانات وتشبع المؤشرات الناتجة عن التدريب المسبق للنماذج في مجموعات التقييم العامة. تم استخلاص مهام الاختبار جميعها من طلبات سحب (PR) ناجحة تم نشرها فعليًا في بيئة الإنتاج عبر مساعد Ramp الداخلي للبرمجة الذكية Inspect. تم إعادة بناء قاعدة الكود الأساسية قبل تقديم كل طلب سحب، مع الاحتفاظ بالكود والاختبارات المدمجة كمعيار ذهبي، واستخلاص النية الأصلية للمهندس من محادثات Inspect كمُحفز. يتم التقييم في بيئة محاكاة mini-swe-agent، مع اعتبار النجاح هو اجتياز جميع الاختبارات في تشغيل واحد دون إتلاف الوظائف الحالية (pass@1). وفقًا لنتائج المقارنة الأفقية المنشورة لـ 14 نموذجًا، تصدر نموذج Claude Fable 5 الجديد من Anthropic بنتيجة حل بلغت 87.5%. وحل نموذجا Claude Opus 4.7 وGPT-5.5 في المركز الثاني متساويين بنسبة حل بلغت 83.75%. وعلى الرغم من أن Claude Opus 4.8 حققت نسبة حل بلغت 77.5%، إلا أن متوسط وقت التشغيل لكل مهمة انخفض إلى 8 دقائق و30 ثانية، وتكاليف التشغيل لكل مرة لم تتجاوز 1.09 دولار، أي أقل من 40% من تكلفة Fable 5، مما يُظهر كفاءة تكلفة ممتازة. كشفت بيانات الاختبار أيضًا عن التوازن بين السعر والأداء بين النماذج المختلفة. وحققت النماذج الصينية Kimi K2.6 وGLM 5.1 نسب حل متقاربة بلغت 72.5% و71.25% على التوالي، لكن متوسط تكلفة Kimi K2.6 بلغ 0.69 دولار، أي أرخص بنسبة 34% تقريبًا من GLM 5.1. وفي فئة النماذج الخفيفة، تصدر نموذج GPT-5.4 Mini بنتيجة حل بلغت 58.75%، متقدمًا على Claude Haiku 4.5 بحوالي 10 نقاط مئوية، مع انخفاض متوسط التكلفة وعدد الخطوات إلى النصف. وأشارت Ramp إلى أنه مع انتقال النماذج إلى التطبيق العملي، أصبح التوازن بين الأداء والسرعة والتكلفة عاملًا حاسمًا في التنفيذ الهندسي. (المصدر: BlockBeats)
إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.