ریمپ SWE-Bench بینچ مارک: کلوڈ فیبل 5 نے 87.5% کامیابی کے ساتھ ٹاپ کیا

iconKuCoinFlash
بانٹیں
AI summary iconخلاصہ
ریمپ، ایک فینٹیک یونیکورن، نے اپنا SWE-Bench بینچ مارک جاری کیا ہے جو حقیقی پروڈکشن ماحول سے 80 بیک اینڈ ٹاسکس پر مشتمل ہے۔ اینتھرپک کا کلوڈ فیبل 5 نے 14 ماڈلز میں سب سے زیادہ 87.5% سکور حاصل کیا۔ AI + کرپٹو خبروں میں کلوڈ اوپس 4.8 کی لاگت کی کارآمدی $1.09 فی رن کے ساتھ اہم ہے۔ گھریلو ماڈلز کیمی K2.6 اور GLM 5.1 نے 72.5% اور 71.25% سکور حاصل کیا۔ GPT-5.4 Mini نے ہلکے ماڈلز میں 58.75% سکور کے ساتھ قیادت کی۔ ریمپ نے بتایا کہ عملی استعمال کے لیے پرفارمنس، رفتار اور لاگت میں توازن اہم ہے۔ بینکاری شرح کی خبریں ٹریڈرز کے لیے الگ تھلگ توجہ کا مرکز رہتی ہیں۔
ME AI کی خبر، اس کے مطابق، فن ٹیک یونیکورن Ramp نے اعلان کیا ہے کہ انہوں نے ایک نجی ٹیسٹ بینچ مارک Ramp SWE-Bench جاری کیا ہے جو سامنے والے AI کوڈنگ ایجینٹس کے لیے ہے۔ Ramp SWE-Bench میں Ramp کے اصل پروڈکشن ماحول سے لیے گئے 80 بیک اینڈ ڈویلپمنٹ ٹاسکس شامل ہیں، جو عوامی ایوانٹس ڈیٹا سیٹس میں ماڈل کی پری ٹریننگ کی وجہ سے ہونے والی ڈیٹا لیک اور میٹرکس سچوریشن کو حل کرنے کے لیے بنائے گئے ہیں۔ تمام ٹاسکس Ramp کے اندر AI کوڈنگ اسسٹنٹ Inspect کے ذریعے پروڈکشن میں کامیابی سے ڈپلوئ کیے گئے اصل پل ریکسٹ (PR) سے نکالے گئے ہیں۔ ہر ٹاسک میں PR سب مٹ کے پہلے کا بنیادی کوڈ بیس دوبارہ ترتیب دیا گیا ہے، جس میں مرج کردہ کوڈ اور ٹیسٹس کو گولن سٹینڈرڈ کے طور پر برقرار رکھا گیا ہے، اور انجرز کے Inspect ڈائلاگ میں اصل نیت کو پرومپٹ کے طور پر استعمال کیا گیا ہے۔ ایوانٹس mini-swe-agent سینڈ باکس ماحول میں کیا جاتا ہے، جہاں ایک بار میں تمام ٹیسٹس کامیابی سے پاس کرنا اور موجودہ فنکشنلٹی کو نقصان نہ پہنچانا (pass@1) پاسنگ کرٹیرین بنایا گیا ہے۔ جاری کردہ 14 ماڈلز کے عرض دار تجزیہ کے مطابق، Anthropic نے اپنا نئاترین Claude Fable 5 جاری کیا جس نے 87.5% حل شدہ شرح کے ساتھ سب سے اوپر مقام حاصل کیا۔ Claude Opus 4.7 اور GPT-5.5 دونوں دوسرے نمبر پر ہیں، جن کی حل شدہ شرح 83.75% ہے۔ Claude Opus 4.8 کی حل شدہ شرح 77.5% ہے، لیکن اس کا اوسط وقت صرف 8 منٹ اور 30 سیکنڈ تک محدود ہے، اور اس کا اوسط لاگت صرف 1.09 امریکی ڈالر ہے، جو Fable 5 کے لاگت سے 40% سے بھی کم ہے، جس سے اس کا لاگت فائدہ بہت زبردست نکلتا ہے۔ ٹیسٹ ڈیٹا نے مختلف ماڈلز کے درمیان قیمت اور پرفارمنس کے درمیان توازن بھی ظاہر کیا۔ مقامی ماڈل Kimi K2.6 اور GLM 5.1 کی حل شدہ شرح تقریباً برابر ہے، جو ترتیب سے 72.5% اور 71.25% ہے، لیکن Kimi K2.6 کا اوسط لاگت صرف 0.69 امریکی ڈالر ہے، جو GLM 5.1 سے تقریباً 34% سستا ہے۔ لائٹ ویٹ ماڈلز میں، GPT-5.4 Mini نے Claude Haiku 4.5 سے تقریباً 10 فصد زائد حل شدہ شرح (58.75%) حاصل کی، اور اس کا اوسط لاگت اور مرحلوں کا عدد بھي آدھا رہا۔ Ramp نے بتایا کہ جب ماڈلز عمل میں آتے ہیں تو، پرفارمنس، رفتار اور لاگت کا توازن عمل مین لائنز مین اہم ترین فکر بن رہا ہے۔ (ذرائع: BlockBeats)
اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔