র্যাম্প এসডব্লিউ-বেঞ্চ বেঞ্চমার্ক: ক্লড ফেবল ৫ ৮৭.৫% সাফল্যের হার নিয়ে শীর্ষে

iconKuCoinFlash
শেয়ার
AI summary iconসারাংশ
ফিনটেক ইউনিকর্ন Ramp তার SWE-Bench বেঞ্চমার্ক প্রকাশ করেছে, যাতে বাস্তব প্রোডাকশন পরিবেশ থেকে ৮০টি ব্যাকএন্ড টাস্ক অন্তর্ভুক্ত। Anthropic-এর Claude Fable 5 এই ১৪টি মডেলের মধ্যে সর্বোচ্চ ৮৭.৫% স্কোর করেছে। AI + ক্রিপ্টো সংবাদে Claude Opus 4.8-এর খরচ দক্ষতা $1.09 প্রতি রান হিসাবে উল্লেখযোগ্য। দেশীয় মডেল Kimi K2.6 এবং GLM 5.1 যথাক্রমে ৭২.৫% এবং ৭১.২৫% স্কোর করেছে। GPT-5.4 Mini হালকা মডেলগুলির মধ্যে ৫৮.৭৫% স্কোর নিয়ে শীর্ষে। Ramp উল্লেখ করেছে যে পারফরম্যান্স, গতি এবং খরচের মধ্যে ট্রেড-অফগুলি ডিপ্লয়মেন্টের জন্য গুরুত্বপূর্ণ। সুদের হার সংক্রান্ত সংবাদগুলি ট্রেডারদের জন্য আলাদা ফোকাস হয়ে রয়েছে।
ME AI সংবাদ, অনুসন্ধান বেটিং মনিটরিং অনুযায়ী, ফিনটেক ইউনিকর্ণ Ramp একটি প্রাইভেট টেস্ট বেঞ্চমার্ক Ramp SWE-Bench প্রকাশ করেছে, যা অগ্রগামী AI কোডিং এজেন্টগুলির জন্য ডিজাইন করা হয়েছে। Ramp SWE-Bench-এ 80টি ব্যাকএন্ড ডেভেলপমেন্ট টাস্ক রয়েছে, যা Ramp-এর প্রকৃত উৎপাদন পরিবেশ থেকে নেওয়া হয়েছে, যার উদ্দেশ্য হল মডেলের প্রি-ট্রেনিংয়ের কারণে সাধারণ মূল্যায়ন ডেটাসেটগুলিতে ডেটা লিকেজ এবং মেট্রিকস স্যাচুরেশনের সমস্যা সমাধান করা। প্রতিটি টাস্ক Ramp-এর অভ্যন্তরীণ AI কোডিং সহায়ক Inspect-এর দ্বারা উৎপাদন পরিবেশে সফলভাবে ডিপ্লয় করা বাস্তব PR (পুল রিকোয়েস্ট) থেকে নেওয়া হয়েছে। প্রতিটি টাস্ক PR-এর কমিটের আগের বেসকোডবেসকে পুনঃগঠন করে, মার্জড কোড এবং টেস্টকে গোল্ডন স্ট্যান্ডার্ড হিসাবে রাখে, এবং Inspect-এর ডায়ালগগুলিতেই ইঞ্জিনিয়ারদের মূল ইচ্ছা-কে প্রমপ্টস olarak এক্সট্র্যাক্ট করে। মূল্যায়ন mini-swe-agent স্যান্ডবক্স পরিবেশের মধ্যে করা হয়, এবং "pass@1" —অর্থাৎ, একবারেই সমস্ত টেস্ট পাস করা, ১০০% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 1০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% ১০০% —এটিই পাসিংয়ের মানদণ্ড। প্রকাশিত 14টি মডেলের পারস্পরিক মূল্যায়নের ফলাফলগুলির ভিত্তিতে, Anthropic-এর latest Claude Fable-5-এর solve rate-এর %87.5,যা top position-এ। Claude Opus-4.7 and GPT-5.5 tie for second place with a solve rate of %83.75 each. Claude Opus-4.8 has a solve rate of %77.5, but its average runtime per task is reduced to just eight minutes and thirty seconds, with a single-run cost of only $1.09, less than forty percent of Fable-5’s cost, demonstrating exceptional cost-efficiency. The test data also reveals trade-offs between price and performance across different models. The domestic models Kimi K2.6 and GLM-5.1 have similar solve rates of %72.5 and %71.25 respectively, but Kimi K2.6’s average cost is $0.69, approximately thirty-four percent cheaper than GLM-5.1. Among lightweight models, GPT-5.4 Mini leads Claude Haiku-4.5 by about ten percentage points with a solve rate of %58.75, while also halving both average cost and number of steps. Ramp notes that as models move toward practical deployment, the trade-offs among performance, speed, and cost are becoming critical considerations for engineering implementation. (Source: BlockBeats)
দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।