Ramp SWE-Bench Benchmark: Claude Fable 5 посідає перше місце з показником успішності 87,5%

iconKuCoinFlash
Поділитися
AI summary iconКороткий зміст
Ramp, фінтех-унікорн, випустив бенчмарк SWE-Bench для AI-агентів з кодуванням, що включає 80 завдань із реальних виробничих середовищ. Claude Fable 5 від Anthropic показав результат 87,5% — найвищий серед 14 моделей. У новинах про AI та криптовалюту підкреслюється ефективність Claude Opus 4.8 — $1,09 за запуск. Домашні моделі Kimi K2.6 та GLM 5.1 поступилися з результатами 72,5% та 71,25%. GPT-5.4 Mini став лідером серед легковагих моделей з результатом 58,75%. Ramp зазначив, що компроміси між продуктивністю, швидкістю та витратами є ключовими для розгортання. Новини щодо процентних ставок залишаються окремою темою для трейдерів.
ME AI Новина: за даними моніторингу Beating, фінтех-унікорн Ramp опублікував приватний тестовий набір для передових AI-кодувальних агентів — Ramp SWE-Bench. Ramp SWE-Bench містить 80 завдань з реальних продуктивних середовищ Ramp, спрямованих на вирішення проблем з утечками даних та насиченням метрик, що виникають через попереднє навчання моделей у публічних наборах даних. Усі завдання були витягнуті з реальних pull request (PR), успішно розгорнутих у продуктивному середовищі за допомогою внутрішнього AI-асистента Ramp — Inspect. Кожне завдання відновлює базову кодову базу до моменту PR, зберігаючи об’єднаний код і тести як золотий стандарт, а також витягує початкову інтенцію інженера з діалогу Inspect як підказку. Оцінка проводиться в середовищі mini-swe-agent, де проходження визначається як успішне проходження всіх тестів за одну спробу без порушення існуючої функціональності (pass@1). За результатами порівняльного тестування 14 моделей, найновіша модель Anthropic Claude Fable 5 посіла перше місце з рівнем вирішення 87,5%. Claude Opus 4.7 і GPT-5.5 поділили друге місце з рівнем вирішення 83,75%. Claude Opus 4.8, хоча й має рівень вирішення 77,5%, сократив середній час виконання однієї задачі до 8 хвилин 30 секунд і знизив вартість однієї спроби до 1,09 долара — менше 40% від вартості Fable 5, продемонструвавши чудову співвідношення вартості та ефективності. Дані тестування також виявили компроміси між ціною та продуктивністю різних моделей. Китайські моделі Kimi K2.6 та GLM 5.1 мають схожий рівень вирішення — 72,5% і 71,25% відповідно, але середня вартість Kimi K2.6 становить 0,69 долара — на 34% дешевше, ніж у GLM 5.1. Серед легковагових моделей GPT-5.4 Mini посідає перше місце з рівнем вирішення 58,75%, що на 10 процентних пунктів вище за Claude Haiku 4.5, при цьому середня вартість та кількість кроків зменшені майже удвічі. Ramp зазначив, що з переходом моделей до практичного застосування компроміси між продуктивністю, швидкістю та вартістю стають ключовим фактором при їхньому внедренні. (Джерело: BlockBeats)
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.