Ramp SWE-Bench Benchmark: Claude Fable 5 лидирует с показателем успешности 87,5%

iconKuCoinFlash
Поделиться
AI summary iconСводка
Ramp, финтех-уникорн, выпустила эталон SWE-Bench для ИИ-агентов в области программирования, включающий 80 задач из реальных производственных сред. Модель Claude Fable 5 от Anthropic показала результат 87,5% — самый высокий среди 14 моделей. В новостях об ИИ и криптовалюте подчеркивается эффективность стоимости Claude Opus 4.8 — 1,09 доллара за запуск. Отечественные модели Kimi K2.6 и GLM 5.1 заняли второе и третье места с результатами 72,5% и 71,25% соответственно. Легковесная модель GPT-5.4 Mini возглавила этот сегмент с результатом 58,75%. Ramp отметила, что компромиссы между производительностью, скоростью и стоимостью являются ключевыми при внедрении. Новости об процентных ставках остаются отдельным приоритетом для трейдеров.
ME AI Сообщение, согласно мониторингу Beating, финтех-уникорн Ramp выпустил частный тестовый набор для передовых AI-кодирующих агентов — Ramp SWE-Bench. Ramp SWE-Bench включает 80 задач по бэкенд-разработке, взятых из реальных производственных сред Ramp, и направлен на решение проблем утечки данных и насыщения метрик, вызванных предварительным обучением моделей в публичных наборах данных. Все тестовые задачи извлечены из реальных pull-запросов (PR), успешно развернутых в производственной среде с помощью внутреннего AI-кодирующего помощника Ramp Inspect. Каждая задача воссоздает базовую кодовую базу до коммита PR, сохраняя объединенный код и тесты в качестве золотого стандарта, а также извлекает первоначальные намерения инженеров из диалогов Inspect в качестве промптов. Оценка проводится в песочнице mini-swe-agent, где прохождение считается успешным при однократном запуске, при котором все тесты пройдены, а существующие функции не нарушены (pass@1). Согласно опубликованным результатам сравнительной оценки 14 моделей, новейшая модель Anthropic Claude Fable 5 лидирует с показателем решения 87,5%. Claude Opus 4.7 и GPT-5.5 разделили второе место с показателем решения 83,75%. Хотя Claude Opus 4.8 имеет показатель решения 77,5%, среднее время выполнения одной задачи сокращено до 8 минут 30 секунд, а стоимость одного запуска составляет всего 1,09 доллара США — менее 40% от стоимости Fable 5, что демонстрирует отличную соотношение цены и производительности. Данные теста также выявили компромиссы между стоимостью и производительностью различных моделей. Китайские модели Kimi K2.6 и GLM 5.1 показали схожие результаты по решению — 72,5% и 71,25% соответственно, однако средняя стоимость Kimi K2.6 составляет 0,69 доллара США, что на 34% дешевле, чем у GLM 5.1. Среди легковесных моделей GPT-5.4 Mini лидирует с показателем решения 58,75%, опережая Claude Haiku 4.5 примерно на 10 процентных пунктов, при этом средняя стоимость и количество шагов уменьшены вдвое. Ramp отмечает, что по мере перехода моделей к практическому применению компромисс между производительностью, скоростью и стоимостью становится ключевым фактором при инженерной реализации. (Источник: BlockBeats)
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.