Ramp SWE-Bench Benchmark: Nagtatapos si Claude Fable 5 bilang numero uno na may 87.5% na rate ng tagumpay

iconKuCoinFlash
I-share
AI summary iconSummary
Ramp, isang fintech unicorn, ay naglabas ng kanyang SWE-Bench benchmark para sa AI coding agents, na naglalaman ng 80 backend tasks mula sa mga tunay na production environment. Ang Claude Fable 5 ng Anthropic ay nakakuha ng 87.5%, ang pinakamataas sa 14 na modelo. Ang AI + crypto news ay nagpapakita ng cost efficiency ni Claude Opus 4.8 sa $1.09 bawat pagpapatakbo. Ang mga lokal na modelo na Kimi K2.6 at GLM 5.1 ay sumunod na may 72.5% at 71.25%. Ang GPT-5.4 Mini ang nangunguna sa mga lightweight model na may 58.75%. Tiniyak ni Ramp na ang mga trade-off sa performance, speed, at cost ay mahalaga para sa deployment. Ang balita tungkol sa interest rate ay nananatiling hiwalay na fokus para sa mga trader.
ME AI mensahe, ayon sa pagmamasid ng Beating, ang fintech unicorn na Ramp ay naglabas ng pribadong benchmark para sa mga advanced AI coding agent na tinatawag na Ramp SWE-Bench. Ang Ramp SWE-Bench ay naglalaman ng 80 na backend development task na batay sa totoong production environment ng Ramp, na layuning lutasin ang data leakage at metric saturation sa public evaluation datasets dulot ng model pre-training. Ang bawat task ay kinuha mula sa totoong pull requests (PR) na matagumpay nang i-deploy sa production ng internal AI coding assistant ng Ramp na Inspect. Bawat task ay binago ang base codebase bago ang PR submission, pinanatili ang merged code at tests bilang golden standard, at kinuha ang orihinal na intensyon ng engineer mula sa Inspect dialogue bilang prompt. Ang pag-evaluate ay ginawa sa mini-swe-agent sandbox environment, kung saan ang passing criterion ay ang pagkakaroon ng isang single run na nakapasa sa lahat ng tests nang hindi nasira ang umiiral na functionality (pass@1). Ayon sa mga resulta ng pagsusuri sa 14 na model, ang pinakabagong inilabas ni Anthropic na Claude Fable 5 ay nasa unang lugar na may 87.5% success rate. Ang Claude Opus 4.7 at GPT-5.5 ay nagkakasundo sa pangalawang lugar, parehong may 83.75% success rate. Bagaman ang Claude Opus 4.8 ay may 77.5% success rate, ang average runtime nito ay nabawasan sa 8 minuto at 30 segundo, at ang cost bawat run ay lamang $1.09, mas mababa kaysa 40% ng cost ng Fable 5, na nagpapakita ng napakabuting cost-efficiency. Ang test data ay nagpapakita rin ng trade-off sa pagitan ng presyo at performance. Ang lokal na model na Kimi K2.6 at GLM 5.1 ay may malapit na success rate na 72.5% at 71.25%, ngunit ang average cost ni Kimi K2.6 ay $0.69, mas mura ng halos 34% kaysa kay GLM 5.1. Sa mga lightweight model, ang GPT-5.4 Mini ay nangunguna na may 58.75% success rate, 10 puntos mas mataas kaysa kay Claude Haiku 4.5, at may halos kalahating average cost at steps. Ipinahiwatig ni Ramp na habang lumalago ang paggamit ng mga model, ang trade-off sa performance, speed, at cost ay naging mahalagang pag-iisip sa pagpapatupad sa engineering. (Source: BlockBeats)
Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.