Ramp SWE-Bench 基準測試:Claude Fable 5 以 87.5% 成功率位居榜首

iconKuCoinFlash
分享
AI summary icon精華摘要
Ramp 這家金融科技 unicorns 已發布其 SWE-Bench 基準測試,用於 AI 編碼代理,包含 80 個來自真實生產環境的後端任務。Anthropic 的 Claude Fable 5 得分為 87.5%,在 14 個模型中排名第一。AI + 加密貨幣新聞焦點為 Claude Opus 4.8 的成本效益,每運行一次僅需 $1.09。國內模型 Kimi K2.6 和 GLM 5.1 分別以 72.5% 和 71.25% 緊隨其後。GPT-5.4 Mini 在輕量級模型中領先,得分为 58.75%。Ramp 指出,性能、速度與成本之間的取捨是部署的關鍵。利率新聞對交易者而言仍為獨立關注焦點。
ME AI 消息,據動察 Beating 監測,金融科技獨角獸 Ramp 發布了針對前沿 AI 編碼智能體的私有測試基準 Ramp SWE-Bench。Ramp SWE-Bench 包含 80 個源自 Ramp 真實生產環境的後端開發任務,旨在解決公共評估數據集因模型預訓練而導致的數據洩露與指標飽和問題。測試任務均提取自 Ramp 內部 AI 編碼助手 Inspect 成功部署到生產環境的真實拉取請求(PR)。每個任務重構了 PR 提交前的基礎代碼庫,保留合併的代碼與測試作為黃金標準,並提取工程師在 Inspect 對話中的原始意圖作為提示詞。評估採用 mini-swe-agent 沙箱環境,以單次運行成功通過所有測試且不破壞現有功能(pass@1)作為通過標準。根據公布的 14 款模型橫向評測結果,Anthropic 最新推出的 Claude Fable 5 以 87.5% 的解決率高居榜首。Claude Opus 4.7 和 GPT-5.5 並列第二,解決率均為 83.75%。Claude Opus 4.8 雖然解決率為 77.5%,但單次任務平均運行時間縮短至 8 分 30 秒,單次運行成本僅為 1.09 美元,不足 Fable 5 運行成本的 40%,展現出極佳的成本效益。測試數據還揭示了不同模型在價格與性能間的權衡。國產模型 Kimi K2.6 與 GLM 5.1 解決率相近,分別為 72.5% 與 71.25%,但 Kimi K2.6 的平均成本為 0.69 美元,比 GLM 5.1 貴約 34%。在輕量級模型中,GPT-5.4 Mini 以 58.75% 的解決率領先 Claude Haiku 4.5 約 10 個百分點,且平均成本和步驟數均減半。Ramp 指出,隨著模型走向應用,性能、速度與成本的權衡正成為工程落地時的關鍵考量。(來源:BlockBeats)
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露