Ramp SWE-Bench 基準測試:Claude Fable 5 以 87.5% 成功率位居榜首
KuCoinFlash分享
Ramp 這家金融科技 unicorns 已發布其 SWE-Bench 基準測試,用於 AI 編碼代理,包含 80 個來自真實生產環境的後端任務。Anthropic 的 Claude Fable 5 得分為 87.5%,在 14 個模型中排名第一。AI + 加密貨幣新聞焦點為 Claude Opus 4.8 的成本效益,每運行一次僅需 $1.09。國內模型 Kimi K2.6 和 GLM 5.1 分別以 72.5% 和 71.25% 緊隨其後。GPT-5.4 Mini 在輕量級模型中領先,得分为 58.75%。Ramp 指出,性能、速度與成本之間的取捨是部署的關鍵。利率新聞對交易者而言仍為獨立關注焦點。
來源:顯示原文
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。
虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。