Ramp SWE-Benchベンチマーク:Claude Fable 5が87.5%の成功率で首位

iconKuCoinFlash
共有
AI summary icon概要
フィンテックユニコーンのRampが、実際の本番環境からの80のバックエンドタスクを含むSWE-Benchベンチマークをリリースしました。AnthropicのClaude Fable 5は14モデル中最高の87.5%を記録しました。AIと暗号通貨のニュースでは、Claude Opus 4.8の1回の実行コストが1.09ドルと効率性が注目されています。国内モデルのKimi K2.6とGLM 5.1はそれぞれ72.5%、71.25%を記録しました。軽量モデルではGPT-5.4 Miniが58.75%でトップでした。Rampは、パフォーマンス、速度、コストのトレードオフが導入に不可欠であると指摘しています。金利ニュースはトレーダーにとって引き続き別途注目されています。
ME AI ニュース、動察 Beating の監視によると、フィンテックユニコーンのRampは、最先端のAIコーディングエージェント向けのプライベートベンチマーク「Ramp SWE-Bench」を公開しました。Ramp SWE-Benchは、Rampの本番環境から抽出した80のバックエンド開発タスクを含み、公開評価データセットにおけるモデルの事前学習によるデータリークと指標飽和の問題を解決することを目的としています。テストタスクは、Rampの内部AIコーディングアシスタント「Inspect」が本番環境に正常にデプロイされた実際のプルリクエスト(PR)から抽出されています。各タスクは、PRのコミット前のベースコードベースを再構築し、マージされたコードとテストをゴールデンスタンダードとして保持し、エンジニアがInspectの対話で示した元の意図をプロンプトとして抽出しています。評価はmini-swe-agentサンドボックス環境で実施され、単一の実行ですべてのテストに合格し、既存の機能を破壊しない(pass@1)ことを合格基準としています。公開された14モデルの横断的評価結果によると、Anthropicが最新リリースしたClaude Fable 5が87.5%の解決率で首位を独走しました。Claude Opus 4.7とGPT-5.5はいずれも83.75%の解決率で並んで2位となりました。Claude Opus 4.8の解決率は77.5%ですが、単一タスクあたりの平均実行時間が8分30秒に短縮され、単一実行コストは1.09ドルと、Fable 5のコストの40%未満であり、極めて優れたコストパフォーマンスを示しています。テストデータは、価格と性能間のトレードオフについても明らかにしています。中国製モデルのKimi K2.6とGLM 5.1の解決率はそれぞれ72.5%と71.25%でほぼ同等ですが、Kimi K2.6の平均コストは0.69ドルで、GLM 5.1より約34%安くなっています。軽量モデルでは、GPT-5.4 Miniが58.75%の解決率でClaude Haiku 4.5を約10ポイント上回り、平均コストとステップ数も半分以下に抑えています。Rampは、モデルが実用化されるにあたり、性能・速度・コストのトレードオフがエンジニアリング実装における重要な考慮事項となっていると指摘しています。(出典:BlockBeats)
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。