Ramp SWE-Bench Benchmark: Claude Fable 5 memimpin dengan kadar kejayaan 87.5%

iconKuCoinFlash
Kongsi
AI summary iconRingkasan
Ramp, sebuah unicorn fintech, telah melancarkan tolok ukur SWE-Bench untuk agen pengkodean AI, yang menampilkan 80 tugas backend dari persekitaran pengeluaran sebenar. Claude Fable 5 daripada Anthropic mencapai 87.5%, tertinggi di antara 14 model. Berita AI + kripto menonjolkan kecekapan kos Claude Opus 4.8 pada $1.09 setiap larian. Model tempatan Kimi K2.6 dan GLM 5.1 mengikuti dengan 72.5% dan 71.25%. GPT-5.4 Mini memimpin model ringan dengan 58.75%. Ramp mencatat bahawa kompromi dalam prestasi, kelajuan, dan kos adalah kunci untuk pelaksanaan. Berita kadar faedah tetap menjadi fokus berasingan untuk pedagang.
ME AI mesej, menurut pemantauan Beating, unicorn fintech Ramp telah mengumumkan benchmark privasi khusus untuk agen pengkodean AI mutakhir, Ramp SWE-Bench. Ramp SWE-Bench mengandungi 80 tugas pembangunan belakang yang diambil dari persekitaran pengeluaran sebenar Ramp, bertujuan untuk menyelesaikan masalah kebocoran data dan kejenuhan metrik akibat latihan pra-model pada set data penilaian awam. Tugas-tugas ujian diambil daripada permintaan tarik (PR) sebenar yang berjaya dideploy ke persekitaran pengeluaran oleh asisten pengkodean AI dalaman Ramp, Inspect. Setiap tugas membina semula pangkalan kod sebelum PR disatukan, mengekalkan kod dan ujian yang disatukan sebagai piawai emas, serta mengekstrak niat asal jurutera dalam perbualan Inspect sebagai petunjuk. Penilaian dilakukan dalam persekitaran sandbox mini-swe-agent, dengan keberhasilan diukur berdasarkan kejayaan lulus semua ujian dalam satu percubaan tanpa merosakkan fungsi sedia ada (pass@1). Berdasarkan perbandingan 14 model yang dipaparkan, Claude Fable 5 terbaru dari Anthropic memimpin dengan kadar penyelesaian 87.5%. Claude Opus 4.7 dan GPT-5.5 berada di tempat kedua secara bersama-sama dengan kadar penyelesaian masing-masing 83.75%. Walaupun Claude Opus 4.8 mempunyai kadar penyelesaian 77.5%, masa purata satu percubaan dipersingkat kepada 8 minit 30 saat, dengan kos satu percubaan hanya $1.09, kurang daripada 40% kos Fable 5, menunjukkan kecekapan kos yang sangat baik. Data ujian juga mengungkapkan kompromi antara harga dan prestasi di antara pelbagai model. Model tempatan Kimi K2.6 dan GLM 5.1 mempunyai kadar penyelesaian yang serupa, masing-masing 72.5% dan 71.25%, tetapi kos purata Kimi K2.6 ialah $0.69, 34% lebih murah berbanding GLM 5.1. Dalam kalangan model ringan, GPT-5.4 Mini memimpin dengan kadar penyelesaian 58.75%, unggul sebanyak 10 peratus daripada Claude Haiku 4.5, dengan kos dan bilangan langkah purata separuhnya. Ramp menekankan bahawa seiring model semakin diterapkan, kompromi antara prestasi, kelajuan, dan kos menjadi pertimbangan utama dalam pelaksanaan kejuruteraan. (Sumber: BlockBeats)
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.