Ramp SWE-Bench Benchmark: Claude Fable 5 Unggul dengan Tingkat Keberhasilan 87,5%

iconKuCoinFlash
Bagikan
AI summary iconRingkasan
Ramp, sebuah unicorn fintech, telah merilis benchmark SWE-Bench untuk agen pengkodean AI, yang mencakup 80 tugas backend dari lingkungan produksi nyata. Claude Fable 5 dari Anthropic mendapat skor 87,5%, tertinggi di antara 14 model. Berita AI + crypto menyoroti efisiensi biaya Claude Opus 4.8 sebesar $1,09 per operasi. Model domestik Kimi K2.6 dan GLM 5.1 mengikuti dengan skor 72,5% dan 71,25%. GPT-5.4 Mini memimpin model ringan dengan skor 58,75%. Ramp mencatat bahwa trade-off antara kinerja, kecepatan, dan biaya merupakan faktor kunci untuk peluncuran. Berita suku bunga tetap menjadi fokus terpisah bagi trader.
ME AI Berita, menurut pemantauan Beating, unicorn fintech Ramp meluncurkan benchmark privat untuk agen pemrograman AI mutakhir, Ramp SWE-Bench. Ramp SWE-Bench mencakup 80 tugas pengembangan backend yang berasal dari lingkungan produksi nyata Ramp, dirancang untuk mengatasi masalah kebocoran data dan saturasi metrik akibat pelatihan awal model pada kumpulan data evaluasi publik. Tugas-tugas evaluasi diambil dari pull request (PR) nyata yang berhasil dideploy ke lingkungan produksi oleh asisten pemrograman AI internal Ramp, Inspect. Setiap tugas merekonstruksi basis kode sebelum commit PR, mempertahankan kode dan pengujian yang digabungkan sebagai standar emas, serta mengekstrak niat asli insinyur dalam percakapan Inspect sebagai petunjuk. Evaluasi dilakukan di lingkungan sandbox mini-swe-agent, dengan kriteria lulus berdasarkan keberhasilan melewati semua pengujian dalam satu kali eksekusi tanpa merusak fungsionalitas yang ada (pass@1). Berdasarkan hasil evaluasi横向 terhadap 14 model yang dirilis, Claude Fable 5 terbaru dari Anthropic memimpin dengan tingkat penyelesaian 87,5%. Claude Opus 4.7 dan GPT-5.5 berada di posisi kedua, masing-masing dengan tingkat penyelesaian 83,75%. Meskipun Claude Opus 4.8 memiliki tingkat penyelesaian 77,5%, waktu rata-rata eksekusi per tugas diperpendek menjadi 8 menit 30 detik, dengan biaya per eksekusi hanya $1,09, kurang dari 40% biaya Fable 5, menunjukkan efisiensi biaya yang sangat baik. Data evaluasi juga mengungkapkan trade-off antara harga dan kinerja di berbagai model. Model lokal Kimi K2.6 dan GLM 5.1 memiliki tingkat penyelesaian yang serupa, masing-masing 72,5% dan 71,25%, namun biaya rata-rata Kimi K2.6 sebesar $0,69, 34% lebih murah dibanding GLM 5.1. Di antara model ringan, GPT-5.4 Mini memimpin dengan tingkat penyelesaian 58,75%, unggul sekitar 10 poin persentase dibanding Claude Haiku 4.5, dengan biaya rata-rata dan jumlah langkah yang setengahnya. Ramp menunjukkan bahwa seiring model semakin diterapkan, trade-off antara kinerja, kecepatan, dan biaya menjadi pertimbangan kunci dalam implementasi teknis. (Sumber: BlockBeats)
Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.