Ramp SWE-Bench Başarı Testi: Claude Fable 5, %87,5 başarı oranı ile birinci oldu

iconKuCoinFlash
Paylaş
AI summary iconÖzet
Ramp, bir fintech ünicornu, 80 gerçek üretim ortamından alınan arka uç görevi içeren SWE-Bench benchmarkini yayınladı. Anthropic’ın Claude Fable 5, 14 model arasında %87,5 ile en yüksek puanı aldı. AI + kripto haberlerinde Claude Opus 4.8’in her çalıştırmada 1,09 dolarlık maliyet verimliliği vurgulandı. Yerel modeller Kimi K2.6 ve GLM 5.1 sırasıyla %72,5 ve %71,25 puan aldı. Hafif modeller arasında GPT-5.4 Mini %58,75 ile öne çıktı. Ramp, performans, hız ve maliyet arasında dengelerin dağıtım için kilit olduğunu belirtti. Faiz oranları haberleri, traderlar için ayrı bir odak noktasını korumaya devam ediyor.
ME AI Haberi, Beating İzleme’ye göre, finansal teknoloji üniverstesi Ramp, öncü AI kodlama ajanları için özel bir test benchmark’ı olan Ramp SWE-Bench’i duyurdu. Ramp SWE-Bench, Ramp’in gerçek üretim ortamından alınan 80 adet arka uç geliştirme görevini içeriyor ve model ön-eğitimi nedeniyle ortaya çıkan veri sızıntısı ve metrik doygunluğu sorunlarını çözmeyi amaçlıyor. Test görevleri, Ramp’in dahili AI kodlama asistanı Inspect’in üretim ortamına başarıyla dağıtılmış gerçek çekme isteklerinden (PR) çıkarıldı. Her bir görev, PR gönderiminden önceki temel kod tabanını yeniden yapılandırdı, birleştirilen kod ve testleri altın standart olarak korudu ve mühendislerin Inspect diyalogundaki orijinal niyetlerini ipucu olarak çıkardı. Değerlendirme, mini-swe-agent kum havuzu ortamında gerçekleştirilir ve tüm testleri tek seferde başarıyla geçip mevcut işlevleri bozmayan (pass@1) durum geçiş kriteri olarak kabul edilir. Yayınlanan 14 modelin karşılaştırmalı değerlendirmesine göre, Anthropic’in en yeni modeli Claude Fable 5, %87,5 çözme oranı ile birinci sırada yer aldı. Claude Opus 4.7 ve GPT-5.5, her ikisi de %83,75 çözme oranı ile ikinci sırada yer aldı. Claude Opus 4.8’in çözme oranı %77,5 olsa da, ortalama tek seferlik çalışma süresi 8 dakika 30 saniyeye indi ve tek seferlik maliyeti yalnızca 1,09 dolar olup, Fable 5’in maliyetinin %40’ından azdır ve bu da son derece iyi bir maliyet-verimlilik sunmaktadır. Test verileri ayrıca farklı modeller arasında fiyat ve performans dengesinin açıkça ortaya çıktığını göstermektedir. Yerel modeller Kimi K2.6 ve GLM 5.1’in çözme oranları sırasıyla %72,5 ve %71,25 olmak üzere benzer seviyede olup, Kimi K2.6’nın ortalama maliyeti 0,69 dolar olup GLM 5.1’den yaklaşık %34 daha ucuzdur. Hafif modeller arasında, GPT-5.4 Mini %58,75 çözme oranı ile Claude Haiku 4.5’i yaklaşık 10 puan önde tutarken, ortalama maliyet ve adım sayısı da yarıya inmiştir. Ramp, modellerin uygulamaya geçiş sürecinde performans, hız ve maliyet dengesinin mühendislik uygulamalarında kritik bir faktör haline geldiğini belirtmektedir. (Kaynak: BlockBeats)
Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.