Ramp SWE-Bench बेंचमार्क: क्लॉड फेबल 5 87.5% सफलता दर के साथ शीर्ष पर

iconKuCoinFlash
साझा करें
AI summary iconसारांश
रैंप, एक फिनटेक यूनिकॉर्न, ने अपना SWE-Bench बेंचमार्क एआई कोडिंग एजेंट्स के लिए जारी किया है, जिसमें वास्तविक उत्पादन वातावरणों से 80 बैकएंड कार्य शामिल हैं। एंथ्रोपिक के क्लॉड फेबल 5 ने 14 मॉडल्स में सबसे अधिक 87.5% स्कोर प्राप्त किया। एआई + क्रिप्टो समाचार में क्लॉड ओपस 4.8 की लागत कुशलता $1.09 प्रति रन के साथ उल्लेखनीय है। घरेलू मॉडल्स किमी K2.6 और GLM 5.1 क्रमशः 72.5% और 71.25% पर आगे रहे। हल्के मॉडल्स में GPT-5.4 Mini ने 58.75% स्कोर के साथ नेतृत्व किया। रैंप ने बताया कि प्रदर्शन, गति और लागत में व्यापार करना प्रस्तुति के लिए महत्वपूर्ण है। ब्याज दर समाचार व्यापारियों के लिए अलग केंद्र है।
ME AI संदेश, डिनामिक चेक द्वारा मॉनिटर किए जाने पर, फिनटेक यूनिकॉर्न Ramp ने उन्नत AI कोडिंग एजेंट के लिए निजी टेस्ट बेंचमार्क Ramp SWE-Bench जारी किया है। Ramp SWE-Bench में Ramp के वास्तविक उत्पादन पर्यावरण से लिए गए 80 बैकएंड डेवलपमेंट कार्य शामिल हैं, जो सार्वजनिक मूल्यांकन डेटासेट में मॉडल प्री-ट्रेनिंग के कारण होने वाली डेटा लीकेज और मेट्रिक सैचुरेशन की समस्या को हल करने के लिए बनाए गए हैं। सभी परीक्षण कार्य Ramp के आंतरिक AI कोडिंग सहायक Inspect द्वारा उत्पादन पर्यावरण में सफलतापूर्वक डिप्लॉय किए गए वास्तविक पुल रिक्वेस्ट (PR) से निकाले गए हैं। प्रत्येक कार्य में PR कमिट से पहले की मूल कोडबेस को पुनर्गठित किया गया है, संयोजित कोड और परीक्षण को स्वर्ण मानक के रूप में संरक्षित किया गया है, और Inspect डायलॉग में इंजीनियर के मूल इरादे को प्रॉम्प्ट के रूप में निकाला गया है। मूल्यांकन mini-swe-agent सैंडबॉक्स पर्यावरण में किया गया है, जहाँ सभी परीक्षणों को एकल चलाने में सफलतापूर्वक पास करना और मौजूदा कार्यक्षमता को नुकसान पहुँचाए बिना (pass@1) पास मानदंड है। प्रकाशित 14 मॉडलों की समीक्षा के अनुसार, Anthropic द्वारा हाल ही में लॉन्च किया गया Claude Fable 5 87.5% समाधान दर के साथ शीर्ष पर है। Claude Opus 4.7 और GPT-5.5 दोनों 83.75% समाधान दर के साथ दूसरे स्थान पर हैं। Claude Opus 4.8 की समाधान दर 77.5% है, लेकिन प्रति कार्य औसत चलाने का समय 8 मिनट 30 सेकंड तक सीमित है, और प्रति चलाने की लागत केवल 1.09 डॉलर है, जो Fable 5 की लागत से 40% से कम है, जो इसे अत्यधिक लागत-कुशल बनाता है। परीक्षण डेटा में मॉडलों के मूल्य और प्रदर्शन के बीच समझौते का पता चलता है। भारतीय मॉडल Kimi K2.6 और GLM 5.1 की समाधान दर 72.5% और 71.25% है, क्रमशः, लेकिन Kimi K2.6 की औसत लागत 0.69 डॉलर है, जो GLM 5.1 से लगभग 34% सस्ती है। हल्के मॉडल में, GPT-5.4 Mini 58.75% समाधान दर के साथ Claude Haiku 4.5 से 10 प्रतिशत प्रति-अंकों से आगे है, और औसत लागत और कदमों की संख्या में 50% कमी हुई है। Ramp का कहना है कि मॉडलों के प्रयोग में, प्रदर्शन, गति और लागत के समझौते प्रोजेक्ट प्रयोग में महत्वपूर्ण मुद्दे बनते हैं। (स्रोत: BlockBeats)
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।