OpenScience ने Terminal-Bench Science पर 75.7% का स्कोर प्राप्त किया, जो Codex को पीछे छोड़ दिया

iconKuCoinFlash
साझा करें
AI summary iconसारांश
OpenScience, Y Combinator 2026 विंटर बैच के स्टार्टअप Synthetic Sciences का एक अनुसंधान एजेंट, Terminal-Bench Science पर 75.7% स्कोर करके Codex को पीछे छोड़ दिया। यह टूल प्रयोगों को स्वचालित करता है, कोड लिखता है और वैज्ञानिक डेटाबेस का उपयोग करता है। इसकी Autoresearch सुविधा आवर्ती परीक्षण की अनुमति देती है। ऑन-चेन समाचारों से पता चलता है कि AI-संचालित अनुसंधान टूल्स में रुचि बढ़ रही है। मुद्रास्फीति डेटा विनिमय बाजार में मैक्रो ट्रेंड्स का पालन करने वाले निवेशकों के लिए एक प्रमुख मापदंड बना हुआ है।
ME AI संदेश, Y Combinator 2026 विंटर बैच (YC W26) कंपनी Synthetic Sciences ने ओपन सोर्स रिसर्च Agent OpenScience का आधिकारिक रूप से लॉन्च किया है। यह पेपर खोजने, डेटा प्रोसेस करने, कोड लिखने और रिसर्च डेटाबेस को कॉल करने में सक्षम है, और नए जोड़े गए Autoresearch सुविधा के साथ AI स्वयं लगातार प्रयोग चला सकता है। उदाहरण के लिए, एक मॉडल ट्रेन करते समय, शोधकर्ता को सिर्फ यह बताना होगा कि “वैलिडेशन सेट का loss कम करो।” OpenScience पहले बेसलाइन चलाएगा, फिर स्वयं सुधार के लिए प्रस्ताव बनाएगा, और एक-एक करके प्रयोग करेगा। अगर परिणाम सुधरते हैं, तो उन्हें बरकरार रखा जाएगा, अगर खराब होते हैं, तो पिछली स्थिति में वापस जाया जाएगा, और पिछले परिणामों के आधार पर अगला प्रयास निर्धारित किया जाएगा। उपयोगकर्ता पहले से ही चलाने की संख्या, कुल समय और रुकने की स्थिति को सीमित कर सकते हैं, या “अब केवल ऑप्टिमाइज़र में ही बदलाव करो” जैसा निर्देश दे सकते हैं। OpenScience, जिसमें शोधकर्ताओं को पहले बार-बार मॉनिटर करना पड़ता था, उस प्रक्रिया को स्वचालित करता है: प्रस्ताव बनाना, प्रयोग करना, मीट्रिक्स की तुलना करना, असफल प्रस्तावों को हटाना, और अगली पाली में आगे बढ़ना। प्रयोग स्थानीय रूप से चलाए जा सकते हैं, या रिमोट GPU, SSH सर्वर, और Slurm/PBS क्लस्टर पर सौंपे जा सकते हैं। हर प्रयोग के कोड, परिणाम, और मूल्यांकन की सभी प्रतिलिपि संग्रहित होती हैं, जिससे बाद में जाँच करने में सुविधा होती है। इसके साथ ही, ChatGPT/Codex सब्सक्रिप्शन में सीधे प्रवेश की सुविधा है, साथ ही अपनी API कुंजी, स्थानीय मॉडल, या आधिकारिक पेपर-पर-यूज़ Ace का उपयोग किया जा सकता है। आधिकारिक परीक्षण में, OpenScience ने 70 Terminal-Bench Science कार्यों में से 53 पूरे किए, 75.7% स्कोर प्राप्त किया। इसकी तुलना में, Codex + GPT-6 Astra का प्रकाशित स्कोर 68.1% है। (स्रोत: BlockBeats)
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।