OpenAI ने GPT-6 Astra मूल्यांकन डेटा को समायोजित किया, जिससे पारदर्शिता के मुद्दे उठे

icon MarsBit
साझा करें
AI summary iconसारांश
रिपोर्ट्स के अनुसार, OpenAI ने GPT-6 Astra के मूल्यांकन डेटा में बदलाव किया है, जिससे पारदर्शिता के बारे में चिंताएँ उठी हैं। Astra की हॉलूसिनेशन दर 4.2% से घटकर 2% हो गई, जबकि Anthropic और GPT-5.6 Sol जैसे प्रतिद्वंद्वीयों के गणित स्कोर में कमी आई। OpenAI का कहना है कि ये बदलाव सटीक प्रदर्शन को दर्शाते हैं, लेकिन स्टैनफोर्ड के शोधकर्ता "बेंचमैक्सिंग" की चेतावनी देते हैं। बाजार में हो रहे बदलाव के साथ, अल्टकॉइन जिन्हें देखने की आवश्यकता है, उनमें रुचि बढ़ रही है, जिससे विश्वसनीय डेटा का महत्व बना रहता है। मुद्रास्फीति डेटा के प्रवृत्ति भी AI और क्रिप्टो सेक्टर में स्पष्ट, पुनरुत्पादनयोग्य बेंचमार्क की आवश्यकता पर प्रकाश डालते हैं।

देखें Beating AI न्यूज़, OpenAI ने 3 सितंबर को GPT-6 Astra लॉन्च करने के बाद से कई मॉडल आकलन बेंचमार्क डेटा को लगातार समायोजित किया है, जिसमें कुछ संशोधनों से Astra का प्रदर्शन बेहतर हुआ है, जबकि कुछ प्रतिद्वंद्वी मॉडल्स के स्कोर गिरे हैं, जिससे AI के "बेंचमार्क फ्रॉड" और आकलन पारदर्शिता के बारे में सवाल उठे हैं। इसमें, Astra की हॉलूसिनेशन दर 4.2% से घटाकर 2% कर दी गई, GPT-5.6 Sol की 12.2% से 9.4% कर दी गई, लेकिन बाद में दोनों को फिर से 4.2% और 12.2% पर वापस कर दिया गया। गणितीय आकलन में, Anthropic के Fable 5.1 का स्कोर 87.8% से घटाकर 78% कर दिया गया, जो अब 83% पर वापस आ गया है; GPT-5.6 Sol का स्कोर 83% से 80.5% तक गिरा, लेकिन फिर 83% पर वापस आ गया। इसके अलावा, Astra का ARC-AGI-3 आकलन में प्रारंभिक प्रोजेक्ट पेज पर 98.6% से अंतिम पेज पर 99.99% तक सुधार किया गया, और प्रोग्रामिंग आकलन स्कोर 57.7% से 57.9% तक हल्का बढ़ाया गया। OpenAI ने कहा कि आकलन परिणाम मॉडल संस्करण, टूल कॉन्फ़िगरेशन, इनफ़रेंस स्तर और परीक्षण रन सहित कई कारकों से प्रभावित होते हैं, और इन समायोजनों का मकसद मॉडल के सर्वोत्तम प्रदर्शन को सटीकता से प्रतिबिंबित करना है। हालाँकि, स्टैनफोर्ड विश्वविद्यालय के शोधकर्ता मानते हैं कि आकलन को बार-बार चलाने में "Benchmaxxing" का मुद्दा हो सकता है, यानी परीक्षण परिस्थितियों को समायोजित करके बेंचमार्क स्कोर को अधिकतम करना। उद्योगविदों का मानना है कि AI मॉडल प्रतिस्पर्धा के कड़े होते ही, आकलन डेटा मॉडल की क्षमता के मापने और बाज़ार में प्रतिस्पर्धा के महत्वपूर्ण साधन बनते हैं, और बेंचमार्क परीक्षणों की पारदर्शिता और पुन:उत्पादनयोग्यता में सुधार पर हमेशा से अधिक ध्यान केंद्रित हो रहा है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।