OpenAI का नवीनतम तर्क मॉडल, GPT-6 Astra, 3 सितंबर को लॉन्च हुआ, जिसने FrontierMath Tier 4 (v2) पर 97.6% स्कोर प्राप्त किया। यह वह प्रकार का नंबर है जो आपको दोबारा देखने पर मजबूर कर देता है, खासकर जब आपको पता चलता है कि मॉडल का एक पिछला आंतरिक संस्करण गणित क्षमता मूल्यांकन पर केवल 17% ही प्राप्त कर पाया था।
17% से 47% तक का आंतरिक अनुक्रम, और फिर सार्वजनिक बेंचमार्क पर लगभग परिपूर्णता तक, सामान्यतः वर्षों की प्रगति को एक ही विकास चक्र में संकुचित कर देता है।
बेंचमार्क ब्लिट्ज
ARC-AGI-3 पर, OpenAI के अपने मूल्यांकन हार्नेस के भीतर मापा गया, एस्ट्रा ने 99.9% स्कोर प्राप्त किया। ExploitBench पर, इसने एक आदर्श 100% प्राप्त किया। GPQA Diamond, एक स्नातक स्तरीय विज्ञान तर्क परीक्षण, 96.0% पर रहा। Terminal-Bench Science 0.1 ने 64.6% स्कोर प्राप्त किया।
हालाँकि, फ्रंटियरमैथ टियर 4 (v2) परिणाम मुख्य संख्या है। GPT-5.6 Sol, एस्ट्रा का पूर्ववर्ती, इसी बेंचमार्क पर 83.0% अंक प्राप्त करता है। एस्ट्रा का 97.6% 14.6 प्रतिशत अंकों के सुधार को दर्शाता है।
17% से विश्व स्तरीय
एक्सट्रा बनने वाले मॉडल के प्रारंभिक संस्करणों ने गणित क्षमता मूल्यांकनों पर लगभग 17% का प्रदर्शन किया। आवर्ती सुधारों के माध्यम से, यह संख्या जब तक सार्वजनिक रिलीज के लिए मॉडल को और अधिक सुधारा गया, तब तक लगभग 47% तक पहुँच गई।
OpenAI ने अस्त्रा को प्राइम अंतरालों पर नए दृष्टिकोण देने के लिए भी सम्मानित किया है, जो संख्या सिद्धांत का एक दुर्जेय क्षेत्र है जिस पर शताब्दियों से मानव गणितज्ञ काम कर रहे हैं।
किसे पहुंच मिलती है, और कब
एस्ट्रा का रोलआउट चरणबद्ध दृष्टिकोण के साथ हुआ। लॉन्च दिन पर कुछ चयनित संगठनों को पहले पहुंच प्राप्त हुई, और तुरंत बाद इसकी व्यापक उपलब्धता ChatGPT Plus, Pro, Business और Enterprise सदस्यों तक विस्तारित कर दी गई। API पहुंच OpenAI के माध्यम से, साथ ही Azure और AWS Bedrock के माध्यम से उपलब्ध है।
प्रतिस्पर्धी दृश्य
स्वतंत्र मूल्यांकनों ने एस्ट्रा को वर्तमान में उपलब्ध शीर्ष प्रदर्शन करने वाले एआई मॉडल्स में से एक के रूप में स्थान दिया है, हालांकि कुछ मूल्यांकनों में यह नोट किया गया है कि एंथ्रोपिक के कुछ क्लॉड वेरिएंट्स व्यापक बुद्धिमत्ता परीक्षणों में इसे पीछे छोड़ देते हैं।
एक मॉडल जनरेशन में FrontierMath पर 83.0% से 97.6% तक की वृद्धि से पता चलता है कि यदि AI गणितीय तर्क के लिए कोई सीमा है, तो वह अभी तक प्राप्त नहीं हुई है।
