GPT-6 Astra फाइनल फ्रंटियरमैथ टियर 4 समस्या को हल करता है

icon MarsBit
साझा करें
AI summary iconसारांश
AI + क्रिप्टो समाचार: GPT-6 Astra ने FrontierMath Tier 4 में अंतिम समस्या को हल कर दिया है, जिससे उन्नत बेंचमार्क में सभी चुनौतियाँ पूरी हो गईं। Epoch AI द्वारा 60+ गणितज्ञों के साथ विकसित, Astra ने 97.6% सटीकता प्राप्त की और अब तक हल नहीं हो पाई गई अंतिम समस्या को हल कर लिया है। अब प्रोजेक्ट एक नए चरण में आगे बढ़ रहा है, जिसमें खुली शोध और औपचारिक चुनौतियाँ शामिल हैं, जो AI प्रगति में एक महत्वपूर्ण प्रोजेक्ट घोषणा है।

अभी-अभी, FrontierMath Tier 4 की अंतिम समस्या GPT-6 Astra द्वारा हल कर ली गई।

इस तक, इस शोध स्तरीय परीक्षण के सभी प्रश्न, जिन्हें पहले बड़े मॉडल के लिए गणित का निदान माना जाता था, कम से कम एक बार AI द्वारा सफलतापूर्वक हल किए जा चुके हैं।

Epoch AI ने भी इसका अंतिम निष्कर्ष निकाल लिया है, FrontierMath Tier 4, संतृप्त।

फ्रंटियरमैथ

हालांकि ऊपर के चित्र से दिखता है कि Astra अभी तक 100% तक नहीं पहुंचा है, OpenAI द्वारा खुद घोषित परिणाम 97.6% है।

लेकिन एपोक के एल्गोरिदम के अनुसार, "सभी हल किए गए" का अर्थ है कि विभिन्न मॉडलों और विभिन्न समयों के प्रयासों को जोड़ने के बाद, टियर 4 में प्रत्येक प्रश्न का कम से कम एक बार सफलतापूर्वक उत्तर दिया जा चुका है।

और एस्ट्रा ने जिसे खत्म किया, वह पहले एकमात्र ऐसी बाधा थी जिसे AI अभी तक नहीं तोड़ पाया था।

(सरल शब्दों में, यह इस बात का है कि एस्ट्रा किसी परीक्षण में गलत हो सकती है, लेकिन उसने जो प्रश्न हल किया, वह पहले कभी हल नहीं हुआ था)

फ्रंटियरमैथ

सच बताऊं तो, यह विकास दर काफी असाधारण है।

अगर आप मॉडल एवलुएशन पर नजर रखते हैं, तो आप जानते होंगे कि 2025 जुलाई 11 को, जब Tier 4 का शुभारंभ हुआ था, तब शीर्ष प्रदर्शन केवल लगभग 5% था।

अब एक वर्ष और दो महीने बीत चुके हैं, और यह पहले का “ऊँची दीवार” अब “चढ़ाई” बन चुकी है, जिस समस्या को AI अभी तक रास्ता बदलकर नहीं पार कर पाया था, उसे भी पार कर लिया गया है।

मार्केट विश्वविद्यालय के गणित के सहायक प्रोफेसर जे पैंटोन ने भी कहा कि पिछली बार AI हमेशा संख्यात्मक छोटे रास्ते ढूंढता था, लेकिन इस बार AI का हल उनके हल के काफी करीब था।

फ्रंटियरमैथ

हालांकि, हाल ही में GPT-6 Astra ने गणितीय समुदाय पर तीन दिन में दो बार मिलेनियम समस्याओं को हल करने के साथ तीव्र हमला शुरू कर दिया, पैंटोन ने कहा कि अब उन्हें आश्चर्य होना मुश्किल हो गया है!

गणित कह सकते हैं कि एस्ट्रा के हालिया सबसे ज्यादा ध्यान आकर्षित करने वाले क्षेत्रों में से एक बन गया है।

2% से कम से, एक विशेष "अनुसंधान-स्तरीय रक्षा" जोड़ने तक

फ्रंटियरमैथ का शुरुआती वर्जन 7 नवंबर, 2024 को जारी किया गया था, और इसका उद्देश्य मूल रूप से गणितीय बेंचमार्क को AI द्वारा जल्दी से ब्रेक किए जाने से रोकना था।

जब तक GSM8K, MATH जैसे पारंपरिक गणित बेंचमार्क पहले से ही शीर्ष मॉडल्स के बीच के अंतर को अलग करने में कठिनाई का सामना कर रहे थे, इसलिए Epoch AI ने 60 से अधिक गणितज्ञों के साथ मिलकर पहले कभी जारी नहीं किए गए मूल प्रश्नों का एक नया सेट डिज़ाइन किया।

इसमें ताओ जेज़हेन, टाइमोथी गाउवर्स, रिचर्ड बोर्चर्ड्स जैसे फील्ड्स पुरस्कार विजेता शामिल हैं।

जब टाओ जेह्वान ने कुछ शोध स्तर के प्रश्नों को देखा, तो उन्होंने सीधे कहा कि ये प्रश्न "अत्यंत कठिन" हैं, और सबसे कठिन Tier 3 प्रश्नों के कारण AI कुछ और सालों तक फंस सकता है।

फ्रंटियरमैथ

पहले चरण के परीक्षण के परिणामस्वरूप, जैसा कि अपेक्षित था, अग्रणी मॉडल की सटीकता 2% से कम थी।

शुरुआत में, FrontierMath के कोर प्रश्न बैंक में 300 प्रश्न शामिल थे, जिन्हें कठिनाई के आधार पर Tier 1, Tier 2 और Tier 3 के तीन स्तरों में विभाजित किया गया था।

फ्रंटियरमैथ

टियर 1 लगभग उच्च कठिनाई वाले स्नातक स्तर के प्रश्नों और गणित ओलंपियाड के समान है, हालाँकि अधिक उन्नत उपकरणों का उपयोग अनुमत है; टियर 2 प्रगतिशील ग्रेजुएट स्तर की कठिनाई तक पहुँच जाता है; टियर 3 तो डॉक्टरेट के प्रारंभिक चरण में मिलने वाले अन्वेषणात्मक शोध प्रश्नों के अधिक समीप है।

लेकिन रीजनिंग मॉडल्स के आगमन के साथ, ये तीनों स्तर भी धीरे-धीरे पर्याप्त नहीं रहे, इसलिए 2025 में, एपोक ने एक और स्तर, टियर 4 जोड़ दिया।

टियर 4 को अधिकांशतः गणित के प्रोफेसर और पोस्टडॉक्टोरल शोधकर्ता द्वारा डिज़ाइन किया गया है, जो प्रत्येक व्यक्ति अपने शोध क्षेत्र के चारों ओर लगभग कुछ सप्ताह का अल्पकालीन शोध करता है, और अंत में परिणामों को एक ऐसे प्रश्न में संकुचित कर देता है जिसे स्वचालित रूप से सत्यापित किया जा सके।

फ्रंटियरमैथ

शुरू में, टियर 4 में कुल 50 प्रश्न शामिल थे। इनका दायरा विश्लेषण, संख्या सिद्धांत, संयोजनीय गणित, टोपोलॉजी, बीजीय ज्यामिति... शामिल है

शुरुआत में, सभी मॉडलों के सभी परीक्षणों में केवल तीन प्रश्न ही हल किए गए थे, और इन हलों पर कुछ सही, लेकिन पर्याप्त रूप से सिद्ध नहीं किए गए अनुमानों का आधार था।

इसके आधार पर, ऑफिशियल वेबसाइट के पब्लिक प्रैक्टिस क्वेश्चन पेज पर, इपोक ने कभी लिखा था: कुछ प्रश्नों को AI द्वारा कई दशकों तक हल नहीं किया जा सकता है।

फ्रंटियरमैथ

(This sentence is now being repeatedly beaten up)

हालांकि, जैसे-जैसे मॉडल अधिक शक्तिशाली हो रहे हैं, एक अन्य समस्या सामने आई: प्रश्न बैंक स्वयं भी AI के "परीक्षण" को झेलने लगा है।

OpenAI ने परीक्षण के दौरान पाया कि FrontierMath में अपेक्षित से अधिक त्रुटियाँ हैं।

इसके बाद एपोक ने स्वतंत्र ऑडिट शुरू किया, जिसमें पहले GPT-5.5 और Claude Opus 4.7 द्वारा संदिग्ध बिंदुओं की जांच की गई, फिर गणितज्ञों द्वारा प्रत्येक प्रश्न की पुनरावृत्ति की गई। अंततः 2026 की जून में v2 संस्करण लॉन्च किया गया, जिसमें Tier 4 ने 12 प्रश्नों में सुधार किया, 7 प्रश्नों को हटा दिया, और 43 प्रश्न बचाए।

सुधार के बाद, मॉडल के अंक अभी भी लगातार बढ़ रहे हैं।

GPT-5.6 Sol ने 83.0% किया, Claude Fable 5 ने 90.2% प्राप्त किया, और GPT-6 Astra पर परिणाम 97.6% पहुंच गए।

फ्रंटियरमैथ

अधिक महत्वपूर्ण बात यह है कि एस्ट्रा ने पहले कभी एआई द्वारा हल नहीं की गई एकमात्र प्रश्न को भी हल कर दिया।

फ्रंटियरमैथ

इस तरह, टियर 4 के प्रत्येक प्रश्न को AI ने कम से कम एक बार सफलतापूर्वक हल कर लिया है। इस विशेष रूप से सबसे शक्तिशाली मॉडल के लिए बनाई गई शोध-स्तरीय सुरक्षा अंततः भी तोड़ दी गई।

हालांकि, इसका मतलब यह नहीं है कि "गणित को AI ने हल कर दिया है"। बल्कि, FrontierMath खुद अगले चरण की ओर बढ़ना शुरू कर चुका है।

अब पूरे प्रोजेक्ट में टियर 1-4 के अलावा वास्तविक ओपन प्रॉब्लम्स भी शामिल किए गए हैं, और Erdős ओपन प्रॉब्लम्स को Lean में FrontierMath Erdős के रूप में फॉर्मलाइज़ किया गया है।

फ्रंटियरमैथ

पहला मॉडल को उन गणितीय समस्याओं का परीक्षण करता है जो अभी तक गणितीय समुदाय द्वारा हल नहीं की गई हैं; दूसरा AI से फॉर्मल वेरिफिकेशन से गुजरने वाले पूर्ण सबूत लिखने की मांग करता है।

इस बार, एस्ट्रा ने फ्रंटियरमैथ एर्डोश के 68 प्रश्नों में से केवल 2 को हल किया।

कहानी जारी है~

यह लेख वेचेन ग्रुप "Quantum Bit" से है, लेखक: henry

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।