अभी-अभी, FrontierMath Tier 4 की अंतिम समस्या GPT-6 Astra द्वारा हल कर ली गई।
इस तक, इस शोध स्तरीय परीक्षण के सभी प्रश्न, जिन्हें पहले बड़े मॉडल के लिए गणित का निदान माना जाता था, कम से कम एक बार AI द्वारा सफलतापूर्वक हल किए जा चुके हैं।
Epoch AI ने भी इसका अंतिम निष्कर्ष निकाल लिया है, FrontierMath Tier 4, संतृप्त।

हालांकि ऊपर के चित्र से दिखता है कि Astra अभी तक 100% तक नहीं पहुंचा है, OpenAI द्वारा खुद घोषित परिणाम 97.6% है।
लेकिन एपोक के एल्गोरिदम के अनुसार, "सभी हल किए गए" का अर्थ है कि विभिन्न मॉडलों और विभिन्न समयों के प्रयासों को जोड़ने के बाद, टियर 4 में प्रत्येक प्रश्न का कम से कम एक बार सफलतापूर्वक उत्तर दिया जा चुका है।
और एस्ट्रा ने जिसे खत्म किया, वह पहले एकमात्र ऐसी बाधा थी जिसे AI अभी तक नहीं तोड़ पाया था।
(सरल शब्दों में, यह इस बात का है कि एस्ट्रा किसी परीक्षण में गलत हो सकती है, लेकिन उसने जो प्रश्न हल किया, वह पहले कभी हल नहीं हुआ था)

सच बताऊं तो, यह विकास दर काफी असाधारण है।
अगर आप मॉडल एवलुएशन पर नजर रखते हैं, तो आप जानते होंगे कि 2025 जुलाई 11 को, जब Tier 4 का शुभारंभ हुआ था, तब शीर्ष प्रदर्शन केवल लगभग 5% था।
अब एक वर्ष और दो महीने बीत चुके हैं, और यह पहले का “ऊँची दीवार” अब “चढ़ाई” बन चुकी है, जिस समस्या को AI अभी तक रास्ता बदलकर नहीं पार कर पाया था, उसे भी पार कर लिया गया है।
मार्केट विश्वविद्यालय के गणित के सहायक प्रोफेसर जे पैंटोन ने भी कहा कि पिछली बार AI हमेशा संख्यात्मक छोटे रास्ते ढूंढता था, लेकिन इस बार AI का हल उनके हल के काफी करीब था।

हालांकि, हाल ही में GPT-6 Astra ने गणितीय समुदाय पर तीन दिन में दो बार मिलेनियम समस्याओं को हल करने के साथ तीव्र हमला शुरू कर दिया, पैंटोन ने कहा कि अब उन्हें आश्चर्य होना मुश्किल हो गया है!
गणित कह सकते हैं कि एस्ट्रा के हालिया सबसे ज्यादा ध्यान आकर्षित करने वाले क्षेत्रों में से एक बन गया है।
2% से कम से, एक विशेष "अनुसंधान-स्तरीय रक्षा" जोड़ने तक
फ्रंटियरमैथ का शुरुआती वर्जन 7 नवंबर, 2024 को जारी किया गया था, और इसका उद्देश्य मूल रूप से गणितीय बेंचमार्क को AI द्वारा जल्दी से ब्रेक किए जाने से रोकना था।
जब तक GSM8K, MATH जैसे पारंपरिक गणित बेंचमार्क पहले से ही शीर्ष मॉडल्स के बीच के अंतर को अलग करने में कठिनाई का सामना कर रहे थे, इसलिए Epoch AI ने 60 से अधिक गणितज्ञों के साथ मिलकर पहले कभी जारी नहीं किए गए मूल प्रश्नों का एक नया सेट डिज़ाइन किया।
इसमें ताओ जेज़हेन, टाइमोथी गाउवर्स, रिचर्ड बोर्चर्ड्स जैसे फील्ड्स पुरस्कार विजेता शामिल हैं।
जब टाओ जेह्वान ने कुछ शोध स्तर के प्रश्नों को देखा, तो उन्होंने सीधे कहा कि ये प्रश्न "अत्यंत कठिन" हैं, और सबसे कठिन Tier 3 प्रश्नों के कारण AI कुछ और सालों तक फंस सकता है।

पहले चरण के परीक्षण के परिणामस्वरूप, जैसा कि अपेक्षित था, अग्रणी मॉडल की सटीकता 2% से कम थी।
शुरुआत में, FrontierMath के कोर प्रश्न बैंक में 300 प्रश्न शामिल थे, जिन्हें कठिनाई के आधार पर Tier 1, Tier 2 और Tier 3 के तीन स्तरों में विभाजित किया गया था।

टियर 1 लगभग उच्च कठिनाई वाले स्नातक स्तर के प्रश्नों और गणित ओलंपियाड के समान है, हालाँकि अधिक उन्नत उपकरणों का उपयोग अनुमत है; टियर 2 प्रगतिशील ग्रेजुएट स्तर की कठिनाई तक पहुँच जाता है; टियर 3 तो डॉक्टरेट के प्रारंभिक चरण में मिलने वाले अन्वेषणात्मक शोध प्रश्नों के अधिक समीप है।
लेकिन रीजनिंग मॉडल्स के आगमन के साथ, ये तीनों स्तर भी धीरे-धीरे पर्याप्त नहीं रहे, इसलिए 2025 में, एपोक ने एक और स्तर, टियर 4 जोड़ दिया।
टियर 4 को अधिकांशतः गणित के प्रोफेसर और पोस्टडॉक्टोरल शोधकर्ता द्वारा डिज़ाइन किया गया है, जो प्रत्येक व्यक्ति अपने शोध क्षेत्र के चारों ओर लगभग कुछ सप्ताह का अल्पकालीन शोध करता है, और अंत में परिणामों को एक ऐसे प्रश्न में संकुचित कर देता है जिसे स्वचालित रूप से सत्यापित किया जा सके।

शुरू में, टियर 4 में कुल 50 प्रश्न शामिल थे। इनका दायरा विश्लेषण, संख्या सिद्धांत, संयोजनीय गणित, टोपोलॉजी, बीजीय ज्यामिति... शामिल है
शुरुआत में, सभी मॉडलों के सभी परीक्षणों में केवल तीन प्रश्न ही हल किए गए थे, और इन हलों पर कुछ सही, लेकिन पर्याप्त रूप से सिद्ध नहीं किए गए अनुमानों का आधार था।
इसके आधार पर, ऑफिशियल वेबसाइट के पब्लिक प्रैक्टिस क्वेश्चन पेज पर, इपोक ने कभी लिखा था: कुछ प्रश्नों को AI द्वारा कई दशकों तक हल नहीं किया जा सकता है।

(This sentence is now being repeatedly beaten up)
हालांकि, जैसे-जैसे मॉडल अधिक शक्तिशाली हो रहे हैं, एक अन्य समस्या सामने आई: प्रश्न बैंक स्वयं भी AI के "परीक्षण" को झेलने लगा है।
OpenAI ने परीक्षण के दौरान पाया कि FrontierMath में अपेक्षित से अधिक त्रुटियाँ हैं।
इसके बाद एपोक ने स्वतंत्र ऑडिट शुरू किया, जिसमें पहले GPT-5.5 और Claude Opus 4.7 द्वारा संदिग्ध बिंदुओं की जांच की गई, फिर गणितज्ञों द्वारा प्रत्येक प्रश्न की पुनरावृत्ति की गई। अंततः 2026 की जून में v2 संस्करण लॉन्च किया गया, जिसमें Tier 4 ने 12 प्रश्नों में सुधार किया, 7 प्रश्नों को हटा दिया, और 43 प्रश्न बचाए।
सुधार के बाद, मॉडल के अंक अभी भी लगातार बढ़ रहे हैं।
GPT-5.6 Sol ने 83.0% किया, Claude Fable 5 ने 90.2% प्राप्त किया, और GPT-6 Astra पर परिणाम 97.6% पहुंच गए।

अधिक महत्वपूर्ण बात यह है कि एस्ट्रा ने पहले कभी एआई द्वारा हल नहीं की गई एकमात्र प्रश्न को भी हल कर दिया।

इस तरह, टियर 4 के प्रत्येक प्रश्न को AI ने कम से कम एक बार सफलतापूर्वक हल कर लिया है। इस विशेष रूप से सबसे शक्तिशाली मॉडल के लिए बनाई गई शोध-स्तरीय सुरक्षा अंततः भी तोड़ दी गई।
हालांकि, इसका मतलब यह नहीं है कि "गणित को AI ने हल कर दिया है"। बल्कि, FrontierMath खुद अगले चरण की ओर बढ़ना शुरू कर चुका है।
अब पूरे प्रोजेक्ट में टियर 1-4 के अलावा वास्तविक ओपन प्रॉब्लम्स भी शामिल किए गए हैं, और Erdős ओपन प्रॉब्लम्स को Lean में FrontierMath Erdős के रूप में फॉर्मलाइज़ किया गया है।

पहला मॉडल को उन गणितीय समस्याओं का परीक्षण करता है जो अभी तक गणितीय समुदाय द्वारा हल नहीं की गई हैं; दूसरा AI से फॉर्मल वेरिफिकेशन से गुजरने वाले पूर्ण सबूत लिखने की मांग करता है।
इस बार, एस्ट्रा ने फ्रंटियरमैथ एर्डोश के 68 प्रश्नों में से केवल 2 को हल किया।
कहानी जारी है~
यह लेख वेचेन ग्रुप "Quantum Bit" से है, लेखक: henry
