वैश्विक AI मॉडल IMO 2026 में परफेक्ट स्कोर के साथ शीर्ष पर हैं

icon MarsBit
साझा करें
AI summary iconसारांश
AI और क्रिप्टो समाचार टूटा, जब चार AI मॉडल—Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3 और AxiomProver—ने 2026 के IMO में 42/42 अंक प्राप्त किए, जिससे 99% मानव प्रतियोगियों को पीछे छोड़ दिया। सात वर्षों में केवल 30 मानवों ने ही परफेक्ट स्कोर प्राप्त किया है। Axiom Math ने समस्याओं को ऑटोमेटेड स्कोरिंग के लिए Lean 4 में अनुवादित किया। लागत $0.18 से $51 तक थी। वैश्विक क्रिप्टो नीति चर्चाएँ जल्द ही गणित और तर्क में AI की भूमिका को शामिल कर सकती हैं।

जुलाई में शंघाई में तपती हवाएँ चल रही हैं।

67वें अंतरराष्ट्रीय गणित ओलंपियाड का आधिकारिक रूप से अंत हो गया, जिसमें चीनी टीम ने 232 अंकों से स्वर्ण पदक जीता। तीन युवाओं ने 42 अंकों का पूर्ण स्कोर हासिल किया।

एक्सियम मैथ

अभी तक जीवंत तालियाँ बंद नहीं हुई हैं, जबकि GitHub पर एक और चमकदार उपलब्धि धीरे से सामने आ गई है।

पूर्व Google इंजीनियर डीडी डास ने एक AI तुलना प्रस्तुत की: 7 अग्रणी बड़े मॉडल, जो IMO 2026 के सभी 6 प्रश्नों को स्वतंत्र रूप से हल करते हैं।

क्लॉड फेबल 5 ने 42 में से 42 अंक प्राप्त किए। केवल 2.5 घंटे में, 51 डॉलर खर्च हुए।

GPT-5.6 Sol का xhigh संस्करण भी पूर्ण अंक प्राप्त करता है। 3.8 घंटे का समय लगा और लागत केवल 20 डॉलर तक सीमित कर दी गई।

किमी K3 ने अगले स्थान पर 17.4 घंटे की लड़ाई के बाद 31 डॉलर खर्च करके पूर्ण अंक प्राप्त किए।

AxiomProver के अलावा, चारों शक्तियाँ सभी पूर्ण अंक प्राप्त कर चुकी हैं।

एक्सियम मैथ

संदर्भ के लिए, पिछले सात वर्षों में IMO में 4,347 मानव प्रतियोगी शामिल हुए, जिनमें से केवल 30 ने पूर्ण अंक प्राप्त किए — 0.69% का अनुपात।

एक्सियम मैथ

प्रदर्शन में भारी अंतर से दबा दिया गया

परिणामों से पता चलता है कि न केवल पूर्ण अंक 42 और चौथे स्थान के 28 अंकों के बीच 14 अंकों की खाई है, बल्कि तीनों पूर्ण अंक प्राप्त करने वाले मॉडल भी शीर्ष पर पहुँचने का तरीका अलग-अलग है।

क्लॉड फेबल 5 ने साफ़ और सटीक तरीके से प्रदर्शन किया। 9 बातचीतों में, 6 बातचीतों में प्रभावी आउटपुट, एक बार में अधिकतम 73 मिनट (P3), कुल 70 लाख टोकन आउटपुट।

GPT-5.6 Sol का पथ कुछ कठिन रहा। P2 पर 106 मिनट तक चलकर 4 राउंड पूरे किए, जिसके दौरान दो बार नेटवर्क खराबी के कारण बाधा आई। लेकिन कैलकुलेशन नियंत्रण भयानक है—कुल आउटपुट केवल 23 हजार टोकन, जो तीन में सबसे कम है।

किमी K3 एक अथक विशालकाय राक्षस की तरह है। 2.8 ट्रिलियन पैरामीटर का MoE मॉडल, एक ही बार में 1.54 मिलियन टोकन उत्सर्जित करता है, जो Sol का 6.5 गुना है। केवल P3 के एक प्रश्न के लिए ही 6 बार हमला किया गया, और 491 मिनट तक लड़ा गया।

एक्सियम मैथ

एक्सियम मैथ

एक्सियम मैथ

एक्सियम मैथ

एक्सियम मैथ

एक्सियम मैथ

Mathematical intuition face-off

P1 सबसे हल्का एपिटाइज़र है, सभी मॉडल कुछ ही मिनटों में पूरा कर लेते हैं, और मानव प्रतियोगी भी लगभग कोई भी गलती नहीं करते।

बोर्ड पर 2026 से अधिक 1 के धनात्मक पूर्णांक लिखे हुए हैं। प्रत्येक चरण में, दो संख्याएँ m और n चुनें, उन्हें मिटाएँ और gcd(m,n) और lcm(m,n)/gcd(m,n) लिखें। इस प्रक्रिया को तब तक दोहराएँ जब तक आगे नहीं बढ़ा जा सकता। साबित करें: (a) प्रक्रिया अवश्य समाप्त होगी और अंत में केवल एक संख्या M > 1 शेष रहेगी; (b) M का मान संक्रियाओं के क्रम पर निर्भर नहीं करता।

एक्सियम मैथ

इस प्रश्न को समझने के लिए, हम एक सूक्ष्म प्रयोग करते हैं।

बोर्ड पर केवल 12 और 18 हैं। 12 = 2² × 3, 18 = 2 × 3²। पहला चरण: gcd(12,18) = 6, lcm(12,18)/6 = 6, बोर्ड [6, 6] बन जाता है। दूसरा चरण: gcd(6,6) = 6, lcm(6,6)/6 = 1, बोर्ड [6, 1] बन जाता है। केवल एक संख्या 1 से अधिक बचती है, इसलिए खेल समाप्त हो जाता है। M = 6।

आप ऑपरेशन क्रम को कैसे भी बदलें, M हमेशा 6 होता है। क्यों?

The answer lies in the prime factors.

प्रत्येक अभाज्य संख्या p के लिए, सभी संख्याओं को p से विभाजित करने की अधिकतम घात का महत्तम समापवर्तक लें, और फिर इन अभाज्य घातों को गुणा करें—यह मान पहले चरण से अंतिम चरण तक स्थिर रहता है।

Claude Fable 5: एक ऐसा काउंटर सीधे बनाया गया है जो हर कदम पर संकुचित हो जाता है।

इस प्रश्न के लिए, Fable 5 एक मात्रा Φ = T + N परिभाषित करता है। T, बोर्ड पर सभी संख्याओं के अभाज्य गुणनखंडों की कुल संख्या है (पुनरावृत्ति के साथ), और N, 1 से बड़ी संख्याओं की संख्या है। उदाहरण के लिए, बोर्ड [12, 18] पर, 12 के अभाज्य गुणनखंड 2, 2, 3 हैं, जो कुल 3 हैं, और 18 के अभाज्य गुणनखंड 2, 3, 3 हैं, जो कुल 3 हैं, इसलिए T = 6, N = 2, Φ = 8।

फिर यह साबित होता है कि प्रत्येक कदम पर, Φ कम से कम 1 कम हो जाता है। दो स्थितियाँ हैं—यदि gcd(m,n) > 1, तो अभाज्य गुणनखंडों की कुल संख्या T कम हो जाती है; यदि gcd(m,n) = 1, तो T अपरिवर्तित रहती है, लेकिन 1 से अधिक की संख्याएँ एक कम हो जाती हैं, और N में 1 की कमी होती है। Φ एक धनात्मक पूर्णांक है, प्रत्येक कदम पर कम से कम 1 कम होता है, इसलिए प्रक्रिया सीमित कदमों में समाप्त होनी चाहिए। एकल गिनती, एक ही कट।

एक्सियम मैथ

GPT-5.6 Sol: उत्पाद का अनुसरण करें, शब्दावली क्रम में आयाम घटाएं।

सॉल दो मानों पर ध्यान देता है: P = सभी संख्याओं का गुणनफल, K = 1 से बड़ी संख्याओं की संख्या। प्रत्येक चरण में, यदि gcd(m,n) = d > 1, तो नई दो संख्याओं का गुणनफल mn/d होता है, जो मूल से छोटा है, और समग्र गुणनफल P कठोरता से कम हो जाता है। यदि d = 1, तो P अपरिवर्तित रहता है, लेकिन K 1 कम हो जाता है।

(P, K) युग्म शब्दकोशीय क्रम में कठोर रूप से घट रहा है: या तो P छोटा हो रहा है, या P समान है लेकिन K छोटा हो रहा है। धनात्मक पूर्णांकों का शब्दकोशीय क्रम अनंत रूप से घट नहीं सकता। समाप्त।

एक्सियम मैथ

एक ही समस्या के (a) भाग को हल करने के लिए दो अलग-अलग रास्ते अपनाए गए।

भाग (b) में, तीनों मॉडल एक ही निष्कर्ष पर पहुँचते हैं: प्रत्येक अभाज्य संख्या p के लिए, बोर्ड पर सभी संख्याओं को p से विभाजित करने की अधिकतम घातों का महत्तम समापवर्तक संक्रिया के दौरान अपरिवर्तित रहता है। अंतिम सूत्र भी बिल्कुल समान है—

एक्सियम मैथ

उदाहरण की जांच पर वापस जाएं: 12 और 18। p=2 के लिए, v₂(12) = 2, v₂(18) = 1, gcd = 1, योगदान 2¹। p=3 के लिए, v₃(12) = 1, v₃(18) = 2, gcd = 1, योगदान 3¹। M = 2 × 3 = 6, जो हाथ से गणना के परिणाम के बिल्कुल मेल खाता है।

The cheapest blank paper in the entire venue

P6 का यह संख्या सिद्धांत प्रश्न दिन 2 का अंतिम प्रश्न है, जिसमें अनुक्रम के अंततः आवर्ती होने को सिद्ध करना है।

पिछले वर्ष IMO 2025 में दुनिया भर में केवल 6 लोगों ने P6 हल किया।

Claude Fable 5: 52 मिनट, दो राउंड, पूर्ण अंक। GPT-5.6 Sol: 60 मिनट, दो राउंड, पूर्ण अंक। किमी K3: 381 मिनट, चार राउंड, पूर्ण अंक।

Grok 4.5 P6 पर केवल 7053 टोकन उत्पन्न करता है और सभी में सबसे नीचे है। सबमिट किए गए फ़ाइल में स्पष्ट रूप से लिखा है: Full proof: (Not yet complete.)

$0.18, सभी में सबसे सस्ती व्हाइट पेपर।

ग्रोक की समस्याएँ यहीं तक सीमित नहीं हैं। पूरे परीक्षण के दौरान यह एक अजीब भ्रम में बार-बार फंस गया: यह दावा करता रहा कि "प्रमाण फ़ाइल में लिख दिया गया है", जबकि बैकएंड ने लिखने के उपकरण को तक छुआ नहीं।

यह गणितीय क्षमता की समस्या नहीं है, बल्कि एजेंट क्षमता की समस्या है। मॉडल जानता है कि फ़ाइल लिखनी चाहिए और दावा करता है कि उसने लिख दी है, लेकिन टूल कॉल स्तर पर उसने कोई कार्रवाई नहीं की है।

Three leaps in three years

सिलिकॉन ब्रेन का भयानक विकास

2024 में, DeepMind का AlphaProof पहली बार IMO स्तर पर रजत पदक की सीमा तक पहुंचा।

2025 में, OpenAI और DeepMind ने एक साथ कदम रखा। OpenAI ने अपना मॉडल गुप्त रखते हुए 5 प्रश्नों को हल करके 35 अंकों का स्वर्ण पदक जीता, जबकि Gemini Deep Think ने समान स्तर प्राप्त किया।

2026 में, तीन सामान्य बड़े मॉडल सीधे पूर्ण अंक प्राप्त करते हैं। इस बार, किसी भी विशेष गणित प्रशिक्षण के बिना, और सभी के लिए उपलब्ध। यहां तक कि एक खुला स्रोत भी है।

एक्सियम मैथ

जिसने मशीन का चुनौती पत्र लिखा

पूरी परीक्षा की शुरुआत एक कंपनी एक्सियम मैथ से हुई।

उन्होंने IMO 2026 के सभी छह प्रश्नों का शब्दशः मशीन के लिए समझने योग्य Lean 4 फॉर्मल प्रस्तुति में अनुवाद किया।

इस मशीन-पठनीय प्रश्न सेट के साथ, AI सीधे Lean प्रमाण उत्पन्न कर सकता है और कंपाइलर द्वारा स्वचालित रूप से अंक दिए जा सकते हैं, जिससे मानव निरीक्षकों की आवश्यकता नहीं रहती।

टेस्ट फ्रेमवर्क प्राप्त करने के बाद, डीडी डास ने एक पूर्णतः स्वचालित टेस्ट फ्रेमवर्क तैयार कर लिया। प्रमुख मॉडल्स ट्रैक पर अपनी-अपनी गति से दौड़े और सभी 6 चुनौतियों को पूरा कर लिया। AxiomProver ने भी स्वतंत्र रूप से पूर्ण अंक प्राप्त किए।

ध्यान देने योग्य बात यह है कि Axiom Math के संस्थापक होंग लेतोंग केवल 25 वर्ष के हैं। वह ग्वांगज़ौ में पैदा हुईं और केवल तीन वर्षों में MIT से गणित और भौतिकी की दोहरी स्नातक डिग्री प्राप्त कर चुकी हैं, और मॉर्गन पुरस्कार की विजेता भी हैं।

पिछले साल के अंत में, उनके द्वारा विकसित AxiomProver ने पुटनम गणित प्रतियोगिता में पूर्ण अंक प्राप्त किए। यह प्रतियोगिता के 98 वर्षों के इतिहास में छठा पूर्ण अंक का अद्भुत उपलब्धि है।

इस कंपनी ने इस वर्ष मार्च में 2 बिलियन डॉलर की A-चरण की फंडिंग पूरी की। इसका मूल्यांकन 16 बिलियन डॉलर तक पहुँच गया।

एक्सियम मैथ

सामान्य लोगों का जीवन कैसे पुनर्गठित होगा

4229 पंक्तियों के कठोर सिद्धांत वाले मॉडल को लिखने की क्षमता, गणित के प्रश्नों को हल करने की क्षमता से अधिक है।

यह वास्तव में लंबी तर्क श्रृंखला पर नियंत्रण रखता है, जिसमें प्रत्येक चरण कूदा नहीं जा सकता, गलत नहीं किया जा सकता और अस्पष्ट नहीं हो सकता।

क्या अनुबंध शर्तों में खामियाँ हैं, बीमा दावे की शर्तें पूरी हो रही हैं या नहीं, कर योजना अनुपालन के अनुकूल है या नहीं—सतही रूप को हटाकर ये सभी एक ही प्रकार के प्रश्न हैं: उत्तर 'लगभग सही' नहीं हो सकता।

पहले इस तरह की प्रति-पंक्ति जांच केवल विशेषज्ञ ही कर सकते थे, जिसका शुल्क घंटे के हिसाब से लिया जाता था।

अब, इस क्षमता के उपभोक्ता उत्पादों में शामिल होने के साथ, कठिन समस्याओं का सामना करने के लिए, बस अपना फोन खोलें।

संदर्भ सामग्री:

https://x.com/deedydas/status/2079409461874332066

यह लेख वेचेन ग्रुप "न्यूज़िज़यून" से आया है, लेखक: ASI अपोकैलिप्स, संपादक: मोशे

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।