Claude ने इस बार AI प्रोग्रामिंग रैंकिंग में भारी अंतर बना दिया!
हाल ही में अपडेट किए गए MirrorCode रैंकिंग में, Claude Fable 5 ने 64% की निरपेक्ष सफलता दर के साथ फिर से शीर्ष स्थान प्राप्त किया।
GPT-5.6 Sol के बाद सबसे अधिक अंक प्राप्त करने वाले के अंक केवल इसके एक-तिहाई हैं!
चौथे स्थान पर स्थित GPT-5.5 और भी बुरी तरह से फंस गया। न केवल इसका स्कोर केवल 10% है, बल्कि इसे अपने ही पूर्वज GPT-5.4 द्वारा जमीन पर रगड़ा जा रहा है।

अधिक आश्चर्यजनक बात यह है कि Go जैसी उच्च संसाधन भाषाओं का उपयोग करने पर Fable 5 की सफलता दर 64% है; जबकि कम उपयोग की जाने वाली भाषा Ada में यह दर अभी भी 61% है।
पता होना चाहिए कि ओपन सोर्स दुनिया में, Python कॉर्पस लगभग Ada का 230 गुना है।
लेकिन Fable 5 तक पहुँचकर, प्रदर्शन केवल 3 प्रतिशत कम हो गया।

यह दिलचस्प हो गया।
अगर मॉडल मुख्य रूप से लोकप्रिय भाषाओं के व्याकरण और सामान्य लेखन शैलियों को याद करके काम करता है, तो एडा में बदलने के बाद इसका प्रदर्शन कम होना चाहिए।
लेकिन वर्तमान परिणाम एक अन्य संभावना की ओर इशारा करते हैं—
सबसे शक्तिशाली मॉडल अब विशिष्ट डेटा को अनुसरण नहीं कर रहा है और शून्य से एक पूर्ण सॉफ्टवेयर प्रोजेक्ट बनाना सीखने लगा है।
100% पारित करने की रेखा पर फंस गया, 10 अरब टोकन की सीमा परीक्षण
विशेष रूप से, पूर्ण MirrorCode में 25 लक्ष्य कार्यक्रम शामिल हैं, जो Unix उपकरण, व्याख्याता, डेटा प्रश्न, जीनोमिक्स, क्रिप्टोग्राफी और संपीड़न उपकरण आदि क्षेत्रों को कवर करते हैं।
यहाँ, मॉडल को एक अलग परिवेश में रखा जाएगा, जिसमें इंटरनेट नहीं होगा, मूल प्रोजेक्ट का सोर्स कोड दिखाई नहीं देगा, और तीसरे पक्ष के निर्भरता को डाउनलोड नहीं किया जा सकता। इसे केवल उच्च स्तरीय दस्तावेज, कुछ दृश्य परीक्षण, और एक ऐसा मूल प्रोग्राम मिल सकता है जिसे बार-बार कॉल किया जा सकता है।
अगला, यह मूल प्रोग्राम में डेटा लगातार डालता रहेगा, आउटपुट को देखकर आंतरिक तर्क का अनुमान लगाएगा, फिर एक डॉट डॉट Write a new program with consistent behavior.
लेटेस्ट रैंकिंग से 15 मीडियम और लार्ज लक्ष्य चुनें। प्रत्येक लक्ष्य के लिए दो वास्तविकीकरण भाषाएँ उपयोग करें, प्रत्येक भाषा को तीन बार चलाएँ।
और, दृश्य परीक्षण और गुप्त परीक्षण दोनों की पूर्णता 100% होनी चाहिए, 99.9% पर्याप्त नहीं है।
एक भी किनारे का मामला छूट जाए, तो पूरा रन असफलता के रूप में गिना जाता है।

मिररकोड ने मॉडल को अंतिम कुछ अंतरालों को भरने के लिए एक बार के बजट को 10 अरब टोकन तक पहुंचा दिया है और अधिकतम लगातार 7 दिन तक चलने की अनुमति दी है।
पेपर में सबसे महंगा कार्य और भी अधिक चौंकाने वाला था: मॉडल लगातार 19 दिन चला, जिसमें एक बार का खर्च 2600 डॉलर तक पहुंच गया।
इन 19 दिनों के दौरान, मॉडल लगातार मूल प्रोग्राम चलाएगा, परिणामों की तुलना करेगा, कार्यों को पूरा करेगा और फिर परीक्षण दोबारा चलाएगा। त्रुटि आने पर कारण जांचेगा, आउटपुट मेल नहीं खाता तो अनुमान बदलेगा, स्थानीय रूप से सफल होने के बाद अगली कमी पर आगे बढ़ेगा।
पूरी प्रक्रिया, एक बार की उत्पादन की बजाय, कई दिनों तक चलने वाली एक डीबगिंग की तरह है।

gotree का उदाहरण सबसे अधिक स्पष्ट है।
इस बायोइनफॉर्मेटिक्स टूल में मूल रूप से लगभग 16,000 पंक्तियाँ Go कोड और 40 से अधिक कमांड थे।
Claude Opus 4.7 ने 14 घंटे और 251 डॉलर का खर्च करके 2001 परीक्षणों में से 2000 परीक्षण पूरे किए, जिससे 99.95% पूर्णता प्राप्त हुई।
हालांकि एक दुर्लभ सीमा, जिसमें तारीख टिप्पणी को संभालना शामिल था, छूट गया और इसे MirrorCode की 100% पास लाइन ने रोक दिया, लेकिन इसने मूल रूप से सप्ताहिक आधार पर गणना किए गए इंजीनियरिंग कार्य को केवल कुछ दर्जन घंटों में समाप्त कर दिया—
एपोक के अनुमान के अनुसार, यदि AI का उपयोग नहीं किया जाए, तो मानव इंजीनियरों को एक ही कार्य पूरा करने में कम से कम 2 से 17 सप्ताह लगेंगे।
In the language desert, Fable 5 dropped only 3 points.
MirrorCode पेपर ने पहले StarCoder के खुले प्रशिक्षण मिश्रण को संदर्भ के रूप में उपयोग किया था।
इसमें Python लगभग 8% है, जबकि Ada केवल 0.034% है, जो पहले का लगभग 230 गुना है।

हम निश्चित रूप से नहीं जान सकते कि बंद स्रोत मॉडल ने कितना Ada कोड देखा है। लेकिन खुले पारिस्थितिकी के संदर्भ में, Ada कितनी दुर्लभ है, यह पर्याप्त रूप से स्पष्ट है।
यह भाषा मुख्य रूप से एयरोस्पेस, रक्षा और अन्य सुरक्षा-महत्वपूर्ण प्रणालियों में दिखाई देती है। समुदाय के आकार, ट्यूटोरियल की संख्या या ओपन सोर्स प्रोजेक्ट्स के मामले में, यह Python, JavaScript या Go के साथ तुलना नहीं कर सकती।
और Fable 5 स्पष्ट रूप से Go कोड को Ada में शब्दशः अनुवाद नहीं कर रहा है।
यह अधिक इस तरह का है कि पहले मूल प्रोग्राम कैसे काम करता है, यह समझें, और फिर एक अलग भाषा में उसी व्यवहार को पुनः बनाएं।

इसके विपरीत, अन्य मॉडल इतने स्थिर नहीं हैं।
GPT-5.6 Sol 24% से घटकर 19% हो गया, GPT-5.4 21% से घटकर 12% हो गया, और GPT-5.5 तो 17% से घटकर केवल 5% हो गया। भाषा बदलते ही अंतर स्पष्ट हो जाता है।
पूरे प्रोजेक्ट को AI को सौंप दें
अब तक, Cursor ने सैकड़ों एजेंट्स को लगभग एक सप्ताह तक सहयोग करने दिया है, जिन्होंने शून्य से 1000 फाइलों में विभाजित 100 लाख से अधिक पंक्तियों का ब्राउज़र कोड लिखा है।
एंथ्रोपिक ने 16 क्लॉड एजेंट्स को समानांतर में लगभग 2000 सत्र चलाए, जिससे अंततः 10 लाख पंक्तियों का एक C कंपाइलर बनाया गया, जो Linux 6.9 कर्नेल को कंपाइल कर सकता है।
OpenAI द्वारा मई तक Codex के व्यक्तिगत उपयोगकर्ता नमूने में, 70.2% ने कम से कम एक बार ऐसा कार्य सबमिट किया जिसके लिए मानव श्रम की अनुमानित अवधि एक घंटे से अधिक थी; 25.6% ने आठ घंटे से अधिक का कार्य सबमिट किया।
लोग AI को सौंपे जा रहे इकाईयाँ, एक कोड सेगमेंट, एक बग से बदलकर एक दोपहर, एक सप्ताह, या पूरी प्रोजेक्ट बन गई हैं।
MirrorCode का 64%, इस «प्रोजेक्ट-लेवल डिलीगेशन» की एक मापनीय व्याख्या है।
यह बताता है कि जब लक्ष्य पर्याप्त रूप से स्पष्ट हो और परिणाम स्वचालित रूप से स्वीकार्य हों, तो अग्रणी मॉडल पहले से ही कुछ मध्यम और बड़े सॉफ़्टवेयर को स्वतंत्र रूप से पूरा कर सकते हैं।
हर उस व्यक्ति के लिए जो अपना काम AI को सौप रहा है, परिवर्तन पहले से ही दरवाजे पर है—
पहले आपको हर लाइन कोड पर नजर रखनी पड़ती थी, अब आप केवल महत्वपूर्ण बिंदुओं पर जाँच करेंगे कि क्या यह विचलित हो रहा है।
कोड लगातार सस्ता होता जाएगा।
जो लोग समस्याओं को स्पष्ट कर सकते हैं और परिणामों की जांच कर सकते हैं, वे लगातार अधिक मूल्यवान बनते जाएंगे।
संदर्भ: https://epoch.ai/MirrorCode
यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI अपोकैलिप्स; संपादक: मोशे
