गूगल का जेमिनी फ्लैश टीमवर्क फ्रेमवर्क का उपयोग करके 3 डॉक्टरेट स्तर की गणित समस्याओं को हल करता है

icon MarsBit
साझा करें
AI summary iconसारांश
Google का Gemini Flash एक कंप्लायंस फ्रेमवर्क का उपयोग करके तीन डॉक्टरेट स्तर की गणित की समस्याओं को हल करने में सफल रहा, जो AI एजेंट्स को सहयोग करने और समाधानों को सुधारने की अनुमति देता है। हल्का मॉडल Gemini Pro द्वारा पहले प्राप्त परिणामों को दोहराता है और मशीनों द्वारा सत्यापित त्रुटि-मुक्त सबूत प्रस्तुत करता है। टीमवर्क फ्रेमवर्क शैक्षणिक समीक्षा का अनुकरण करता है, जो दर्शाता है कि छोटे मॉडल कैसे जटिल कार्यों को संभाल सकते हैं। लिक्विडिटी और क्रिप्टो बाजार ऐसे संरचित AI सहयोग से लाभान्वित हो सकते हैं।

अगर आप नाम नहीं देखें, तो आपको लगेगा कि यह फिर से एक ऐसा शक्तिशाली मॉडल है जिसे सार्वजनिक रूप से जारी नहीं किया जा सकता, जिसने एक 'चीट' प्रदर्शन प्रस्तुत किया है:

अनुसंधान करें: एक ही सांस में 7 शीर्ष गणित और कंप्यूटर समस्याओं को हल करें, जिसका 40 पृष्ठों का सबूत सबसे कठोर मशीनी समीक्षा तक को भी कोई त्रुटि नहीं ढूंढ पाई;

Engineering project: Wrote a highly realistic CPU simulator from scratch, successfully booted the system with an error rate of 0.71%;

कोड लिखें: ईगन और पैरलीहैश दोनों प्रमुख ओपन-सोर्स लाइब्रेरीज़ के कोर कोड को अच्छी तरह से ऑप्टिमाइज़ किया, और परिवर्तन सीधे अपस्ट्रीम मेंटेनर्स द्वारा मर्ज कर लिए गए।

यह गूगल एंटीग्रैविटी टीम द्वारा 27 अगस्त को जारी किया गया एक परिणाम है।

Google

Teamwork तकनीकी लेख में, गूगल की एंटीग्रैविटी टीम ने गणित, सिस्टम और ओपन सोर्स तीन प्रकार के परिणामों की घोषणा की।

आश्चर्यजनक रूप से, इस बार बड़े कैलकुलेशन वाले मॉडल की जगह नहीं, बल्कि "तेज़ और सस्ता" पर ध्यान केंद्रित करने वाले छोटे मॉडल: Gemini 3.7 Flash ने प्रमुख भूमिका निभाई।

Google

गूगल की आधिकारिक तौर पर घोषणा हुई है: यह Flash स्तर के मॉडल की पहली बार डॉक्टरेट स्तर की गणितीय शोध उपलब्धि है।

क्यों सस्ते मॉडल क्षमताओं को पार कर सकते हैं?

रहस्य पैरामीटर में नहीं, बल्कि टीमवर्क नामक एक मल्टी-एजेंट ऑर्केस्ट्रेशन फ्रेमवर्क में है।

गूगल वास्तव में उद्योग को यह संकेत देना चाहता है: यह फ्लैश अचानक बुद्धिमान नहीं हुआ है, बल्कि काम करने का तरीका बदल गया है।

Pro नेतृत्व में अन्वेषण

Flash successfully reproduced

इस रिपोर्ट का मुख्य पात्र कौन है, गूगल की तकनीकी लंबी लेख ने बहुत कठोर परिभाषा दी है:

7 गणित और थ्योरेटिकल कंप्यूटर साइंस के परिणाम, जो शुरू में सभी Gemini 3.1 Pro द्वारा Teamwork के लंबे सबूत मोड में प्राप्त किए गए थे।

लेकिन आश्चर्यजनक बात यह है कि इनमें से 3 हार्डकोर परिणामों को Gemini 3.7 Flash ने पूरी तरह से पुनर्निर्मित किया।

ये तीनों बातें केवल भरपाई के लिए नहीं हैं: ℓp उपस्थान सन्निकटन के लिए coreset निर्माण, अधिकतम आंतरिक गुणन के लिए आयामी निचली सीमा, और हैडमार्ड क्वांटाइजेशन द्वारा अग्रणी स्थिरांक को सीधे लगभग 5.93 गुना कम करना।

प्रत्येक एक वास्तविक और शैक्षणिक समुदाय की खुली समस्या है।

Google

शेष चार विषय 3.1 Pro द्वारा अकेले ही संभाले गए, जिनमें विरल कॉन्वेक्स ऑप्टिमाइज़ेशन के लिए कंडीशन नंबर की निचली सीमा, प्रीफिक्स मैट्रिक्स डीकंपोज़िशन के लिए अनुमानित आदर्श निचली सीमा, कनूथ के साइकल्स की समस्या, और ऑफलाइन स्थिति में पुनः उत्पन्न एर्डोस यूनिट डिस्टेंस समस्या शामिल हैं।

इसके अलावा, जो TCSBench आकलन ने गूगल के आंतरिक रिकॉर्ड को 71% के उच्चतम स्कोर से तोड़ा, वह 3.7 Flash और 3.1 Pro के मजबूत संयोजन से प्राप्त हुआ, जिसने पिछली पीढ़ी के 3.6 Flash और 3.1 Pro के संयोजन द्वारा प्राप्त 67.7% के रिकॉर्ड को सीधे पार कर दिया।

जिसमें, हमारा वास्तविक ध्यान देने योग्य संकेत है:

अगर आप व्यवस्था के ढांचे को सही ढंग से तैयार कर लें, तो फ्लैश जैसे हल्के मॉडल पूरी तरह से फ्लैगशिप मॉडल द्वारा किए गए शोध को दोहरा सकते हैं।

This is enough to refresh our understanding of the boundaries of what small models can do.

Teamwork ne "找茬" को कठोर नियम बना दिया है

Teamwork एंटीग्रैविटी टीम द्वारा विकसित एक मल्टी-एजेंट ऑर्केस्ट्रेशन फ्रेमवर्क है।

आपको बस एक बार /teamwork-preview टाइप करना है, Gemini प्रॉम्प्ट पढ़कर स्वयं मोड चुन लेगा और तुरंत एक «AI विशेषज्ञ टीम» बना देगा, जो कई घंटों या दिनों तक काम करती रहेगी।

पिछले उल्लेखित गणितीय उपलब्धियाँ सभी लॉन्ग प्रूफ (Long Proof) मोड से निकली हैं।

इसकी डिज़ाइन विचारधारा अत्यंत अप्रत्यक्ष है: पैरामीटर्स को जमा करने के बजाय, यह एक समूह फ्लैश को एक साथ लाकर आपस में "आलोचना, विवाद और कमजोर बिंदुओं को उजागर करने" के लिए प्रेरित करती है।

तो ये AI लोग वास्तव में कैसे मीटिंग करते हैं? इसे चरणबद्ध तरीके से देखें, कुल चार चरण हैं:

पहला चरण: पागलपन भरा प्रतिस्पर्धा रणनीति खोज।

सिस्टम एक साथ कई प्रस्तावों को विकसित करेगा और प्रत्येक प्रस्ताव को एक नियुक्त "विरोधी स्पीकर" आवंटित करेगा, जिसका एकमात्र KPI इस प्रस्ताव को खारिज करना है।

दिलचस्प बात यह है कि जिस योजना को बहुत सख्ती से आलोचित किया गया है, उसे सीधे कचरा बिन में नहीं फेंका जाता है, बल्कि वह सभी विरोधी रायों के साथ प्रक्रिया में रहती है।

अंततः, एक अवैध रास्ते में, अक्सर बचाव के लिए प्रेरणा छिपी होती है।

दूसरा कदम: चित्र के अनुसार खोजें, 「सटीक विघटन」।

जब एक विश्वसनीय रणनीति चुन ली जाती है, तो सिस्टम इसे निर्भरता वाले उप-समस्याओं में विभाजित कर देता है और एक कठोर टोपोलॉजिकल ग्राफ बनाता है। समानांतर रूप से आगे बढ़ने योग्य स्वतंत्र भागों को समानांतर रूप से आगे बढ़ाया जाता है, और क्रमबद्ध भागों को क्रम में प्रतीक्षा करनी पड़ती है।

चरण 3: अत्यधिक प्रतिस्पर्धात्मक "आंतरिक टूर्नामेंट"।

प्रत्येक उप-प्रश्न के भीतर एक नया उत्कर्ष प्रतियोगिता शुरू करें, नोड उम्मीदवार समाधानों को पढ़ते हुए विषम आलोचनाओं को देखते हुए, मिलकर एक अपग्रेडेड संस्करण तैयार करें।

अगर समग्र विफल हो जाए, तो संचित विरोध के साथ पुनः चलाएं, जब तक कि दरार पूरी तरह से बंद न हो जाए।

चरण 4: एक गलती से सीखने का "क्रॉस-राउंड लर्निंग"।

असफल ड्राफ्ट को बिना किसी बदलाव के अगले चक्र के लिए छोड़ दें, प्रमाणीकर्ता द्वारा ट्रिगर किए गए हर बड़े जाल को 'जाल रजिस्टर' में स्थायी रूप से दर्ज कर लें।

अनुभव की गई गलत राहों और साबित किए गए निष्कर्ष सभी को शेयर्ड ज्ञान भंडार में रीयल-टाइम सिंक किया जाता है, ताकि सभी सदस्य किसी भी समय उनका उपयोग कर सकें।

Google

Long Proof मोड के टूर्नामेंट नेटवर्क: प्रत्येक उम्मीदवार रणनीति के साथ एक falsifier आवंटित किया जाता है, और अस्वीकृत रास्ते विरोध के साथ प्रक्रिया में रहते हैं।

इस प्रक्रिया को पूरा करने के बाद, इसे एक ठंडा-ठंडा सुपर ब्रेन कहने के बजाय, एक अत्यंत क्रूर, जहाँ कोई भी पानी में घुल न सके, एक अकादमिक मीटिंग की प्रतिलिपि कहा जा सकता है।

यहां, किसी भी योजना को पहले कई बार कसकर चीरा जाता है, और केवल वही कठिन हड्डी सफलतापूर्वक पार हो पाती है।

यह सीधे रूप से पारंपरिक बहु-एजेंट सिस्टम के सबसे आम त्रुटि, सामूहिक हिस्टीरिया को ठीक कर देता है:

पहले एक AI अक्सर गलत दिशा में ले जाता था, और अन्य AI बिना सोचे-समझे 'अनुकरणकार' बन जाते थे, जिससे गलत आधार पर ऊँचा इमारत बन जाती थी।

टीमवर्क का सुपरवीप बस यह है कि "एक दूसरे को ढूंढना" को एक ऐसी कठोर प्रणाली में बदल दिया जाए जिससे कोई भी बच नहीं सकता।

कनुथ के समस्या का सत्य

इन सात उपलब्धियों के बारे में, सबसे आकर्षक और सबसे अधिक भ्रमित होने वाली, डोनाल्ड कनुथ द्वारा प्रस्तावित कनुथ के साइकिल्स की समस्या है।

वास्तव में, इस प्रश्न को इस साल वसंत में ही AI द्वारा पूरा कर लिया गया था।

Google

डोनल्ड क्नुथ, 2023 स्टैनफोर्ड क्रिसमस लेक्चर।

इस साल के फरवरी के अंत में, क्लॉड ओपस 4.6 ने केवल एक घंटे के लगभग में विषम स्थिति की रचना कर दी, जिससे गुडनर ने अपने पेपर की शुरुआत में दो 'शॉक!' लिख दिए।

Google

इसके तुरंत बाद, GPT-5.3-Codex और GPT-5.4 Pro जैसे मॉडल्स ने सबसे कठिन सम स्थितियों को भी पूरा कर दिया।

By mid-April, Gartner had clearly stamped in the revised paper: the even case was no longer in doubt.

Google ने इस बार क्या किया?

सरल शब्दों में, गूगल ने सम स्थितियों के लिए दो और अधिक उपयुक्त और सरल निर्माण खोजे हैं और साथ ही पहले लंबे साबित करने के दो दस्तावेज़ जारी किए हैं, जिनकी लंबाई क्रमशः 40 से अधिक पृष्ठ और 70 से अधिक पृष्ठ है।

इसमें 40 से अधिक पृष्ठों का कठोर सबूत Lean फॉर्मल वेरिफिकेशन से गुजर चुका है, जिससे मशीन भी कोई त्रुटि नहीं निकाल सकी।

यह निश्चित रूप से काफी मजबूत शैक्षणिक योगदान है, लेकिन इसका वास्तविक महत्व शून्य से नवीनता लाने के बजाय "अधिक सुंदर साबित करना" है।

यह वास्तव में Teamwork की वास्तविक शक्ति को दर्शाता है:

यह किसी एकल मॉडल के “एकांती बुद्धिमत्ता” को पूरा करने के बजाय, संस्थागत खेल और व्यवस्था के माध्यम से, बहु-बुद्धिमत्ता प्रणाली की बिखरी हुई और आपस में सहमति देने वाली सहयोग की कमजोरी को पूरी तरह से दूर करता है और “समूह बुद्धिमत्ता” को मुक्त करता है।

From Theorem to Shell

यह बार वास्तव में Flash ने किया है

एक ही खोज तंत्र, गूगल ने मॉडल बदल दिया, सीधे हार्डकोर इंजीनियरिंग पर काम करने लगा।

इस तकनीकी लंबे लेख में स्पष्ट रूप से लिखा गया है कि "Gemini 3.7 Flash" का उपयोग करें। Teamwork ने शून्य से एक पीरियड-लेवल, अनऑर्डर्ड निष्पादन वाला RISC-V CPU सिमुलेटर बनाया है।

अनुक्रमहीन निष्पादन आधुनिक उच्च-प्रदर्शन CPU का मानक फीचर है, और सिमुलेटर के लिए सबसे आसान स्थान है जहाँ यह ब्रेक हो सकता है।

टीमवर्क दो चरणों में होता है: पहले माइक्रोआर्किटेक्चर कार्यक्षमता सुनिश्चित करें, अपनी खुद की अनुक्रमहीन पाइपलाइन और रीऑर्डरिंग बफर लिखें, और xv6 ऑपरेटिंग सिस्टम को शेल तक सफलतापूर्वक शुरू करें; फिर प्रत्येक चक्र के साथ समयबद्धता को समायोजित करें।

Google

Teamwork द्वारा निर्मित RISC-V सिमुलेटर द्वारा xv6 कर्नेल को स्टार्ट करना और Shell में प्रवेश करना।

सबसे कठिन बाधा, जिसे गूगल "साइलेंट एक्जीक्यूशन गैप" कहता है।

सिमुलेटर की माइक्रोआर्किटेक्चर स्थिति कुछ सौ साइकल्स में धीरे-धीरे विचलित हो सकती है, और जब आर्किटेक्चर स्तर पर त्रुटि दिखाई देती है, तो मूल कारण को पहचानना लगभग असंभव हो चुका होता है।

टीमवर्क का समाधान है कि संदर्भ सिमुलेटर Spike को सैंडबॉक्स में अलग कर दें, ताकि एजेंट धोखेबाजी या नकल न कर सकें, और पूरी प्रक्रिया में सिंक्रोनाइज्ड सिमुलेशन करें, प्रत्येक कदम पर लेखांकन करें।

अंततः, यह सिमुलेटर ने 100 से अधिक RISC-V मानक बेंचमार्क चलाए, और अनदेखे परीक्षण लोड पर BOOM हार्डवेयर के साथ औसत चक्र त्रुटि केवल 0.71% थी।

Google

Google ने उजागर किया: Teamwork सिमुलेटर और BOOM हार्डवेयर के चक्र समन्वय की तुलना में, परीक्षण लोड पर औसत त्रुटि 0.71% नहीं देखी गई।

हालाँकि, यहाँ स्पष्ट करना आवश्यक है कि यह सॉफ्टवेयर स्तर का एक सिमुलेटर है, जो RTL चिप डिज़ाइन नहीं है, और न ही इसका कोई संबंध चिप निर्माण या फ़ेब्रिकेशन से है।

Open-source实战 with real weapons

AI अनुसंधान के दूसरे चरण में लागू करने और स्वीकृति पर बात बनती है

गणित और सिमुलेटर की तुलना में, अंतिम श्रेणी के परिणाम सबसे कम दिखाई देते हैं, लेकिन सबूत सबसे अधिक मजबूत हैं।

Eigen एक अत्यधिक लोकप्रिय उच्च-प्रदर्शन रेखीय बीजगणित पुस्तकालय है जो C++ दुनिया में व्यापक रूप से उपयोग किया जाता है।

Teamwork ने एक एकल पंक्ति या एकल स्तंभ मैट्रिक्स वेक्टर गुणन के अनुकूलित नहीं किए गए कार्यान्वयन को पहचाना और सीधे एक SIMD त्वरित पथ बनाया।

और समानांतर हैश टेबल ParlayHash में, Teamwork ने Swiss Table के अनुकूलन विचारों को शामिल किया, जिससे 64 थ्रेड्स की प्रारंभिक डालने की थ्रूपुट दोगुनी हो गई, एकल थ्रेड की कुल थ्रूपुट 1.5 गुना बढ़ गई, और प्रत्येक तत्व द्वारा 25% कम मेमोरी का उपयोग हुआ।

ये दोनों बदलाव केवल एक बंद दरवाजे के पीछे की खुशी के लिए किए गए स्कोरिंग नहीं हैं, बल्कि वास्तविक कोड हैं जिन्हें कठोर ओपन सोर्स कोड रिव्यू के माध्यम से पूरी तरह से पारित किया गया और बाहरी मानव संरक्षकों द्वारा अपस्ट्रीम शाखा में आधिकारिक रूप से मर्ज किया गया।

रनिंग स्कोर से अधिक ध्यान देने योग्य, एक गणितीय पेपर के अंत में लेखक का एक बयान है: साबित करना पहले गूगल के आंतरिक Gemini एजेंट सिस्टम द्वारा किया गया, फिर लेखक द्वारा सत्यापित और संपादित किया गया।

एजेंट अनंत ड्राफ्ट पेपर पर पागलों की तरह खोज करते हैं, जबकि मनुष्य अंतिम स्वीकृति और हस्ताक्षर करते हैं। यही वर्तमान में AI अनुसंधान का सबसे वास्तविक विभाजन है।

गूगल खुद स्पष्ट रूप से कहता है: ये समस्याएँ मूल रूप से शीर्ष विशेषज्ञों को कई महीने लगते थे, टीमवर्क त्रुटि-परीक्षण चक्र को संकुचित करता है, लेकिन ड्राइविंग और अंतिम स्वीकृति का अधिकार अभी भी मनुष्य के हाथों में है।

AI अनुसंधान के दूसरे चरण में, अब यह नहीं बल्कि यह है कि किसकी AI टीम बेहतर बनाई गई है, न कि किसका मॉडल पैरामीटर बड़ा है।

जितना सस्ता और उपयोग के लिए तैयार उत्पाद के रूप में मॉडल होगा, उतना ही मानवीय स्वीकृति और नियंत्रण मूल्यवान होगा।

पहले, लोग समस्याओं को हल करने वाले थे। अब, लोग समस्याएँ बनाने और स्वीकार करने वाले हैं।

गार्टनर ने क्लॉड के लिए हाथ से लिखा गया सबूत ढूंढा, और जब उन्हें पता चला कि किसी ने लीन का उपयोग करके इसे सत्यापित कर दिया है, तो उन्होंने कहा, "यह वास्तव में अच्छी बात है," क्योंकि वे "हाल के समय में अधिक गलतियाँ करने लगे हैं।"

88 वर्षीय ट्यूरिंग पुरस्कार विजेता के प्रमाण भी वेरिफायर से गुजरने पड़ते हैं, इसलिए AI द्वारा लिखे गए प्रमाणों को भी अपवाद नहीं होना चाहिए।

समाधान का काम मशीनें और अधिक करती जाएंगी। स्वीकृति के चरण पर, हमेशा किसी इंसान को निगरानी करनी चाहिए।

संदर्भ:

https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner

https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf

यह लेख वेचेन ग्रुप "न्यूज़िज़युएन" से आया है, लेखक: ASI उपदेश, संपादक: युआनयू

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।