GPT-6 Astra का ARC-AGI-3 में निर्बाध स्कोर AGI पर बहस को जन्म देता है

iconMetaEra
साझा करें
AI summary iconसारांश
GPT-6 Astra ने ARC-AGI-3 पर लगभग पूर्ण अंक प्राप्त किए, जिसमें प्रतीकात्मक विश्व मॉडल का उपयोग करके 96% कार्यों में मनुष्यों से बेहतर जटिल पहेलियाँ हल कीं। इस परीक्षण की लागत $18,000 थी, और आलोचकों का कहना है कि इसने वास्तविक AGI के बजाय बाहरी उपकरणों पर निर्भरता रखी। जोखिम-आधारित संपत्तियों में बढ़ती रुचि के बीच, मॉडल के प्रदर्शन ने वास्तविक AI प्रगति और उच्च लागत वाली गणना के बीच के अंतर के बारे में प्रश्न उठाए हैं। CFT एजेंसियाँ पहले से ही देख रही हैं कि AI में हो रहे प्रगति कैसे नियामक ढांचे पर प्रभाव डाल सकती है।
GPT-6 Astra को ARC-AGI-3 परीक्षण में 100% के करीब स्कोर मिलने से ध्यान आकर्षित हुआ। यह मॉडल दक्ष “सिंबोलिक वर्ल्ड मॉडल” बनाकर वास्तविक दुनिया को तार्किक प्रतीकों और कारण-परिणाम कोड में अमूर्त करता है, और अज्ञात ग्राफिक गेम में स्वयं DSL बीजगणित प्रतीक प्रणाली बनाकर पर्यावरण के नियमों को दर्ज करता है, फिर “वर्चुअल सैंडबॉक्स” का निर्माण करके उसमें प्रतिक्रिया के पहले सिमुलेशन करता है। हालाँकि, उच्च स्कोर के पीछे प्रति प्रश्न 360 डॉलर, और पूरे परीक्षण के लिए 18,000 डॉलर की महंगी कैलकुलेशन लागत है। ARC Prize फाउंडेशन के अध्यक्ष ग्रेग कैम्रैड ने बताया कि उच्च स्कोर Harness बाहरी फ्रेमवर्क पर निर्भर है, और यह वास्तविक AGI की उपलब्धि नहीं है, बल्कि केवल यह साबित करता है कि AI समझदार होता जा रहा है।

लेखक, स्रोत: लेफेंगवेन

AI क्षमता परीक्षा को तोड़ दें! GPT-6 Astra का सिंबल वर्ल्ड मॉडल, क्रांति है या पैसों से स्कोर बढ़ाया गया?

प्रत्येक प्रश्न पर 360 डॉलर जलाते हुए, क्या GPT-6 वास्तव में AGI पार कर गया है?

OpenAI का सबसे शक्तिशाली मॉडल GPT-6 Astra अंततः लॉन्च हो गया है, जो कंप्यूटर ऑपरेशन, शोध अनुसंधान और सुरक्षा रक्षा में आश्चर्यजनक क्रांति लाता है। इन सभी उल्लेखनीय उपलब्धियों में, सबसे अधिक चर्चा में आया है कि यह ARC-AGI-3 परीक्षण में 100% के करीब पहुँच गया है।

AI क्षमता परीक्षा को तोड़ दें! GPT-6 Astra का सिंबल वर्ल्ड मॉडल, क्रांति है या पैसों से स्कोर बढ़ाया गया?

ARC-AGI-3 क्या है? यह वर्तमान में वैश्विक प्रौद्योगिकी समुदाय द्वारा स्वीकृत AI "बुद्धिमत्ता" मूल्यांकन सूची है, जिसे आप AI के लिए मेन्सा क्लब प्रवेश परीक्षा के रूप में समझ सकते हैं।

इस परीक्षण में सभी प्रश्न लगातार बदलते आकृति पैटर्न पर आधारित हैं, जिन्हें बस अभ्यास से हल नहीं किया जा सकता; AI को मानव की तरह परिवेश का पता लगाना, लक्ष्य का अनुमान लगाना, और स्थिति के अनुसार प्रतिक्रिया देकर और तर्क करके पैटर्न पहचानना होगा। यह विभिन्न मूल्यांकनों में एक उन्नत स्तर का परीक्षण है, जो यह दर्शाता है कि AI केवल एक उपकरण है या वास्तविक बुद्धिमत्ता रखता है।

और GPT-6 Astra ने इस परीक्षण को पूरी तरह से पार कर दिया, जबकि पिछला मॉडल GPT-5.6 Sol का स्कोर केवल 38.3% था, जो वास्तव में एक विशाल कूद है। यह बुद्धिमत्ता मानवीय क्षमताओं को भी पीछे छोड़ देती है; 96% स्तरों में, इसकी कार्यक्षमता मानव से अधिक है, और औसत क्रिया चरण मानव से 51.7% कम है।

अगर एक AI पूरी तरह अज्ञात परिस्थितियों में, तार्किक नियमों की स्थापना और समस्याओं के समाधान की क्षमता वास्तव में प्राप्त कर लेता है, तो हम कल्पना कर सकते हैं कि भविष्य में, यह अज्ञात स्व-चालित वाहन यातायात की स्थितियों में सही निर्णय ले सकता है, या एक नए, अज्ञात वायरस के प्रकोप के समय, तुरंत प्रभावी दवा की अणु संरचना का अनुमान लगा सकता है।

GPT-6 Astra के इतने बुद्धिमान होने का कारण जानने के लिए, ARC Prize की आधिकारिक टीम ने इसके बैकएंड रिकॉर्ड्स का पुनर्विश्लेषण किया और पाया कि यह गेम खेलते समय कुशल "सिंबोलिक वर्ल्ड मॉडल" बनाता है।

AI क्षमता परीक्षा को तोड़ दें! GPT-6 Astra का सिंबल वर्ल्ड मॉडल, क्रांति है या पैसों से स्कोर बढ़ाया गया?

सिंबल वर्ल्ड मॉडल "वर्ल्ड मॉडल" का उन्नत विकास है। जब वर्ल्ड मॉडल कलाकार की तरह भविष्य की भविष्यवाणी के लिए चित्रों का उपयोग करता है; तो सिंबल वर्ल्ड मॉडल एक गणितज्ञ की तरह है, जो वास्तविक दुनिया को तार्किक प्रतीकों और कारण-प्रभाव कोड में सारांशित करता है।

यह तकनीक AI के उन्नत तर्क की ओर जाने का एक अनिवार्य चरण मानी जाती है।

What is the Symbol World Model?

पिछले समय में, ARC-AGI बेंचमार्क सीरीज में कई बड़े मॉडल्स को उच्च स्कोर नहीं मिल पाने का एक महत्वपूर्ण कारण यह था कि वे "बलपूर्वक प्रयास और त्रुटि" की आदत में थे। AI गेम की छवि को पिक्सेल ब्लॉक में काट देता है, पहले कहीं भी क्लिक करता है, अगर गलत होता है तो दिशा बदल देता है, और सफलता के लिए भाग्य पर निर्भर करता है।

इस मोड में, भले ही कुछ स्कोर के ब्रेकआउट हों, AI वास्तव में गेम के नियमों को समझता और आत्मसात नहीं करता।

सिंबल वर्ल्ड मॉडल इसलिए सभी कुछ पर नियंत्रण रखता है क्योंकि यह अपने वातावरण के भौतिक नियमों और कारण-परिणाम संबंधों को पूरी तरह समझकर, सूक्ष्म गणना के माध्यम से निर्णय लेता है।

वास्तविक परीक्षण में, जब GPT-6 Astra अपरिचित ग्राफिक्स गेम में प्रवेश करता है, तो यह अपने द्वारा बनाए गए DSL, एक विशिष्ट बीजगणितीय प्रतीक प्रणाली का उपयोग करके, अवलोकित वातावरण के लिए विस्तृत नोट्स लेना शुरू कर देता है। उदाहरण के लिए, यह गेम के संभावित अंतर्निहित नियमों, आगे निष्पादित होने वाले निर्देशों की श्रृंखला, और यहां तक कि प्रत्येक पिक्सेल की गति को निर्देशांक प्रणाली पर सटीकता से मैप करता है।

इस बीजगणितीय रिकॉर्डिंग शैली से एक अद्वितीय और निश्चित विश्व अवस्था प्राप्त होती है, जो पिछले मॉडल में प्राकृतिक भाषा के इंटरैक्शन से उत्पन्न अस्पष्टता की तुलना में इस संकेतात्मक अभिव्यक्ति से शुद्धता में ऐतिहासिक क्रांति लाती है।

फिर, यह मन में एक Python कोड लॉजिक लिखता है: "अगर मैं A दबाता हूँ, तो ग्राफ 90 डिग्री बाएँ मुड़ जाएगा।"

फिर, यह अपने मस्तिष्क में एक "वर्चुअल सैंडबॉक्स" बनाता है और अगली योजना का अनुकरण करता है। जब तक यह तार्किक बंद चक्र और सटीकता की पुष्टि नहीं कर लेता, तब तक यह वास्तविक गेम में पहला कदम नहीं उठाता। यही कारण है कि इसकी संचालन कुशलता मानव से कहीं अधिक है।

GPT-6 Astra की क्षमता की सीमाओं को समझने के लिए, रेड टीम टेस्टिंग प्लेटफॉर्म PRO‑LONG ने इसे कोड सैंडबॉक्स में डाल दिया, जहाँ AI स्वयं कस्टम कोड लिख सकता है और उसे चला सकता है।

परिणामस्वरूप, GPT-6 Astra ने प्रत्येक गेम के लिए "कस्टमाइज़ड" उपकरण बनाना शुरू कर दिया। उदाहरण के लिए, एक जटिल लैबरिंथ गेम में जहां गार्ड्स घूम रहे थे, GPT-6 Astra ने खुद ही एक नेविगेशन सिस्टम लिखा, फिर लड़ाई के नियम जोड़े, और गार्ड्स की पैटर्न को सिमुलेट किया, अंत में इस स्व-निर्मित टूलचेन के माध्यम से परिणाम का पूर्वानुमान और पुष्टि की।

पिछले कुछ वर्षों में, इस प्रतीक निष्कर्षण और स्वयं के उपकरण बनाने की क्षमता पूरी तरह से बाहरी Harness एक्सटेंशन फ्रेमवर्क पर निर्भर थी। एक्सटेंशन मॉडल के लिए चित्रण, स्थिति रिकॉर्डिंग और परिणाम सत्यापन करने में मदद करता था, लेकिन इसके गंभीर नुकसान थे: मॉडल और एक्सटेंशन के बीच डेटा के आवागमन से उच्च लेटेंसी होती थी; एक्सटेंशन की इंजीनियरिंग क्षमता मॉडल के वजन प्रशिक्षण से पूरी तरह से अलग थी; और क्लाउड कॉम्प्यूटिंग वातावरण और बाहरी स्क्रिप्ट्स पर भारी निर्भरता के कारण, ऐसी उन्नत क्षमताओं को एंड-साइड एज हार्डवेयर पर स्थापित करना मुश्किल था।

और GPT-6 Astra अब Harness की बड़ी संख्या में क्षमताओं को अपने मॉडल के वजन में शामिल कर लेता है। सांकेतिक दुनिया मॉडल के समर्थक प्रमुख विद्वान गैरी मार्कस ने GPT-6 Astra की इस दिशा में बड़ी जीत की प्रशंसा की।

पिछले एक या दो वर्षों में, हार्वर्ड, MIT से लेकर Google DeepMind तक, शैक्षणिक और उद्योग के क्षेत्रों में इस दिशा में कई महत्वपूर्ण उपलब्धियाँ आई हैं, और सभी “सिंबोलिक वर्ल्ड मॉडल” पर निवेश कर रहे हैं। AGI की ओर जाने वाले अनगिनत शाखा मार्गों पर, उद्योग कुछ निम्न स्तरीय तकनीकी सहमति पर पहुँच रहा है।

इतना अच्छा स्कोर, क्या AGI अब निश्चित है?

प्रश्नकर्ता खुद ठंडा पानी बहा रहे हैं

दिलचस्प बात यह है कि जब पूरे इंटरनेट पर इस रैंकिंग स्कोर के बारे में उत्साह था, तो कई लोगों ने OpenAI के अध्यक्ष ग्रेग ब्रॉकमैन के “AGI आ गया है” कहने का साझा किया, जबकि ARC Prize फाउंडेशन के अध्यक्ष ग्रेग काम्राडट ने स्वयं ठंडा पानी बहाया।

वह प्रश्न निर्माताओं में केंद्रीय व्यक्ति है, जिसके पास आधार कैसे डिज़ाइन किया जाए और अंकों की व्याख्या कैसे की जाए, इसके बारे में सबसे अधिक बात करने का अधिकार है। मूल्यांकन के दृष्टिकोण से, वह मानता है कि अंक सच हैं, लेकिन यह AGI से लाखों किलोमीटर दूर है।

अब तक, उसने कई टीमों को देखा है जिन्होंने Agent Harness के साथ ARC-AGI-3 पर 90% से अधिक प्राप्त किया है, जैसे कि अत्यधिक स्मृति एक्सट्रा के साथ PRO-LONG, गहन अनुमान के लिए विशेषज्ञ Tycho, और स्वयं के प्रोग्रामिंग वातावरण को विकसित करने वाला Prime Agent।

इन उच्च स्कोर वाले उत्पादों में एक सामान्य तकनीकी विधि है, जिसमें नुकसानरहित मेमोरी, प्रोग्रामेटिक विश्लेषण, स्पष्ट अनुमान परीक्षण, स्थायी अवस्था और कम लागत वाली आंतरिक गणना शामिल हैं।

अनुकूलित मेमोरी याददाश्त के लिए जिम्मेदार है, प्रोग्रामेटिक विश्लेषण तर्क के लिए, स्पष्ट अनुमान परीक्षण निष्कर्ष निकालने के लिए, स्थायी स्थिति बहु-चरण बातचीत के संदर्भ के लिए, और कम लागत आंतरिक गणना सस्ती आंतरिक कंप्यूटेशनल पावर के लिए, जिससे AI वर्चुअल वातावरण में गलतियाँ करने के बाद सही उत्तर दे सके। ये सभी मिलकर एक अजेय हैरनेस बनाते हैं, जो मॉडल की अपनी कमियों को पूरा करता है।

GPT-6 Astra ने 100% का स्कोर प्राप्त किया, जिसमें एक शानदार हैरनेस का उपयोग किया गया, जिसने विशेष रूप से अनुकूलित "सप्लायर एडैप्टर बेस" का उपयोग करके लगातार संवाद और संदर्भ संपीड़न के माध्यम से तर्क श्रृंखला को समर्थन दिया; प्रत्येक गेम पूरा होने पर 360 डॉलर की महंगी कैलकुलेशन लागत खर्च होती है। यदि पूरी परीक्षा पूरी की जाए, तो कुल कैलकुलेशन बिल 18,000 डॉलर (लगभग 1.35 लाख रुपये) तक पहुँच सकता है!

एक इंसान एक ग्राफिक पहेली को हल करने में केवल कुछ मिनट लगा सकता है, मानव दिमाग के 20W चयापचय शक्ति के आधार पर बिजली का खर्च आधे सेंट से कम है; भले ही प्रतिभागियों को वास्तविक घंटेवार मजदूरी का भुगतान किया जाए, तो प्रति गेम का खर्च केवल 12.78 डॉलर होता है, जबकि AI को 360 डॉलर खर्च करने पड़ते हैं। क्या इस "पैसे की शक्ति" से प्राप्त परिणाम सामान्य लोगों के लिए सुलभ AGI बन सकते हैं?

जी हाँ, GPT-6 Astra ने Harness की क्षमताओं को धीरे-धीरे अंतर्निहित करना शुरू कर दिया है, और यदि यह विकास जारी रहा, तो मॉडल के अंदर की संभावित गणना क्षमता और अधिक शक्तिशाली होती जाएगी। हालाँकि, चूँकि इसकी तर्क प्रक्रिया अब अपारदर्शी हो गई है, डेवलपर्स को नहीं पता कि AI सचमुच समझ गया है या इसने अधिक कुशल धोखेबाजी का रास्ता खोज लिया है।

ऊपर के प्रश्न पर वापस जाएं, GPT-6 Astra को AGI माना जा सकता है?

इस प्रश्न के लिए, ग्रेग कैम्राड्ट ने अपनी लंबी लेख के अंत में एक दार्शनिक उत्तर दिया। मानवता को "सार्वभौमिक बुद्धिमत्ता" क्यों माना जाता है, क्योंकि मानव किसी भी अज्ञात दुनिया में अनुकूलित हो सकता है, भले ही प्राचीन बच्चे को आधुनिक समय में फेंक दिया जाए, वह फिर भी मेट्रो का उपयोग करना और मोबाइल फोन का उपयोग करना सीख सकता है। यह बुद्धिमत्ता हजारों वर्षों तक जारी रही है और तकनीकी प्रगति को आगे बढ़ाती रही है। लेकिन अब प्रौद्योगिकी क्षेत्र जिस परीक्षा के माध्यम से AI को पास करने के लिए पैसे खर्च कर रहा है, वह केवल AI के लिए एक "ग्राफिकल मैच-3 परीक्षा" है।

यह केवल यह साबित करता है कि AI समझदार हो रहा है, लेकिन AGI के आने का कोई सबूत नहीं है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।