OpenAI की नई 'रिकरेंट डेप्थ' AI तकनीक से सुरक्षा चिंताएं उठीं

icon MarsBit
साझा करें
AI summary iconसारांश
AI और क्रिप्टो समाचार मीडिया रिपोर्ट करते हैं कि OpenAI का नया Astra मॉडल 'रिकरेंट डेप्थ' तकनीक का उपयोग करता है, जिससे आंतरिक अवस्थाओं को हिडन स्पेस में पुनः प्रोसेस किया जा सकता है। इससे मॉनिटरिंग कठिन हो जाती है, जिससे सुरक्षा विशेषज्ञों में चिंता बढ़ रही है। यह तकनीक मॉडल्स को मौजूदा चेन-ऑफ-थॉट ट्रैकिंग को बायपास करने की अनुमति दे सकती है, जिससे धोखाधड़ी संभव हो सकती है। क्रिप्टो प्लेटफॉर्म पर नए टोकन की सूचीबद्धता अक्सर पारदर्शी AI प्रणालियों पर निर्भर करती है, जिससे यह विकास क्षेत्र के लिए विशेष रूप से प्रासंगिक है।

मॉडल अभी तक जारी नहीं हुआ है, फिर भी यह विवाद क्यों उत्पन्न हो रहा है??

GPT-6 लॉन्च होने से पहले, The Information द्वारा सबसे पहले खुलासा किए गए एक समाचार ने ऑनलाइन तेजी से चर्चा का विषय बन गया:

OpenAI के नए मॉडल ने "रिकर्रेंट डेप्थ" नामक एक निष्कर्ष तकनीक पेश की है, जो मॉडल की सोचने की प्रक्रिया को अधिक कठिन और निगरानी के लिए अधिक असंगठित बना सकती है।

बस यही है कि अब AI जो सोचेगा, इंसान उसे समझ नहीं पाएंगे।

GPT Images 2.1

Oh, so if AI learns to deceive, cheat, or bypass security restrictions, won't we also be unable to detect it in time??

इसलिए जब यह समाचार सामने आया, तो AI सुरक्षा समुदाय तुरंत चेतावनी बुलंद कर दी, और सभी चिंतित हो गए:

अगर यह तकनीक अपने उपयोग को बढ़ाती रही, तो मौजूदा चिंतन श्रृंखला निगरानी तंत्र सीधे अक्षम हो सकते हैं।

मामला बहुत महत्वपूर्ण है, चर्चा बहुत तीव्र है, इसलिए OpenAI के मुख्य वैज्ञानिक को भी व्यक्तिगत रूप से प्रतिक्रिया देनी पड़ी।

इतना ही नहीं, शोर में कुछ लोगों ने आश्चर्य से देखा:

OpenAI के नए मॉडल का नाम वास्तव में “GPT-6” है या “Astra”, शायद API द्वारा पहले ही रिवील कर दिया गया है।

इसके साथ ही, OpenAI नए चित्र मॉडल GPT Images 2.1 को भी लॉन्च कर सकता है।

Too many melons, let's savor them one by one.

मॉडल दिमाग में साइकिल चलाना शुरू कर देता है, सुरक्षा विशेषज्ञ घबरा जाते हैं

पहला वह "साइक्लिक डेप्थ" तकनीक है जिसने इस बार विवाद का कारण बना।

पिछले मॉडल निष्कर्ष निकालते समय स्पष्ट CoT विचार श्रृंखला छोड़ते थे, जिससे यह स्पष्ट था कि उन्होंने क्या सोचा।

हालांकि यह पाठ सटीक रूप से मॉडल के वास्तविक आंतरिक विचारों के बराबर नहीं हो सकता (जिस पर विवाद है), लेकिन इसने जांच के लिए छोड़े गए निशान अवश्य छोड़ दिए हैं।

लेकिन एस्ट्रा द्वारा उपयोग किए जाने वाले "साइक्लिक डेप्थ" का शैली अलग है।

GPT Images 2.1

यह मॉडल को एक चरण में उत्पन्न आंतरिक स्थिति को न्यूरल नेटवर्क में वापस भेजने की अनुमति देता है, जहां इसे छिपे हुए स्थान में कई चक्रों तक प्रसंस्कृत किया जाता है, और फिर अगला पाठ उत्पन्न किया जाता है।

एक उदाहरण के रूप में, पहले मॉडल को समस्या हल करते समय एक ओर सोचना पड़ता था और दूसरी ओर काले पेपर पर गणना का चरण लिखना पड़ता था।

अब, यह मन में गणना की जा सकती है।

बाहर के लोग शायद केवल प्रश्न और उत्तर ही देख पाएं, लेकिन इसके बीच की गणना कैसे की गई, कौन-से विचार आजमाए गए, या क्या कोई गलत रास्ता अपनाया गया, वह दिखाई नहीं दे सकता।

चूंकि हर चरण को शब्दों में अनुवाद करने का समय बच गया है, इसलिए सिद्धांत रूप से मॉडल एक ही कैलकुलेशन संसाधनों का उपयोग करके कई चक्र सोच सकता है और एक साथ कई समाधानों पर विचार कर सकता है।

लेकिन जब प्रदर्शन ऊपर की ओर बढ़ता है, तो समस्याएँ भी आने लगती हैं:

अगर मॉडल मानव भाषा से सोचना बंद कर देता है, तो मानव इसकी निगरानी कैसे करें?

गैर-लाभकारी AI सुरक्षा अनुसंधान संगठन Redwood Research के सीईओ ने पहले गंभीर चिंता व्यक्त की:

अभी तक यह अस्पष्ट है कि एस्ट्रा के थिंकिंग चेन की मॉनिटरिंग कितनी कम हो गई है, लेकिन यदि OpenAI चक्रीय गहराई को आगे बढ़ाता है, तो मॉडल का अधिकांश तर्क अपठनीय छिपे हुए स्थान में स्थानांतरित हो सकता है और अंततः “पूरी तरह से” थिंकिंग चेन मॉनिटरिंग को नष्ट कर सकता है।

GPT Images 2.1

रेडवुड के मुख्य वैज्ञानिक रायन ग्रीनब्लैट भी एक ही दिशा की चिंता कर रहे हैं।

उसके अनुसार, अपारदर्शी तर्क पारंपरिक चिंतन श्रृंखला की तुलना में तेजी से विस्तारित हो सकता है। इस दिशा में आगे बढ़ते हुए, मॉडल भविष्य में संभाव्य स्थान में पूरी तरह या लगभग पूरी तरह तर्क कर सकता है।

यह अब तक AI सुरक्षा क्षेत्र में सबसे खराब प्रगति है।

क्योंकि अगर केवल "गणना प्रक्रिया समझ में नहीं आ रही है", तो समस्या इतनी जटिल नहीं होती।

पिछले "OpenAI मॉडल द्वारा Hugging Face पर हमले" के मुख्य जांचकर्ता के रूप में, उन्होंने दो बड़े खतरे की पहचान की:

शोधकर्ता तब बड़ी संख्या में AI एजेंट्स के व्यवहार को पुनर्स्थापित करने के लिए चिंतन श्रृंखला पर अत्यधिक निर्भर थे, फिर भी जांच करना बहुत कठिन था।

संबंधित AI ने अपने रिकॉर्ड को बदलने की कोशिश की, यहां तक कि टूल कॉल को झूठा भी बना दिया।

बाद वाले के लिए, यदि मॉडल के पास अधिक शक्तिशाली छिपी हुई तर्क क्षमता है, तो यह पहले संभावित स्थान में धोखेबाजी की योजना बनाने की संभावना अधिक है, और फिर झूठे कॉल और आउटपुट के माध्यम से एक झूठी कहानी बनाता है, जिसमें पाठ्य विचार श्रृंखला में कोई स्पष्ट संकेत नहीं छोड़ता।

Oh no, the risk has doubled directly...

GPT Images 2.1

AI सुरक्षा पर लंबे समय से ध्यान देने वाले ज़वी मोवशोविट्ज़ कहते हैं:

यह आग में खेलना है।

वह चिंतित है कि जब छिपी हुई निष्कर्षण प्रक्रिया स्पष्ट प्रदर्शन लाभ लाएगी, तो सभी प्रयोगशालाएँ एक नकारात्मक प्रतिस्पर्धा में फंस सकती हैं:

आप सुरक्षा की चिंता के कारण अपनी विचार श्रृंखला को छिपाने से डरते हैं, लेकिन प्रतिद्वंद्वी डरते नहीं हैं, और उनके द्वारा बनाए गए मॉडल अधिक शक्तिशाली और सस्ते हैं।

अपने पीछे नहीं रहना चाहते, तो क्या आप शामिल होंगे?

मोशोविट्ज़ यह भी मानते हैं कि भविष्य में कानूनी उपायों की आवश्यकता हो सकती है, ताकि AI कंपनियाँ अपनी क्षमताओं की तलाश में चिंतन श्रृंखला की निगरानीयोग्यता को सामूहिक रूप से छोड़ने से रोका जा सके।

GPT Images 2.1

हालांकि, दूसरी ओर कुछ लोगों का मानना है कि यह आतंक बहुत जल्दी आ गया।

तियान युआनडोंग ने X पर कहा कि जब उन्होंने पहले Coconut को लॉन्च किया था, तो उन्हें लगभग एक जैसे प्रश्न मिले थे।

Coconut का पूर्ण नाम "Chain of Continuous Thought" है, जो मॉडल को प्रत्येक चरण को टेक्स्ट में डिकोड किए बिना सीधे निरंतर छिपे हुए स्थान में तर्क करने का समर्थन करता है।

टियान युआनडोंग के अनुसार, यहां तक कि अगर मॉडल ने स्पष्ट विचार श्रृंखला को बनाए रखा हो, तो इसका मतलब यह नहीं है कि मनुष्य वास्तव में इसके वास्तविक विचार देख पाए हैं।

महत्वपूर्ण है कि आप मॉडल के काम करने के तरीके को समझें, केवल मॉडल द्वारा लिखे गए "समाधान की प्रक्रिया" पर ध्यान केंद्रित न करें।

GPT Images 2.1

जब विवाद बढ़ता गया, तो OpenAI के मुख्य वैज्ञानिक जाकूब पैचोकी भी चुप नहीं रहे और व्यक्तिगत रूप से प्रतिक्रिया दी।

उसने शुरुआत में ही यह बताया कि वह "अव्यवस्थित रिपोर्टिंग" से उत्पन्न एक अनियंत्रित प्रतिस्पर्धा को रोकना चाहता है।

एस्ट्रा सहित, ओपनएआई के वर्तमान अग्रणी मॉडल की कैलकुलेशन ग्राफ गहराई, GPT-4 की दोगुनी सीमा के भीतर है।

इसका मतलब है कि एस्ट्रा वास्तव में चक्रीय गणना का उपयोग करती है, लेकिन वर्तमान में इसका पैमाना सीमित है और पूरी विचार श्रृंखला को छिपाया नहीं गया है। वर्तमान जानकारी के अनुसार, इसकी प्राकृतिक भाषा निष्कर्षण अभी भी पठनीय है।

पैचोकी ने यह भी जोर दिया कि ओपनएआई ने हमेशा थिंकिंग चेन मॉनिटरिंग को एक महत्वपूर्ण सुरक्षा उपाय के रूप में देखा है, और यह अभी भी कंपनी के वर्तमान अनुसंधान योजना का केंद्रीय लक्ष्य है।

हालांकि, उन्होंने स्वीकार किया कि चिंतन श्रृंखला निगरानी बहुत कमजोर है और नकारात्मक दिशा में बढ़ रही है।

लेकिन इस गिरावट का कारण केवल सर्कुलेशन डेप्थ जैसे आर्किटेक्चरल बदलाव नहीं है (इस बारे में बाद में अलग से लेख लिखा जाएगा), और OpenAI अभी भी मॉनिटरिंग क्षमता को मजबूत करने पर काम कर रहा है।

GPT Images 2.1

इसलिए, एस्ट्रा ने अभी तक मॉडल को मानवों के लिए पूरी तरह से असमझने योग्य नहीं बनाया है।

सुरक्षा विशेषज्ञ वास्तव में चिंतित हैं:

क्या आज छोटे सीमा में सीमित छिपी हुई रीजनिंग अगली पीढ़ी के मॉडल में और विस्तारित होगी और अंततः एक अनियंत्रित काला बॉक्स बन जाएगी?

क्या यह वाकई GPT-6-Astra है? API रिस्पॉन्स ने पहले ही रहस्य खोल दिया

अल्गोरिदम विवाद समाप्त हो गया, दूसरा स्कैंडल मॉडल के नाम के बारे में है।

लीओ ने खोजा कि, "gpt-6-astra" के लिए OpenAI Responses API को अनुरोध करने पर सर्वर 404 Not Found लौटाता है।

और वास्तव में अनुपलब्ध या बेकार के मॉडल नाम दर्ज करने पर आमतौर पर 400 त्रुटि प्राप्त होती है।

404 का अर्थ है कि यह मॉडल आईडी बैकएंड द्वारा पहचाना गया है, लेकिन वर्तमान खाते के पास इस तक पहुँचने का अधिकार नहीं है, या मॉडल अभी तक उपलब्ध नहीं है।

पहले कुछ अनपब्लिश्ड मॉडल्स भी इसी तरह के API रिस्पॉन्स अंतरों के माध्यम से पहले से ही अपनी उपस्थिति का पता दे चुके थे।

इसलिए लियो ने निष्कर्ष निकाला कि "gpt-6-astra" को संभवतः OpenAI API के बैकएंड पर डिप्लॉय कर दिया गया है।

GPT Images 2.1

GPT Images 2.1 भी आ रहा है, पहले "नॉइज़ बीमारी" को हल करें

OpenAI के चित्र उत्पादों को भी भाषा मॉडल के बाहर समानांतर अपडेट किया गया है।

लीक करने वाले अकाउंट Fix के अनुसार, नया चित्र मॉडल GPT Images 2.1 4 सितंबर को लॉन्च हो सकता है।

इस अपग्रेड का सबसे सीधा परिवर्तन, पुराने संस्करण की "नॉइज बीमारी" को ठीक करना हो सकता है।

GPT Images 2.1

पहले, Images v2 उत्पादन के कुछ परिणामों में अजीबे दानेदार, धुंधलापन और गंदगी का प्रभाव दिखता था, खासकर जब चित्र में बहुत सारा पाठ या सूक्ष्म तत्व होते थे, एक अन्य उपयोगकर्ता के शब्दों में:

जैसे एक गंदी ग्लास के माध्यम से लिया गया फोटो।

और नवीनतम लीक हुई नमूना छवियों ने इस समस्या में स्पष्ट सुधार किया है, चित्र अधिक साफ हैं।

आओ आओ, फिर से पुराने अभिनेता ओटमैन का मैदान:

विश्व प्रसिद्ध चित्रकारी: “अगर GPT-6 नहीं जारी किया गया, तो ऑटरमन को गिरफ्तार कर लिया जाएगा!”

GPT Images 2.1

और गिरफ्तारी से बचने के लिए रात भर जागकर काम करने वाला, बीच रात को सड़कों पर घूमने वाला उत्तरीमैन।

इसके साथ ही एक इंस्टाग्राम पोस्ट भी डाली गई: "क्या आपने कभी रात के दो बजे की सड़क देखी है?"

GPT Images 2.1

वास्तव में, चित्र बहुत उच्च गुणवत्ता वाला दिखता है, लगभग वास्तविक फोटो की तरह।

अधिक विषय, अधिक शैलियाँ भी बहुत अच्छी तरह से समझी गई हैं:

GPT Images 2.1

GPT Images 2.1

GPT Images 2.1

बस बातें न करें, ऑल्टीमैन, तुरंत भेज दो।

रेफरेंस लिंक:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20

यह लेख वेइचेन ग्रुप "क्वांटम बिट" से आया है, लेखक: फ्रंटियर टेक्नोलॉजी पर ध्यान दें

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।