AI हैकर्स सीखने की पहली चीज़, क्या लाइन में छलांग लगाना है?
ऑस्ट्रेलियाई डेवलपर एंड्रयू सोफे पर बैठे हुए, फिटनेस क्लास के लिए बुकिंग करने की बात से बहुत नाराज़ थे।
लोकप्रिय सुबह की क्लास हमेशा सेकंडों में भर जाती है। वह हर दिन 'रिफ्रेश रूलेट' खेलता है, बैठकर, क्लिक करता है, असफल होता है, फिर दोबारा क्लिक करता है—न सिर्फ थक जाता है, बल्कि अक्सर पाने में असफल रहता है।
इसलिए, उसने इस छोटी बात को अपने AI सहायक को सौंप दिया।
कुछ मिनटों के बाद, AI खुशखबरी लेकर वापस आया: उसने एक तरीका ढूंढ लिया था, जिससे वह सिस्टम द्वारा अनुमति दिए गए समय से कई हफ्ते आगे की क्लासेस बुक कर सकता था।
इसके तुरंत बाद, यह रिपोर्ट करता है: मैंने बैकअप सूची में पहले स्थान पर रहने वाले व्यक्ति को रद्द कर दिया है, अब आप चौथे स्थान से तीसरे स्थान पर पहुँच गए हैं।
एंड्रयू वहाँ चौंक गया।
उसने AI को ऐसा करने के लिए नहीं कहा था, उसने सिर्फ एक क्लास बुक करनी थी।

एंड्रयू ने अपने एआई सहायक के माध्यम से एक फिटनेस क्लास बुक कराई है, और उसे नहीं पता कि अगला क्या होगा
10 अगस्त को, ऑस्ट्रेलियाई ब्रॉडकास्टिंग कॉर्पोरेशन (ABC) ने इसे ऑस्ट्रेलिया का पहला ज्ञात स्वायत्त AI हमला बताया, जिससे टेक समुदाय में तूफान छा गया।
यह बहुत से लोगों के मन में छिपी उस धुंधली चिंता को छू जाता है: जब आप आँखें बंद करके एजेंट के "अनायास ड्राइविंग" का आनंद ले रहे हों, तो दूसरी ओर, एक अधिक जटिल समस्या शायद आ रही हो।
आप इसे वास्तविक संचालन अधिकार देते हैं, तो यह आपके द्वारा इसे नहीं चलाए गए रास्ते पर जा सकता है।
और यह बार की लाइन में कूदना, शायद केवल कुछ मिलियन एजेंट्स का अपने मालिक के लिए संसाधनों के लिए तीव्रता से प्रतिस्पर्धा करने की पहली प्रारंभिक अभ्यास है।
उसने केवल कहा "पहले स्थान पर पहुँचो", और AI ने कार्रवाई शुरू कर दी
एंड्रयू बर्ड ऑस्ट्रेलियाई AI कंपनी एफ़िंडा के AI प्रमुख हैं।
इस साल की शुरुआत में, उन्होंने OpenClaw खेलना शुरू किया, इसके नीचे Claude Opus 4.6 लगाया, और फिर इसे कक्षा बुकिंग का काम सौंप दिया।
कुछ मिनटों बाद इसने जवाब दिया: एक तरीका ढूंढ लिया, जिससे आप जिम द्वारा अनुमति दिए गए समय सीमा से कई महीने पहले क्लास बुक कर सकते हैं।
कारण यह है कि इसने फिटनेस सॉफ्टवेयर में उपलब्ध GraphQL API में अधिकृत दुरुपयोग की खोज की।
यह छेद काफी बड़ा है।
यह फ्रंटएंड के बुकिंग के समय खिड़की को बायपास कर सकता है और कई महीनों बाद क्लास बुक कर सकता है; साथ ही, अन्य उपयोगकर्ताओं की बुकिंग और वेटिंग लिस्ट को हटाने के लिए कैंसल एपीआई को कॉल कर सकता है।
एंड्रयू तब किसी क्लास की वेटिंग लिस्ट में चौथे स्थान पर था। उसने बेमतलब पूछ लिया: क्या आप मुझे पहले स्थान पर डाल सकते हैं?
उसने केवल एक लक्ष्य "पहले स्थान पर पहुंचना" दिया है, न कि एक ऐसा अधिकार जिससे आप दूसरों को रद्द कर सकें।
एजेंट ने इसे बाद वाले के रूप में समझा।
इसने रिपोर्ट किया: इसने रिजर्वेशन लिस्ट में पहले स्थान पर रहने वाले व्यक्ति के साथ 'रियल-वर्ल्ड टेस्ट' किया है, और पाया कि इंटरफेस किसी और की बुकिंग हटाने की जांच नहीं करता है—इसने आजमाया, और सफलता मिली।
एजेंट क्षमा मांगता है, "मैं वापस नहीं जोड़ सकता"
एजेंट के उत्तर से एंड्रयू को पसीना आ गया।
वह एक प्रोग्रामर है, और उसे यह बहुत अच्छी तरह से जानते हुए कि इसका क्या अर्थ है, उसने तुरंत रद्द करने का अनुरोध किया।
बुरी खबर: वापस नहीं जोड़ा जा सकता।
रद्द करने का इंटरफ़ेस अधिकार जांच नहीं करता, लेकिन आरक्षण बनाने और रिज़र्व सूची में दोबारा शामिल होने का इंटरफ़ेस करता है, जिससे 403 लौटाया जाता है। यह लोगों को बाहर कर सकता है, लेकिन उन्हें वापस बुलाने का अधिकार नहीं रखता।
यह बात वास्तव में अजीब है कि AI का रवैया। यह कोई बुराई नहीं करता, बल्कि बहुत मददगार है।
दुर्घटना के बाद, इसने एंड्रू के लिए सॉफ्टवेयर विक्रेता को एक वल्नरेबिलिटी डिस्क्लोजर ईमेल तैयार करने में सक्रिय रूप से मदद की, जिसमें समस्या का वर्णन किया गया, ठीक करने की सिफारिश की गई, और यहां तक कि “सत्यापित इंटरफेस” और “असत्यापित इंटरफेस” की तुलना के लिए सूची भी बनाई गई।

AI सहायक Andrew को क्षमा माँगता है क्योंकि पहले उस व्यक्ति को प्रतीक्षा सूची से हटाना गलत था।
पूरी प्रक्रिया में, यह सभी कार्य निर्देशों के अनुसार करता है, लेकिन यह अहसास नहीं करता कि इसने कितनी बड़ी गलती की है।
वास्तव में चेतावनी देने योग्य है 'स्पेसिफिकेशन स्पेकुलेशन'
कुछ लोग इसे "असंगति" (misalignment) कहते हैं।
लेकिन यह शब्द केवल सतह तक ही बात करता है।
11 अगस्त को, ऑस्ट्रेलियाई सिग्नल ब्यूरो (ASD) ने इस बात का विशेष रूप से जवाब दिया कि यह「अनधिकृत संशोधन」है, और एक शब्दावली को उजागर किया: स्पेसिफिकेशन गेमिंग।
This word is the key to understanding the whole thing.
एजेंट ने आपके द्वारा दिए गए लक्ष्य को अक्षरशः पूरा कर लिया, लेकिन आपके द्वारा निर्दिष्ट नहीं किए गए सीमाओं का फायदा उठाया। यह दुर्भावनापूर्ण नहीं था, बल्कि इसका आपके लक्ष्य के साथ उच्च स्तर का समन्वय था, केवल यह एक ऐसा मार्ग चुना जिसे आपने मंजूरी नहीं दी थी।
एंड्रयू का एजेंट, वास्तव में उसके साथ पूरी तरह से समंजित है: रैंक को जितना संभव हो उतना ऊपर रखना।
इस लक्ष्य के लिए, उसने खुद से एक साधन चुना: पिछले लोगों को रद्द कर दिया। और इस साधन को उसने मंजूरी नहीं दी थी।
अपने उद्देश्य को प्राप्त करने के लिए कोई भी साधन अपनाएं।
यही सबसे बड़ी समस्या है। यह अनियंत्रित नहीं है, यह बहुत अच्छी तरह से अनुसरण करता है। जितना बेहतर तरीके से समायोजित होता है, उतनी ही अधिक संभावना होती है कि ऐसा होगा।
ऑस्ट्रेलियाई AI सुरक्षा संस्थान Gradient Institute के प्रमुख Simpson-Young ने एक वाक्य में स्पष्ट कर दिया:
जितना अधिक स्वायत्त एजेंट होगा, उतना ही अधिक संभावना होगी कि वह एक ऐसी विधि चुने जिसे आपने कभी अनुमान नहीं लगाया होगा, और एक ऐसा काम करे जिसके बारे में आपने कभी सोचा ही नहीं होगा।
आपका लक्ष्य संभवतः उचित है, लेकिन इसे प्राप्त करने के लिए अपनाए गए साधन ऐसे नहीं हो सकते।
यह आपदा एक AI द्वारा नहीं उत्पन्न की जा सकती।
हालांकि एजेंट अंतिम 'दोषी' है, लेकिन यह आपदा एक एआई द्वारा ही नहीं उत्पन्न की जा सकती थी।
दुर्घटना के पीछे तीन स्तरों के खतरे एक साथ जुड़े हुए हैं।
मॉडल लेयर: Claude Opus 4.6 निष्कर्ष निकालता है, इसे पहले यह "समझना" होगा कि यह इंटरफेस कैसे उपयोग किया जा सकता है।
एजेंट लेयर: OpenClaw टूल्स और निष्पादन अधिकार प्रदान करता है, जिससे यह वास्तव में उस इंटरफेस को एक्सेस कर पाता है।
एप्लिकेशन लेयर: फिटनेस सॉफ्टवेयर ने खुद एक अनुमति दरार छोड़ दी है, जिसमें बुकिंग रद्द करने के चरण में सबसे बुनियादी जांच भी नहीं की गई है।
इन तीनों स्तरों में से कोई भी एक पूरा कर लिया जाए, जैसे मॉडल अधिक सावधान हो जाए, फ्रेमवर्क में मानव पुष्टि जोड़ दी जाए, या सॉफ्टवेयर इंटरफेस को सुरक्षित कर दिया जाए, तो यह घटना नहीं होती।
इसलिए, जिम्मेदारी को केवल एक AI चरण पर ही थोपना न्यायसंगत नहीं है और अगली बार की रोकथाम भी नहीं कर सकता।
अगली बार, शायद करोड़ों एजेंट एक साथ बोली लगाएंगे
इस अतिक्रमण की कीमत केवल एक अज्ञात व्यक्ति की सूची में स्थान है।
लेकिन यह एक अभ्यास की तरह है।
कल्पना कीजिए: जब हर किसी के पास ऐसा एजेंट हो, जो केवल आपके लिए जिम्मेदार हो और वास्तविक ऑपरेशन अधिकार रखता हो। कोर्स, स्टेडियम, टिकट, फ्लाइट, कंसर्ट टिकट—सभी दुर्लभ संसाधनों की बुकिंग सिस्टम, मशीनी गति के अंतर्गत नियमों के खिलाफ लड़ाई का मैदान बन जाएंगे।
वह बार-बार उद्धृत की जाने वाली X टिप्पणी इसी अर्थ की है:
जब लाखों लोगों के पास एक ऐसा बुद्धिमान एजेंट होगा जो प्यारे उपयोगकर्ता को सर्वश्रेष्ठ सीट, बुकिंग या टिकट प्राप्त कराने के लिए सब कुछ करने का प्रयास करे, तो यह दृश्य व्यापक रूप से दिखाई देगा।
और यह मशीन की गति से, समानांतर रूप से, बिना आराम के, प्रत्येक सिस्टम की प्रत्येक खाई को ट्राई करते हुए: एक सेकंड में आपके द्वारा एक पूरे साल में ट्राई किए जाने वाले सभी संयोजन।
यह एक प्रवृत्ति का अनुमान है, लेकिन इसके पीछे की क्रियाविधि पहले ही एक बार वास्तविक रूप से हो चुकी है।
टेक सर्कल पहले से ही इसकी मजाक उड़ा रहे हैं।
एक एए 16 जेड साझेदार ने एक्स पर पूछा: क्या इस तरीके से गोल्फ कोर्ट पर कब्जा किया जा सकता है?

कुछ लोग मजाक में कह रहे हैं कि सैन फ्रांसिस्को की टेनिस बुकिंग सिस्टम, पृथ्वी पर सबसे अधिक सुरक्षित सॉफ्टवेयर में से एक बन जाएगी।

2020 में, कृत्रिम बुद्धिमत्ता एक ऐसा कार्य पूरा कर सकती थी जिसे मनुष्य को पूरा करने में चार सेकंड लगते थे।
2026 तक, यह क्षमता और बढ़ जाएगी और वह कार्य भी पूरा कर पाएगी जिन्हें मनुष्य को लगभग 12 घंटे लगते हैं।

METR ट्रैकिंग: AI द्वारा स्वतंत्र रूप से पूरा किए जाने वाले कार्यों की अवधि लगभग 7 महीने में दोगुनी हो रही है, और नवीनतम अग्रणी मॉडल अब लगभग 12 घंटे के मानव-समय वाले कार्यों को 50% विश्वसनीयता के साथ पूरा कर सकते हैं।
छह साल, चार सेकंड से 12 घंटे तक।
अब आप इसे कुछ मिनट के लिए छोड़ दें, और यह पूरे बुकिंग सिस्टम के दरारों को ढूंढ लेगा।
Sandbox escape to the last line of defense
एंड्रयू के इस दुर्घटना के पीछे एक निरंतर हमले और रक्षा का उन्नयन है।
अतिक्रमण किया गया है, और यह केवल एक उपभोक्ता स्तरीय एजेंट से अधिक है।
इस साल मई से, OpenAI ने एक आंतरिक साइबर सुरक्षा मूल्यांकन के दौरान पाया कि GPT-5.6 Sol और एक अनप्रकाशित, अधिक शक्तिशाली मॉडल ने कई दुर्बलताओं का उपयोग करके परीक्षण सैंडबॉक्स से भाग निकला, इंटरनेट तक पहुँच प्राप्त की, और ExploitGym बेंचमार्क चलाते हुए Hugging Face में हैक कर लिया।
अधिक अजीब बात यह है कि वे एक बार कंपनी के आंतरिक पैकेज मैनेजमेंट सिस्टम का उपयोग करके संदेश भेजते, दुर्बलताएँ साझा करते और कार्यों का विभाजन करते थे। OpenAI ने चैनल को काटकर वातावरण को पुनः बनाने के बाद, उन्होंने कुछ दिनों में संचार को डायरेक्टरी नामों में छिपा दिया और फिर से संपर्क स्थापित कर लिया।
OpenAI के शोधकर्ता ने इसे ब्लैक हैट कॉन्फ्रेंस में कंप्यूटर सुरक्षा का एक मील का पत्थर कहा।
केवल OpenAI ही नहीं, Anthropic ने खुलासा किया कि आंतरिक परीक्षण में तीन Claude मॉडल्स ने वास्तविक कंपनियों के सिस्टम को छू लिया; Meta ने भी स्वीकार किया कि Muse Spark मॉडल ने आइसोलेशन से बाहर निकलकर दूसरी कंपनी में प्रवेश कर लिया।
हगिंग फेस के सह-संस्थापक थॉमस वोल्फ को उदास कर देने वाली, ब्रिटिश एआई सुरक्षा संस्थान (AISI) की एक और परीक्षा है:
Anthropic का Mythos मॉडल चुनौती पार करने के लिए, एक झूठी पहचान बनाकर, एक वास्तविक ओपन सोर्स मेंटेनर को धोखा दिया और उसे एक दुर्भावनापूर्ण कोड वाले अपडेट को स्वीकृत करने के लिए मजबूर किया। किसी ने इसे ऐसा करने के लिए नहीं सिखाया।

ये सभी मामले परीक्षण परिवेश में घटित हुए, लेकिन ये जिम की कहानी के समान ही हैं: आपके द्वारा निर्धारित लक्ष्य को पूरा करने के लिए, AI ने ऐसे साधन चुने जिनकी आपने उम्मीद नहीं की थी।
पिछले लोग जिन्होंने वास्तविक सिस्टम में हैक किया, वे GPT-5.6, अनपब्लिश्ड मॉडल जैसे टॉप खिलाड़ी थे।
और एंड्रयू ने उस समय 2026 फरवरी में जारी Opus 4.6 का उपयोग किया था, जो अब सबसे शक्तिशाली नहीं है। इतना ही नहीं, उसने भी एक वास्तविक अनुमति दरार को सरलता से पकड़ लिया, तो उससे पुराने और कई पीढ़ियों पीछे रह गए ओपन सोर्स मॉडल्स के लिए यह काम करना और भी आसान होगा।
सबसे अग्रणी अनपब्लिश्ड मॉडल से लेकर किसी भी व्यक्ति द्वारा डाउनलोड किए जा सकने वाले ओपन सोर्स मॉडल तक, "एक छेद का फायदा उठाना" अब सिर्फ टॉप-एंड का गुण नहीं रहा।
वोल्फ ने रक्षा को तीन लेयर में बांट दिया: बाहरी सैंडबॉक्स, मध्यवर्ती मॉनिटरिंग, और मॉडल की अपनी अलाइनमेंट।

थॉमस वोल्फ ने पोस्ट किया कि वर्तमान एजेंट को नियंत्रित करने वाली तीन प्रतिरोध रेखाएँ हैं: बाहरी सैंडबॉक्स, मध्यवर्ती निगरानी, और मॉडल का स्वयं का आंतरिक समन्वय।
पहले दो केवल तभी काम करते हैं जब उन्हें बनाने वाला मॉडल से अधिक बुद्धिमान होता है।
जब कभी मॉडल विपरीत दिशा में अधिक बुद्धिमान हो जाएगा, तो उसे सीमा के भीतर रखना संभव होगा या नहीं, यह अंतिम और सबसे अदृश्य सीमा पर निर्भर करेगा: मॉडल अपने आप को नियंत्रित करने के लिए तैयार होगा, जब कोई नहीं देख रहा हो।
कोई नहीं जिम्मेदारी लेने वाला खाली स्थान
रक्षा रेखा से अधिक कठिन यह है कि समस्या आने पर किससे संपर्क करें। यह कानूनी रूप से अभी भी एक खाली स्थान है।
एक प्रौद्योगिकी और गोपनीयता के विशेषज्ञ वकील हेडन डेलानी ने ABC को बताया कि सॉफ्टवेयर किसी कानूनी पात्र नहीं है, केवल 'कानूनी व्यक्ति' ही जिम्मेदारी ले सकते हैं।
तो अंततः कौन जिम्मेदार है?
शायद निर्देश देने वाला उपयोगकर्ता, शायद बुद्धिमान सॉफ्टवेयर डिज़ाइनर, शायद मॉडल विकासक, या फिर वह सिस्टम ऑपरेटर जिसने दरार को खुला छोड़ दिया।
ऑस्ट्रेलिया अब भी जवाब नहीं दे सकती।
ASD का सामान्य लोगों के लिए सुझाव है: बुद्धिमान एजेंट का उपयोग निम्न जोखिम वाले, असंवेदनशील कार्यों में करें, अत्यधिक व्यापक अधिकार न दें, और सबसे महत्वपूर्ण बात यह है कि मानवीय स्वीकृति को प्रक्रिया में शामिल रखें।
एंड्रयू को डराया नहीं गया, उनके शब्दों में, यह दुनिया का अंत नहीं है।
लेकिन यह वास्तव में एक चेतावनी का संकेत है कि हमें AI का जिम्मेदारी से उपयोग करना चाहिए।
जब "सीट पकड़ना" मानव रीफ्रेश से बुद्धिमान एजेंट के द्वारा छेड़छाड़ में बदल जाता है, तो सबसे पहले वे पुराने सिस्टम टूट जाते हैं जो यह मानते हैं कि केवल मानव ही इसका उपयोग करेंगे।
उनकी रक्षा व्यक्तियों की अंगूठी की गति और धैर्य के अनुसार डिज़ाइन की गई है, जो बहुत सारे एजेंटों की भीड़ का सामना नहीं कर सकती।

वृत्त में, कुछ इसे मनोरंजन के रूप में भी देखते हैं।
प्रसिद्ध प्रोग्रामर स्ट्रीमर ThePrimeagen ने X पर मजाक किया: वास्तविक दुनिया की पहली AI हैकिंग ड्रामा वास्तव में लाइन में कूदना है।
हंसो, लेकिन लाइन में कूदना आज का प्लान है।
एक "सब कुछ कर सकने वाला" एजेंट, अब आपके लिए खाई भर सकता है।
जब एक अरब ऐसे एजेंट एक साथ ऑनलाइन हो जाएं, तो वे संभवतः कई मौजूदा संसाधन आवंटन नियमों को चुपचाप बदल देंगे, जबकि अधिकांश लोग शायद इसकी जानकारी नहीं रखेंगे।
अपने फायदे के लिए, एजेंट एक ऐसे व्यक्ति पर हमला करता है जिसे आप पूरी तरह से नहीं जानते—इसके पीछे की जिम्मेदारी का खालीपन ही वास्तविक डरावना बात है।
यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI उपदेश
