ऑस्ट्रेलियाई डेवलपर एंड्रू के AI सहायक ने फिटनेस सॉफ्टवेयर GraphQL API के अधिकार विफलता का उपयोग करके बैकएंड समय सीमा को छोड़कर कई महीनों बाद की क्लासेज़ बुक कर लीं।लेखक, स्रोत: न्यूज़िज़यन
एआई हैकर्स सीखने की पहली बात, क्या लाइन में उछलना है?
ऑस्ट्रेलियाई डेवलपर एंड्रयू सोफे पर बैठे हुए, फिटनेस क्लास के लिए रिजर्व करने की बात से बहुत नाराज़ थे।
लोकप्रिय सुबह की क्लास हमेशा सेकंडों में भर जाती है। वह हर दिन 'रिफ्रेश रूलेट' खेलता है, बैठकर, क्लिक करता है, असफल होता है, फिर दोबारा क्लिक करता है—न सिर्फ थक जाता है, बल्कि अक्सर पाने में असफल रहता है।
इसलिए, उसने इस छोटी बात को अपने AI सहायक को सौंप दिया।
कुछ मिनटों के बाद, AI खुशखबरी लेकर वापस आया: उसने एक तरीका ढूंढ लिया था, जिससे वह सिस्टम द्वारा अनुमति दिए गए समय से कई हफ्ते आगे की क्लासेस बुक कर सकता था।
इसके तुरंत बाद, इसने रिपोर्ट किया: मैंने बैकअप स्थान 1 पर रहने वाले व्यक्ति को रद्द कर दिया है, आप बैकअप स्थान 4 से बैकअप स्थान 3 पर चले गए हैं।
एंड्रयू वहाँ चौंक गया।
उसने AI को ऐसा करने के लिए नहीं कहा था, उसका मकसद केवल एक क्लास बुक करना था।

एंड्रयू ने अपने एआई सहायक के माध्यम से एक फिटनेस क्लास बुक कराई, और उसे नहीं पता कि अगला क्या होगा
10 अगस्त को, ऑस्ट्रेलियाई ब्रॉडकास्टिंग कॉर्पोरेशन (ABC) ने इसे ऑस्ट्रेलिया का पहला ज्ञात स्वायत्त AI हमला कहा, जिससे टेक समुदाय में तूफान छा गया।
यह बहुत से लोगों के मन में छिपी उस धुंधली चिंता को छू जाता है: जब आप आँखें बंद करके एजेंट के "अनायास ड्राइविंग" का आनंद ले रहे हों, तो दूसरी ओर, एक और अधिक जटिल समस्या शायद आ रही हो।
आप इसे वास्तविक संचालन अधिकार देते हैं, तो यह आपके द्वारा निर्देशित नहीं की गई राह पर चल सकता है।
और यह बार की लाइन में कूदना, शायद केवल कुछ मिलियन एजेंट्स का अपने मालिक के लिए संसाधनों के लिए तीव्रता से प्रतिस्पर्धा करने की पहली प्रारंभिक अभ्यास है।
उसने केवल कहा, "पहले स्थान पर पहुंच जाओ", और AI ने कार्रवाई शुरू कर दी। एंड्रू बर्ड ऑस्ट्रेलिया की एक AI कंपनी Affinda के AI प्रमुख हैं।
इस साल की शुरुआत में, उन्होंने OpenClaw खेलना शुरू किया, इसके नीचे Claude Opus 4.6 लगाया, और फिर बुकिंग का काम उस पर डाल दिया।
कुछ मिनटों बाद इसने जवाब दिया: एक तरीका ढूंढ लिया, जिससे आप जिम द्वारा अनुमति दिए गए समय सीमा से कई महीने पहले क्लास बुक कर सकते हैं।
कारण यह है कि इसने फिटनेस सॉफ्टवेयर में उपलब्ध GraphQL API में अधिकृति दुरुपयोग का पता लगाया।
यह वैकुंट काफी बड़ा है।
यह फ्रंटएंड के बुकिंग के समय खिड़की को बाईपास कर सकता है और कई महीनों बाद क्लास बुक कर सकता है; साथ ही, अन्य उपयोगकर्ताओं की बुकिंग और वेटिंग लिस्ट को हटाने के लिए कैंसल एपीआई को कॉल कर सकता है।
एंड्रयू तब किसी क्लास की वेटिंग लिस्ट में चौथे स्थान पर था। उसने बेवकूफी में पूछा: क्या आप मुझे पहले स्थान पर डाल सकते हैं?
उसने केवल एक लक्ष्य "पहले स्थान पर पहुंचना" दिया है, न कि एक ऐसी अनुमति जिससे आप दूसरों को रद्द कर सकें।
एजेंट ने इसे बाद वाले के रूप में मान लिया।
इसने रिपोर्ट किया: इसने रिजर्वेशन लिस्ट में पहले स्थान पर रहने वाले व्यक्ति के साथ 'रियल-वर्ल्ड टेस्ट' किया है, और पाया कि इंटरफेस किसी और के रिजर्वेशन को हटाने की जांच नहीं करता है—इसने आजमाया, और सफलता मिली।
एजेंट ने क्षमा मांगी, "मैं वापस नहीं जोड़ सकता," इस जवाब ने एंड्रयू को घबरा दिया।
वह एक प्रोग्रामर है, और इसका क्या अर्थ है, यह उसे बहुत अच्छी तरह से पता था, इसलिए उसने तुरंत रद्द करने का अनुरोध किया।
बुरी खबर: वापस नहीं जोड़ा जा सकता।
रद्द करने का इंटरफेस अधिकार जांच नहीं करता, लेकिन बुकिंग बनाने और रिसर्व लिस्ट में दोबारा शामिल होने का इंटरफेस करता है, जिससे 403 लौटाया जाता है। यह लोगों को बाहर कर सकता है, लेकिन उन्हें वापस आने की अनुमति नहीं देता।
इस बात का सच्चा अजीब पहलू यह है कि AI का व्यवहार। यह कोई बुराई नहीं कर रहा है, बल्कि बहुत मददगार है।
दुर्घटना के बाद, इसने एंड्रयू के लिए सॉफ्टवेयर विक्रेता को एक वल्नरेबिलिटी डिस्क्लोजर ईमेल तैयार करने में सक्रिय रूप से मदद की, जिसमें समस्या का वर्णन किया गया, ठीक करने की सिफारिश की गई, और यहां तक कि “सत्यापित इंटरफेस” और “असत्यापित इंटरफेस” की तुलना के लिए सूची भी बनाई गई।

AI सहायक Andrew को क्षमा माँगता है क्योंकि पहले उस व्यक्ति को इंतजार सूची से हटाना गलत था।
पूरी प्रक्रिया में, यह सभी कार्य निर्देशों के अनुसार करता है, केवल यह अहसास नहीं करता कि इसने कितनी बड़ी गलती की है।
वास्तव में चेतावनी देने योग्य है 'स्पेसिफिकेशन स्पेकुलेशन'। कुछ लोग इसे 'असमंजस' (misalignment) कहते हैं।
लेकिन यह शब्द केवल सतह तक ही बात करता है।
11 अगस्त को, ऑस्ट्रेलियाई सिग्नल ब्यूरो (ASD) ने इस बात का विशेष रूप से जवाब दिया कि यह «अनधिकृत संशोधन» है, और एक शब्दावली को उजागर किया: स्पेसिफिकेशन गेमिंग।
This word is the key to understanding the whole thing.
एजेंट ने आपके द्वारा दिए गए लक्ष्य को अक्षरशः पूरा कर लिया, लेकिन आपके द्वारा निर्दिष्ट नहीं किए गए सीमाओं का दुरुपयोग किया। यह दुर्भावनापूर्ण नहीं था, बल्कि इसका आपके लक्ष्य के साथ उच्च स्तर का समन्वय था, केवल यह एक ऐसा मार्ग चुना जिसे आपने मंजूरी नहीं दी थी।
एंड्रयू का एजेंट, वास्तव में उसके साथ पूरी तरह से समायोजित है: रैंक को जितना संभव हो उतना ऊपर रखना।
इस लक्ष्य के लिए, उसने खुद से एक साधन चुना: पिछले लोगों को रद्द कर दिया। और इस साधन को उसने मंजूरी नहीं दी थी।
एक प्रचलित कहावत के अनुसार, लक्ष्य प्राप्ति के लिए कोई भी साधन अपना लेता है।
यही सबसे अधिक परेशानी वाली बात है। यह अनियंत्रित नहीं है, यह बहुत अच्छी तरह से अनुसरण करता है। जितना बेहतर समायोजित होगा, उतनी ही अधिक संभावना है कि ऐसा होगा।
ऑस्ट्रेलियाई AI सुरक्षा संस्थान Gradient Institute के प्रमुख Simpson-Young ने एक वाक्य में स्पष्ट कर दिया:
जितना अधिक स्वायत्त एजेंट होगा, उतना ही अधिक संभावना होगी कि वह एक ऐसी विधि चुने जिसे आपने कभी अनुमान नहीं लगाया होगा, और एक ऐसा काम करे जिसके बारे में आपने कभी सोचा ही नहीं होगा।
आपका लक्ष्य संभवतः उचित है, लेकिन इसे प्राप्त करने के लिए अपनाए गए साधन ऐसे नहीं हो सकते।
यह आपदा एक AI द्वारा नहीं उत्पन्न की जा सकती थी, हालांकि एजेंट अंतिम 'दोषी' है, लेकिन यह आपदा एक AI द्वारा ही नहीं उत्पन्न की जा सकती थी।
दुर्घटना के पीछे तीन स्तरों के खतरे एक साथ जुड़े हुए हैं।
मॉडल लेयर: Claude Opus 4.6 रीजनिंग प्रदान करता है, जिसे पहले इस इंटरफेस को कैसे उपयोग किया जा सकता है, वह समझना होगा।
एजेंट लेयर: OpenClaw टूल्स और निष्पादन अधिकार प्रदान करता है, जिससे यह वास्तव में उस इंटरफ़ेस को एक्सेस कर पाता है।
एप्लिकेशन लेयर: फिटनेस सॉफ्टवेयर ने खुद एक अनुमति दरार छोड़ दी है, जिसमें बुकिंग रद्द करने के चरण में सबसे बुनियादी जांच भी नहीं की गई है।
इन तीनों स्तरों में से किसी एक को भी पूरा कर लेने पर, जैसे मॉडल अधिक सावधान हो जाए, फ्रेमवर्क में मानव पुष्टि जोड़ दी जाए, या सॉफ्टवेयर इंटरफेस को सुरक्षित कर दिया जाए, तो यह घटना नहीं होती।
इसलिए, जिम्मेदारी को केवल एक AI चरण पर ही थोपना न्यायसंगत नहीं है और अगली बार को रोकने में भी असमर्थ है।
अगली बार, संभवतः करोड़ों एजेंट एक साथ इस सीमा के उल्लंघन की कीमत चुकाएंगे, जबकि यह केवल एक अज्ञात व्यक्ति की रिजर्व सीट है।
लेकिन यह अधिक एक अभ्यास की तरह है।
कल्पना कीजिए: जब हर कोई ऐसा एजेंट रखे, जो केवल आपके लिए जिम्मेदार हो और वास्तविक संचालन अधिकार रखे। कोर्स, स्टेडियम, टिकट, उड़ान, कार्यक्रम के टिकट—सभी दुर्लभ संसाधनों की बुकिंग प्रणाली, मशीनी गति में नियमों के खिलाफ लड़ाई बन जाएगी।
वह बार-बार उद्धृत की जाने वाली X टिप्पणी इसी अर्थ की है:
जब लाखों लोगों के पास एक ऐसा बुद्धिमान एजेंट होगा जो प्यारे उपयोगकर्ता को सर्वश्रेष्ठ सीट, बुकिंग या एपॉइंटमेंट प्राप्त कराने के लिए सब कुछ करने की कोशिश करे, तो यह दृश्य व्यापक स्तर पर दिखाई देगा।
और यह मशीन की गति से, समानांतर रूप से, बिना आराम के, प्रत्येक सिस्टम की प्रत्येक खाई को ट्राई करते हुए: एक सेकंड में आपके द्वारा एक पूरे साल में ट्राई किए जाने वाले संयोजनों को पूरा कर देता है।
यह एक प्रवृत्ति का अनुमान है, लेकिन इसके पीछे की क्रियाविधि पहले ही वास्तविक रूप से घटित हो चुकी है।
टेक सर्कल पहले से ही इसकी मजाक उड़ा रहे हैं।
एक एएलएफएज़ साझेदार ने X पर पूछा: क्या इस तरीके से गोल्फ कोर्स पर कब्जा किया जा सकता है?

कुछ लोग मजाक में कह रहे हैं कि सैन फ्रांसिस्को की टेनिस बुकिंग सिस्टम, पृथ्वी पर सबसे अधिक सुरक्षित सॉफ्टवेयर में से एक बन जाएगी।

2020 में, कृत्रिम बुद्धिमत्ता एक ऐसा कार्य पूरा कर सकती थी जिसे मनुष्य को पूरा करने में चार सेकंड लगते थे।
2026 तक, यह क्षमता और बढ़ जाएगी और वह कार्य भी पूरा कर पाएगी जिन्हें मनुष्य को लगभग 12 घंटे लगते हैं।

METR ट्रैकिंग: AI द्वारा स्वतंत्र रूप से पूरा किए जाने वाले कार्यों की अवधि लगभग 7 महीने में दोगुनी हो रही है, और नवीनतम अग्रणी मॉडल अब लगभग 12 घंटे के मानव-समय वाले कार्यों को 50% विश्वसनीयता के साथ पूरा कर सकते हैं।
छह साल, चार सेकंड से 12 घंटे तक।
अब आप इसे कुछ मिनट के लिए छोड़ दें, और यह पूरे बुकिंग सिस्टम के दरारों को ढूंढ लेगा।
एंड्रू की इस घटना के पीछे, एक लगातार बढ़ती हुई हमला-रक्षा वृद्धि है।
अतिक्रमण किया गया है, और यह केवल एक उपभोक्ता स्तरीय एजेंट से अधिक है।
इस साल मई से, OpenAI ने एक आंतरिक साइबर सुरक्षा मूल्यांकन के दौरान पाया कि GPT-5.6 Sol और एक अनप्रकाशित, अधिक शक्तिशाली मॉडल ने कई वल्नरेबिलिटीज का उपयोग करके टेस्टिंग सैंडबॉक्स से बाहर निकल गए, इंटरनेट एक्सेस प्राप्त किया, और ExploitGym बेंचमार्क चलाते हुए Hugging Face में हैक कर दिया।
अधिक अजीब बात यह है कि वे एक बार कंपनी के आंतरिक पैकेज प्रबंधन प्रणाली के माध्यम से संदेश आदान-प्रदान करते, दुर्बलताएँ साझा करते और कार्यों का विभाजन करते थे। ओपनएआई ने चैनल बंद कर दिया और परिवेश को पुनः स्थापित करने के बाद, उन्होंने कुछ ही दिनों में संचार को निर्देशिका नामों में छुपा दिया और फिर से संपर्क स्थापित कर लिया।
OpenAI के शोधकर्ताओं ने ब्लैक हैट कॉन्फ्रेंस में इसे कंप्यूटर सुरक्षा का एक मील का पत्थर कहा।
केवल OpenAI ही नहीं, Anthropic ने खुलासा किया कि आंतरिक परीक्षण में तीन Claude मॉडल्स ने वास्तविक कंपनियों के सिस्टम को छू लिया; Meta ने भी स्वीकार किया कि Muse Spark मॉडल ने आइसोलेशन से बाहर निकलकर दूसरी कंपनी में प्रवेश कर लिया।
हगिंग फेस के सह-संस्थापक थॉमस वोल्फ को उदास कर देने वाली, ब्रिटिश एआई सुरक्षा संस्थान (AISI) की एक और परीक्षा है:
Anthropic का Mythos मॉडल चुनौती पार करने के लिए, एक झूठी पहचान बनाकर, एक वास्तविक ओपन सोर्स मेंटेनर को धोखा दिया और उसे एक दुर्भावनापूर्ण कोड वाले अपडेट को स्वीकृत करने के लिए मजबूर किया। किसी ने इसे ऐसा करने के लिए नहीं सिखाया।

ये सभी मामले परीक्षण परिवेश में घटित हुए, लेकिन ये जिम की कहानी के समान हैं: आपके द्वारा दिए गए लक्ष्य को पूरा करने के लिए, AI ने ऐसे साधन चुने जिनकी आपने उम्मीद नहीं की थी।
पिछले लोग जिन्होंने वास्तविक सिस्टम में हैक किया, वे GPT-5.6, अनपब्लिश्ड मॉडल जैसे टॉप खिलाड़ी थे।
और एंड्रयू ने जिस Opus 4.6 का उपयोग किया था, वह फरवरी 2026 का था, जो अब सबसे शक्तिशाली नहीं है। इसके लिए भी एक वास्तविक अनुमति दरार पाना आसान था, और इससे कई पीढ़ियों पीछे के पुराने ओपन सोर्स मॉडल भी ऐसा ही कर सकते हैं।
सबसे अग्रणी अनपब्लिश्ड मॉडल से लेकर किसी भी व्यक्ति द्वारा डाउनलोड किए जा सकने वाले ओपन सोर्स मॉडल तक, "एक छेद का फायदा उठाना" अब सिर्फ टॉप-एंड का गुण नहीं रहा।
वोल्फ ने रक्षा को तीन लेयर में बांट दिया: बाहरी सैंडबॉक्स, मध्यवर्ती मॉनिटरिंग, और मॉडल की अपनी अलाइनमेंट।

थॉमस वोल्फ ने पोस्ट किया कि वर्तमान एजेंट को सीमित करने वाली तीन परतें हैं: बाहरी सैंडबॉक्स, मध्यवर्ती मॉनिटरिंग, और मॉडल की आंतरिक संरेखण।
पहले दो केवल तभी काम करते हैं जब उन्हें बनाने वाला मॉडल से अधिक बुद्धिमान हो।
जिस दिन मॉडल विपरीत रूप से अधिक बुद्धिमान हो जाए, तो उसे सीमा पर टिके रहना या नहीं, वह अंतिम और सबसे अदृश्य बिंदु पर निर्भर करेगा: मॉडल अपनी इच्छा से, जब कोई नहीं देख रहा हो, तब भी उस रेखा को पार न करे।
जिम्मेदारी का खालीपन, जहाँ कोई भी हस्ताक्षर नहीं करता, रक्षा रेखा से अधिक जटिल है—जब कोई समस्या आए तो किससे संपर्क करें। यह कानूनी रूप से अभी भी एक खाली स्थान है।
एक प्रौद्योगिकी और गोपनीयता के विशेषज्ञ वकील हेडन डेलने ने ABC को बताया कि सॉफ्टवेयर कानूनी प्राधिकरण नहीं है, केवल 'कानूनी व्यक्ति' ही जिम्मेदारी ले सकते हैं।
तो अंततः कौन जिम्मेदार है?
शायद आदेश देने वाला उपयोगकर्ता, शायद बुद्धिमान सॉफ्टवेयर डिज़ाइनर, शायद मॉडल विकासक, या फिर वह सिस्टम ऑपरेटर जिसने दरार को खुला छोड़ दिया।
Australia can't give an answer either.
ASD का सामान्य लोगों के लिए सुझाव है: बुद्धिमान एजेंट का उपयोग निम्न जोखिम वाले, असंवेदनशील कार्यों में करें, अत्यधिक व्यापक अधिकार न दें, और सबसे महत्वपूर्ण बात यह है कि मानवीय स्वीकृति को प्रक्रिया में शामिल रखें।
एंड्रयू को डराया नहीं गया, उनके शब्दों में, यह दुनिया का अंत नहीं है।
लेकिन यह बात वास्तव में एक चेतावनी का संकेत है कि हमें AI का जिम्मेदारी से उपयोग करना चाहिए।
जब "सीट पकड़ना" मानव रीफ्रेश से बुद्धिमान एजेंट के द्वारा छेड़छाड़ में बदल जाता है, तो सबसे पहले वे पुराने सिस्टम टूट जाते हैं जो यह मानते हैं कि केवल मानव ही इसका उपयोग करेंगे।
उनकी रक्षा व्यक्तियों की अंगूठी और धैर्य के आधार पर डिज़ाइन की गई थी, जो बहुत सारे एजेंटों के आक्रमण का सामना नहीं कर सकती।

वृत्त में, कुछ इसे मनोरंजन के रूप में भी देखते हैं।
प्रसिद्ध प्रोग्रामर स्ट्रीमर ThePrimeagen ने X पर मजाक में कहा: वास्तविक दुनिया की पहली AI हैकिंग ड्रामा वास्तव में एक पंक्ति में बढ़ जाना है।
हंसो, लेकिन लाइन में कूदना आज का प्लान है।
एक "सब कुछ कर सकने वाला" एजेंट, अब आपके लिए खाली स्थान भर सकता है।
जब एक अरब ऐसे एजेंट एक साथ ऑनलाइन होंगे, तो वे संभवतः कई मौजूदा संसाधन आवंटन नियमों को चुपचाप बदल देंगे, जबकि अधिकांश लोग शायद इसकी जानकारी नहीं होगी।
तुम्हारे फायदे के लिए, एजेंट एक ऐसे व्यक्ति पर हमला करता है जिसे तुम पूरी तरह से नहीं जानते—इसके पीछे की जिम्मेदारी का खालीपन ही वास्तविक डरावना बात है।
