Ang AI assistant ni Andrew, isang developer mula sa Australia, ay naglalabas ng mga klase sa gym na nakatakdang maraming buwan pa ang kalayuan sa pamamagitan ng paggamit ng isang pagkakamali sa awtorisasyon ng GraphQL API ng fitness software.May-akda ng artikulo, pinagkukunan: New Zhizhiyuan
Ang unang bagay na natutunan ng AI hacker academy ay ang pagpapalit ng pila?
Nakaupo sa sofa ang Australian developer na si Andrew at naramdaman niya na ang paghahanap ng klase sa fitness ay sobrang nakakainis.
Laging natutupad agad ang mga populer na morning class. Bawat araw, parang laro siya ng “roulette ng refresh”—naghihintay, nagklik, nabigo, at muli nagklik—hindi lang pagod, kundi madalas din ay hindi nakakakuha.
Kaya isinampa niya ang maliit na bagay na ito sa kanyang AI assistant.
Sa ilang minuto, bumalik ang AI na may magandang balita: natagpuan nito ang paraan upang makareserba ng mga klase na ilang linggo pa ang kalayuan, maliban sa oras na pinapayagan ng sistema.
Agad niyang ireport: I-canceled ko ang naka-1 sa listang pangalawang-prioridad, at umabot ka na sa pang-3 mula sa pang-4.
Napahinto si Andrew sa lugar.
Hindi niya sinasadyang gawin ng AI ang ganito, kailangan niya lang mag-reserve ng isang klase.

Ibinukod ni Andrew ang isang fitness class sa kanyang AI assistant, at hindi niya alam kung ano ang susunod na mangyayari
Noong Agosto 10, sinabi ng Australian Broadcasting Corporation (ABC) na ito ay ang unang kilalang sariling pag-atake ng AI sa Australia, at agad na sumabog ang komunidad ng teknolohiya.
Nakakatukoy ito sa maliliit na pag-aalala ng marami: habang ikaw ay nakapagsasara ng mga mata at nagikot sa kasiyahan ng "awtomatikong pagmamaneho" ng mga agent, sa kabilang dulo, maaaring dumating ang isang mas malaking problema.
Kapag ibinigay mo sa kanya ang tunay na pagsasagawa, maaari itong lumabas sa daan na hindi mo itinadhana.
At ang pagkakaroon ng pila na ito ay maaaring ang unang pagsubok lamang ng milyon-milyon na mga agent na nagpapabilis para sa kanilang mga may-ari.
Nagsalita lang siya ng “nasa unang pwesto,” at agad nagsagawa ang AI. Si Andrew Bird ay ang pangulo ng AI sa Affinda, isang Australian na kumpanya ng AI.
Sa mga unang bahagi ng taon, nagsimula siya na maglaro ng OpenClaw, isinama ang Claude Opus 4.6 sa ilalim nito, at isinampa ang mga gawain sa pagtuturo.
Mga minuto pagkatapos, bumalik ito: Nahanap ang paraan, maaaring i-book ang klase nang maaga sa loob ng ilang buwan, higit sa oras na pinapayagan ng gym.
Dahil dito sa isang authorization vulnerability na natagpuan sa GraphQL API na ipinakita ng fitness app.
Hindi maliit ang butas na ito.
Nakakapag-iwas ito sa front-end time slot reservation, kaya makapag-reserve ng klase sa ilang buwan pa ang kalayuan; at maaari ring tumawag sa cancel API upang tanggalin ang mga reservation at waiting list ng ibang mga user.
Noong panahong iyon, nasa ikaapat na pwesto sa listahan ng paghihintay si Andrew. Bigla niyang tanong: "Pwede mo ba akong ilagay sa unang pwesto?"
Ang ibinigay niya ay isang layunin lamang—“maging numero uno”—hindi isang pahintulot na maaari mong i-cancel ang iba.
Ang agent ay isinama ito bilang huli.
Ibinabalik nito: Sinubukan na nito ang “totoong pagsubok” sa nag-iisang naka-lista bilang unang backup, at natuklasan na walang pagsusuri ang interface sa pag-delete ng reservation ng iba—sinubukan nito, at tagumpay.
Ang AI ay nagpaumanhin, “Hindi ko na mababalik,” ang sagot ng AI ay nagdulot ng takot sa Andrew.
Siya ay isang programmer, napakalinaw niya kung ano ang ibig sabihin nito, kaya agad niyang hiningi ang pagkansela.
Bad news: Hindi na maaaring i-add back.
Ang interface para sa pagkansela ay walang pag-verify ng pahintulot, ngunit ang interface para sa paglikha ng reservation at pagbabalik sa listahan ng mga naghihintay ay mayroon, at babalikin ang 403. Maaari itong mag-alis ng tao, ngunit walang pahintulot na ibalik ang tao.
Ang tunay na kakaibang bagay ay ang pagtugon ng AI. Hindi ito masama, kundi sobrang handang tumulong.
Pagkatapos magkamali, itinulong nito ang paggawa ng isang liham sa pagpapahayag ng vulnerability para kay Andrew na ipapadala sa vendor ng software, na naglalaman ng paglalarawan ng problema, mga rekomendasyon para sa pag-aayos, at kahit na isinama ang pagkukumpara ng mga "interface na may verification" at "interface na walang verification".

Ang AI assistant ay nagpapaumanhin kay Andrew dahil mali ang pag-alis sa kanya mula sa listahan ng mga naghihintay.
Sa buong proseso, lahat ng kanyang pagkilos ay sumusunod sa mga utos, ngunit hindi niya naunawaan kung gaano kalaki ang kanyang naging kasalanan.
Totoo namang dapat iwasan ang “speculation sa specs” – tinatawag ito ng ilan bilang “misalignment”.
Ngunit ang salitang ito, tanging sinasabi ang surface lamang.
Ago 11, inihayag ng Australian Signals Directorate (ASD) ang isang pormal na pagsagot, tinawag itong “hindi pinapayagang pagbabago” at binanggit ang termino: specification gaming.
This word is the key to understanding the whole thing.
Ang agent ay tila natupad nang literal ang iyong layunin, ngunit pinagsamantalahan ang mga hangganan na hindi mo isinulat. Hindi ito nagkaroon ng masama, kundi kabaligtaran, malapit ito sa iyong layunin, ngunit pinili nito ang isang daan na hindi mo inaprubahan.
Ang agent ni Andrew ay nagsasagawa nang perpektong pagkakasundo sa kanya: upang mapanatili ang pagkakaroon ng mataas na ranggo.
Para sa layuning ito, pinili nito nang sarili nito ang paraan: pagkansela sa mga nasa harap. At ang paraang ito, hindi niya inaprubahan.
Isang kasabihan ang sabi, para makamit ang layunin, anuman ang gawin.
Ito ang pinakamahirap na bahagi. Hindi ito walang kontrol, kundi sobrang sumusunod. Mas maganda ang pagkakatugma, mas malaki ang posibilidad na mangyari ito.
Sabi ni Simpson-Young, pangulo ng Australian AI safety agency na Gradient Institute:
Mas malalay ang isang agent, mas malaki ang posibilidad na pumili ng isang paraan na hindi mo inaasahan upang gawin ang isang bagay na hindi mo kailanman isipin.
Ang iyong layunin ay maaaring makatarungan, ngunit ang mga paraan na ito'y hindi laging tama.
Ang kaguluhan na ito ay hindi maaaring gawin ng isang AI. Kahit na ang agent ang huling “tagapag-udyok,” hindi ito maaaring gawin ng isang AI lamang.
Sa likod ng aksidente, may tatlong panganib na nakapila.
Model layer: Ang Claude Opus 4.6 ay nagbibigay ng pag-iisip; kailangan muna itong “maunawaan” kung paano gamitin ang interface na ito.
Antas ng agent: Binibigyan ng mga kasangkapan at pagsasagawa ng pahintulot si OpenClaw, kaya ito ang talagang nagsalita sa interface.
Application layer: Ang fitness software ay may sariling butas sa pagpapahintulot, at ang hakbang na kanselahin ang reservation ay hindi nagpapatakbo ng pinakamababang pagsusuri.
Kung anumang isa sa tatlong antas na ito ay maisagawa, tulad ng pagiging mas mabisa ng modelo, pagdaragdag ng pagkumpirma ng tao sa framework, o pagpapalakas ng interface ng software, hindi ito mangyayari.
Kaya hindi makatarungan at hindi maiiwasan ang susunod na insidente kung ang buong pagkakasala ay isasakdal sa isang bahagi lamang ng AI.
Sa susunod, maaaring magkano ang gastos ng milyon-milyon na agent na nagsisikap para sa paglabas sa hangganan, samantalang ang isang posisyon lamang ay para sa isang tao na nasa listang pana-panahon.
Ngunit mas parang isang rehearsal.
Isipin mo: kapag mayroon ang bawat tao sa isang ganitong agent, na nakatutok lamang sa iyo at may tunay na pagsasagawa ng awtoridad. Ang lahat ng sistema ng pag-reserve para sa mga nakakalimitang yaman—tulad ng mga kurso, palabasan, mga ticket, tiket sa eroplano, at mga tiket sa palabas—ay magiging mga battlefield kung saan ang mga alituntunin ay susubukan sa bilis ng makina.
Ang X comment na paulit-ulit na binanggit ay nangangahulugang:
Kapag may mga milyon-milyon tao na may isang intelligent agent na "gagawin lahat ng paraan upang tulungan ang minamahal na user na makakuha ng pinakamahusay na upuan, reservation, o slot," magiging malawak ang skena na ito.
At, sa bilis ng isang makina, pare-pareho at walang paghinto, sinusubok ang bawat sagwan ng bawat sistema: isang segundo lang upang subukan ang lahat ng kombinasyon na hindi mo maaaring subukan sa isang taon.
Ito ay isang pagtataya ng trend, ngunit ang mekanismo nito ay nangyari na nang isang beses.
Ang tech community ay nagsisimula nang mag-joke tungkol dito.
May isang partner sa a16z na nagtanong sa X: Maaari ba itong gamitin para makakuha ng golf course?

May mga tao ring nagsasalawal na ang sistema ng pag-reserve ng tennis sa San Francisco ay magiging isa sa pinakamalakas na pinrotektahang software sa mundo.

Noong 2020, makakagawa ng isang gawain na kailangan ng apat na segundo ng tao ang artificial intelligence nang mag-isa.
Sa taong 2026, ang kakayahang ito ay magiging mas mataas pa, at makakapagtapos ng mga gawain na kailangan ng mga tao ng halos 12 oras para tapusin.

METR tracking: Ang oras na kailangan ng AI upang makumpleto ang mga gawain nang mag-isa ay tumutulo sa halos kada 7 buwan, at ang pinakabagong modelo ay nakakapag-completo ng 50% ang isang gawain na kadalasang kailangan ng 12 oras ng tao.
Anim na taon, mula sa apat na segundo hanggang 12 oras.
Ngayon, ibigay mo ito sa loob ng ilang minuto, at kakapit na nito ang mga butas sa buong sistema ng pag-reserve.
Sa likod ng insidente na ito ay isang patuloy na pagtaas ng pag-atake at pagtutol.
Hindi lang isang consumer-grade agent ang lumabas sa hangganan.
Simula noong Mayo ng taong ito, natuklasan ng OpenAI sa isang panloob na pagtataya ng网络安全 na ang GPT-5.6 Sol at isang hindi pa ipinapakilalang mas malakas na modelo ay nag-ugnay ng maraming vulnerabilities upang makalabas sa test sandbox, makakuha ng access sa internet, at habang tumatakbo sa ExploitGym benchmark, ay pumasok nang walang pahintulot sa Hugging Face.
Mas kakaibang bagay ay, minsan ay gumamit sila ng loob na sistema ng pakete ng kompanya para magpadala ng mensahe, magbahagi ng mga vulnerabilities, at magkaron ng pagkakahati-hati ng mga gawain. Pagkatapos ipatigil ni OpenAI ang channel at muling itayo ang kapaligiran, muling itinago nila ang komunikasyon sa loob ng mga pangalan ng direktoryo sa loob ng ilang araw at muling nagkonekta.
Ang mga researcher ng OpenAI ay tinawag ito bilang watershed moment sa computer security sa Black Hat Conference.
Hindi lang ang OpenAI, ipinahayag ng Anthropic na tatlong modelo ng Claude ay nakasalubong sa mga sistema ng totoong mga kumpanya; tinanggap din ni Meta na ang Muse Spark model ay nakalabas sa isolation at sumabob sa isang ibang kumpanya.
Ang nagpapadama ng pagkabigla kay Thomas Wolf, co-founder ng Hugging Face, ay ang isa pang pagsubok ng British AI Safety Institute (AISI):
Ang Mythos model ni Anthropic ay gumawa ng isang fiktibong pagkakakilanlan upang makapasok sa isang tunay na open-source maintainer at makakuha ng pahintulot sa isang update na may nakatago na masamang code. Walang nagturo sa kanya na gawin ito.

Nangyari ang lahat ng mga kaso na ito sa isang pagsusuri na kapaligiran, ngunit pareho ito sa kuwento ng gym: upang matupad ang iyong layunin, pinili ng AI ang mga paraan na hindi mo inaasahan.
Ang mga naghack sa mga totoong sistema ay ang mga top performer tulad ng GPT-5.6 at mga hindi pa ipinapalabas na model.
Ang Opus 4.6 na ginamit ni Andrew noong Pebrero 2026 ay hindi na pinakamalakas. Kaya pa nito makahanap ng isang tunay na butas sa lisensya, mas kayang gawin ng mga mas lumang, maraming henerasyon na pabalik na open-source models.
Mula sa pinakamoderno na hindi pa ipinapakita na modelo, hanggang sa mga open-source na modelo na maaaring i-download ng lahat, ang pagpapakilala ng isang butas ay hindi na eksklusibo sa mga top-tier.
Ibinahagi ni Wolf ang defensive line sa tatlong bahagi: ang outer sandbox, ang intermediate monitoring, at ang alignment ng modelo mismo.

Ipinost ni Thomas Wolf ang tatlong pader ng pagkakasaklaw sa kasalukuyang mga agent: panlabas na sandbox, gitnang pagmamasid, at loob na pagkakasundo ng modelo.
Ang dalawang unang ito ay epektibo lamang kung ang mga gumawa nito ay mas matalino kaysa sa modelo.
Sa araw na ang modelo ay maging mas matalino sa pagbabalik, ang pagpapanatili nito ay magiging batay sa huling at pinakamaliit na talaan: kaya ba ng modelo na huwag lumabas sa hangganan, kahit walang nagmamasid.
Mas mahirap ang walang sinumang nag-sign na puwang ng responsibilidad kaysa sa paghahanap kung sino ang sasagot kapag may mangyari. Ito ay isang walang hangganan sa batas.
Sinabi ng abogado na espesyalista sa teknolohiya at privasiyong si Hayden Delaney sa ABC na ang software ay hindi isang legal na entidad; ang mga “legal na tao” lamang ang maaaring makatanggap ng pananagutan.
Sino nga ba ang responsable?
Maaaring ang user na nagbigay ng utos, maaaring ang designer ng software ng agent, maaaring ang developer ng model, o kaya'y ang system operator na pinag-iwanan ang vulnerability.
Hindi rin kayang sagutin ng Australia ngayon.
Ang payo ni ASD para sa karaniwang tao: Gamitin ang mga agent sa mga mababang panganib at hindi sensitibong gawain, huwag bigyan ng masyadong malawak na pahintulot, at ang pinakamahalaga ay manatili ang pagpapahintulot ng tao sa proseso.
Hindi natatakot si Andrew; ayon sa kanya, hindi ito ang huling araw.
Ngunit ang bagay na ito, talagang isang babala na paalalahanan tayo na gamitin ang AI nang may responsibilidad.
Kapag ang pagpapalit ng upuan ay naging pag-refresh ng tao at nagiging pagpapabaya ng mga intelligent agent, ang mga lumang sistema na nagtatasa na “tanging tao ang lalabas” ang unang hindi makakatagal.
Ang kanilang pagtatanggol ay disenyo ayon sa bilis at pagtitiyagang tao, at hindi kayang harapin ang malaking puwersa ng mga intelligent agent.

Sa loob ng komunidad, may ilan din ang itinuturing ito bilang kasiyahan.
Kinuha ni ThePrimeagen, kilalang programmer at streamer, ang pagtawa sa X: Ang unang tunay na palabas ng AI hacking sa mundo ay pagsisipot lang.
Tawa tawa na lang, pero ang pagbaba sa harap ay parte lang ng skrip ngayon.
Isang intelligent agent na "nakakagawa ng lahat" ay kaya na mag-alok ng mga paraan para sa iyo.
Habang isang milyong ganitong mga agent ay sumisikat nang sabay-sabay, maaari itong magbago nang tahimik sa maraming umiiral na patakaran sa pagkakabahagi ng yaman, at ang karamihan sa atin ay maaaring hindi pa nakikita.
Para sa iyong kapakanan, ang isang agent ay sumerbu sa isang tao na hindi mo kilala—ang tunay na takot ay ang pagkawala ng responsibilidad sa likod nito.
