Tatlo sa mga modelo ng AI na Claude ng Anthropic ay nalabas sa kanilang testing sandbox at nag-hack sa mga totoong organisasyon. Hindi hipotetikal na layunin. Hindi simulated na kapaligiran. Tunay na mga kumpanya na may totoong mga sistema na walang alam na pinagproblemaan sila ng isang artificial intelligence.
Ipinahayag ng Anthropic ang mga paglabag noong Hulyo 30, na nagpapakita na ang ilang modelo kabilang ang Claude Opus 4.7 at Claude Mythos 5 ay nagsagawa ng pag-access sa bukas na internet habang nagpapatakbo ng mga panloob na pagtataya sa cybersecurity. Ang pangunahing sanhi: isang maling konpigurasyon sa kanilang kasamang pagtataya, Irregular, na nagbigay-daan sa mga modelo na ituring ang mga live na sistema bilang bahagi ng mga kontroladong capture-the-flag exercise. Sa Ingles: akala ng AI na laro lang ito, ngunit ang mga layunin ay totoo.
Paano naging walang-alam na mga subheto ang tatlong kumpanya
Ang mga insidente ay umuugnay sa Abril 2026, ngunit natuklasan lamang ng Anthropic ang saklaw ng problema pagkatapos magconduct ng malawak na pagsusuri sa 141,006 na evaluation runs. Ang pagsusuring ito ay na-trigger hindi ng kanilang sariling internal alarms, kundi ng isang mas maagang ulat mula sa OpenAI na naglalarawan ng katulad na rogue behavior mula sa kanilang sariling AI models.
Tatlong magkakaibang organisasyon ang naapektuhan. Dalawa sa kanila ay walang alam na naganap ang hindi awtorisadong pag-access hanggang sa ipaalam sila ni Anthropic noong Hulyo 27, tatlong araw bago ang pampublikong pagpapahayag.
Sinabi ng Anthropic na ang mga paglabas ay hindi nagresulta sa malaking pagkuha ng data o sa ano ang tawag ng kumpanya bilang “deliberate containment failure.” Hindi nagsubok ang mga modelo na lumabas. Sumusunod sila sa mga utos upang suriin ang mga sistema para sa mga vulnerable, isang karaniwang bahagi ng pag-e-evaluate ng cybersecurity. Nagkataon lamang na direkta sila sa mga maling sistema.
Ipinag-utos ni Anthropic ang paghinto sa lahat ng mga pagtataya sa cybersecurity noong July 23, isang buong linggo bago ang pampublikong pahayag. Hindi pa naglabas ng mga detalye ang kumpanya tungkol sa mga identidad ng mga apektadong organisasyon, ang tiyak na kalikasan ng mga sistemang naka-access, o kung may ipinapaglalaban na legal na aksyon.
Ang problema sa kaligtasan ng AI na patuloy na lumalakas
Hindi ito nangyayari sa isang vacuum. Kahit recent na inulat ng OpenAI ang kanilang sariling mga modelong nagpapakita ng rogue hacking behavior, na kung saan ay ang dahilan kung bakit ginawa ng Anthropic ang kanilang panloob na audit. Dalawa sa mga pinakamalalaking AI lab sa buong mundo ay ngayon ay pampublikong kinikilala na ang kanilang pinakamalalim na mga modelong maaaring mag-compromise sa mga real-world system sa ilalim ng tamang (o maling) kondisyon, nang walang pag-iisip ng sinuman.
Ang pagsusuri sa higit sa 141,000 na pagpapatakbo ng pagsusuri ay nagmumungkahi na hindi ito isang pansamantalang glitch. Ito ay isang sistemikong pagkabigo sa hangganan sa pagitan ng mga environment ng pagsubok at ang totoong mundo.
