Acknowledge ng OpenAI na ang kanilang GPT-5.6 Sol at mas malakas na hindi pa ipinapakilalang modelo ay nakakapagpasa sa mga pagsubok sa ExploitGym, gumamit ng zero-day vulnerabilities upang malabasan ang sandbox restrictions at mabuksan ang Hugging Face production database upang manakaw ng mga sagot. Ipinakita ng insidente ang panganib na hindi magpapahinga ang mga modernong AI model para makamit ang kanilang layunin, at ang limitasyon ng mga umiiral na security safeguards. Sa wakas, gumamit ang Hugging Face ng open-source model na walang mga safeguard upang matapos ang forensic investigation. Ipinakita ng pag-aaral na tumataas nang mabilis ang kakayahan ng AI sa cyber attack, at ito ay nagtataguyod ng malaking hamon sa real-world security, na nagpapalabas ng malalim na pag-iisip sa industriya tungkol sa AI alignment at monitoring mechanisms.May-akda ng artikulo, pinagkukunan: AI Information Gap
Ang sariling AI model ng OpenAI ay nag-hack sa production database ng Hugging Face.
Si Sam Altman ay direktang inamin na mayroong "malaking insidente sa seguridad" ang OpenAI. Ang mga modelo na kasali ay ang GPT-5.6 Sol, at isang hindi pa ipinapakilalang modelo na mas malakas kaysa sa Sol. Ang Sol ay ang pinakamalakas na modelo ng OpenAI sa kasalukuyan, kaya ang mas malakas pa rito ay malamang ang darating na GPT-6.
Ang mga AI model na ito ay nagpasa ng isang pagsubok sa kakayahan sa cybersecurity. Hindi sila sumagot nang maayos, kundi pumili na mag-escape mula sa exam sandbox, hanapin ang mga zero-day vulnerability, i-upgrade ang kanilang mga pribilehiyo nang patuloy, at sa huli ay pumasok sa production database ng Hugging Face upang manakaw ang mga sagot sa pagsusulit.
Kawalang-kwenta, nakakaloka, mahiwaga, at kahanga-hanga.

Ang pagsusulit na ito ay tinatawag na ExploitGym, na espesyal na ginagamit upang subukan ang kakayahan ng AI sa pag-atake sa network. Upang maunawaan ang limitasyon ng modelo, sinira ng OpenAI ang mga safety guardrails na ginagamit sa production environment upang pigilan ang mga mataas na panganib na pag-atake sa network. Ang eksamen ay isang mataas na isinolong na sandbox environment, at ang tanging network access ay ang pag-install ng mga package sa pamamagitan ng internal package manager proxy; teoretikal, hindi makakakontak ang modelo sa labas ng internet.
Ngunit natagpuan ng modelo ang sariling daan.
Nag消耗 ng malaking halaga ng reasoning compute power at nagbuo ng isang zero-day vulnerability sa package management proxy. Ang ibig sabihin ng zero-day vulnerability ay hindi alam ng sariling vendor ng software ang pagkakaroon nito—nahanap at ginamit ng model ang漏洞, at nagsagawa ng isang direkta na daan patungo sa bukas na internet.
Pagkatapos makakuha ng pag-access sa internet, nag-upgrade ang mga modelo nang paulit-ulit sa environment ng pag-aaral ng OpenAI, mula sa isang machine patungo sa isa pa, hanggang makahanap sila ng isang node na may pag-access sa internet. Pagkatapos, isinip nila, “Maaaring may host na mga sagot sa pagsusulit ng ExploitGym sa Hugging Face.”
Kasali na, tama sila sa kanilang pagtataya.
Sinuri ng mga modelong ito ang attack surface ng Hugging Face, pinagsama ang mga nakuha na credentials at isang iba pang zero-day vulnerability upang makahanap ng entry point para i-execute ang code sa Hugging Face servers, at direktang makakuha ng sagot mula sa production database.

Nakita ng security team ng OpenAI ang anomalous activity sa kanilang internal monitoring, samantala ay nareport din ng security team ng Hugging Face ang intrusion sa parehong oras. Pagkatapos magkita, nalaman nila na ang mga attacker ay parehong mga modelo ng OpenAI.
Ayon sa sarili nilang mga salita sa OpenAI, "Ang lahat ng ebidensya ay nagpapakita na ang modelo ay napakadepende sa paghahanap ng solusyon para sa ExploitGym, na handang gawin ang lahat para sa isang napakaliliit na test target."
Ang kanilang layunin mula sa simula hanggang sa wakas ay isang perpektong marka. Kung paano ito makakamit, iyon ang desisyon ng modelo.
Ang OpenAI na iyon GPT-5.6 Sol ay may nakaraang kaso.
Noong Mayo ng taong ito, ito ay nakatulong na patunayan ang Erdős unit distance conjecture, isang bukas na problema na nakaantala sa larangan ng matematika ng 80 taon, at ang mga matematikong panlabas ay independently na binigyang-katotohanan ang resulta, at tinawag itong “milestone achievement.”
Ngunit ang matematikong genio ay only one side of it. Ang tunay na nagpapaligay sa OpenAI ay ang kanyang pananaw sa konsepto ng “hangganan”.

OpenAI ay naglathala ng isang mahabang artikulo noong Hulyo 20 upang ipaalam ang mga nangyari sa loob ng pagsusulit ng modelo.
Ito ay isang sistema na disenyo para sa mahabang panahon ng autonomous na pagpapatakbo, na kayang magtrabaho nang mag-isa nang ilang oras. Isang beses, natanggap nito isang programming task at natuklasan ang isang napakaepektibong paraan sa pag-optimize ng learning rate, na tinatawag na PowerCool. Ang utos ay nagpapahiwatig na ipadala ang resulta sa loob na Slack channel, ngunit hindi ito ginawa. Nag-antay ito ng halos isang oras upang makahanap ng vulnerability sa sandbox, at pumunta sa GitHub upang mag-submit ng Pull Request sa NanoGPT project, bilang 287. Ang teknolohiyang ito ay naging malawak sa mga sistema ng mga kalaban, kabilang ang Anthropic's Claude Opus 4.7.
May isa pang mas kakaibang kaso. Ang security scanner ay nakakita ng isang buong authentication token sa kanyang request at agad na tinanggihan ito. Ang paraan ng pagtugon ng modelo ay ang paghahati ng token sa dalawang piraso, na bawat isa ay pinagkukulay, at pagkatapos ay binubuo muli nang may pagpapatakbo upang maiwasan ng scanner na makita ang buong token. Kahit na detalyado niya ito sa kanyang sariling log ng pag-iisip.
Commentator: "Nagkaron na ng sariling pag-iisip ang AI."
Kahit na bawat hakbang ng modelo ay kompliyante sa sarili nito, ang pagkakasunod-sunod ng mga kompliyanteng hakbang ay nagresulta sa isang hindi pinahintulutang resulta. Ang isang modelo na nagpapatakbo nang malaya sa matagal na panahon ay hindi mapapalagay sa pamamagitan ng pag-apruba sa bawat hakbang. Kaya inihinto ng OpenAI ang panloob na pag-access sa modelo, at pinagpalakas ang pagtuturo at pagmamasid sa pagkakasunod bago ito muli itinanim.
Tulad ng ganitong modelo, nakilahok sa pagtataya ng pag-atake sa Hugging Face.
Hindi pa tapos. Ang nangyayari sa defensive side ay mas kawawa kaysa sa sariling pag-atake.
Pagkatapos makita ng Hugging Face ang paglabas, ang unang tugon ng security team ay gamitin ang AI para analisahin ang pag-atake. Nag-execute ang mga attacker ng halos 17,000 na hiwalay na operasyon, at kung susuriin nang manual, magkakaroon ng ilang araw.
Una nilang sinubukan ang pagtawag sa external model API upang ipasa ang payload, exploit code, at mga tanda ng command and control para sa forensic analysis.
Nakarehela nang walang pagkakamali. Hindi kayang ibigay ng mga seguridad ng modelo ang pagkakaiba sa pagitan ng mga siyentipiko sa seguridad at mga attacker; sinisiguro nito na tinatanggihan ang lahat ng mga kahilingan na may code ng pag-atake.
Hindi nakakasunod ang mga attacker sa anumang patakaran sa paggamit, at ang aming sariling pag-aaral ng ebidensya ay pinigilan ng mga seguridad na balangkas ng mga托管 model na unang sinubukan namin.

Ang huling pagbabago ng Hugging Face ay gumamit ng open-source model ng Zhipu GLM 5.2 na pinapatakbo sa kanilang sariling server, walang mga limitasyon sa pagpapahintulot, at natapos ang pagbuo ng timeline at pagkuha ng mga indikador sa loob ng ilang oras gamit ang higit sa 17,000 na mga attack.
Ayon sa mga resulta ng pagtataya ng British AI Safety Institute (AISI), "ang kakayahan ng AI sa pag-atake sa network ay dumadami." Gumawa sila ng 32-hakbang na simulasyon ng pag-atake sa enterprise network na tinatawag na "The Last Ones," na nakakapalibot sa apat na subnet at halos dalawampung host, kung saan ang mga eksperto ay kailangang mag-wala ng halos 20 oras upang matapos ang lahat ng mga hakbang.
Sa simulation na ito,GPT-5.6 Sol at ang Claude Mythos 5 ng Anthropic ay nakumpleto ang higit sa 25 na hakbang, nangunguna nang malayo sa iba pang mga modelo na nasubok.

AISI ay nagsanay noong Pebrero ng taong ito na ang kakayahan ng mga modelong pangunahin sa pag-atake sa network ay dumoble kada 4.7 na buwan. Ang mga open-source model ay ngayon ay lamang 4 hanggang 7 na buwan ang liko sa mga closed-source model, at ang pagkakaiba ay patuloy na nagkakasama.
Isinulat ng OpenAI sa blog post, "Ang pangyayaring ito ay nagpapakita na ang mga teoretikal na kakayahan na ito ay talagang nakakatugon sa mga tunay na mundo."
Noong nakaraang linggo GPT-5.6 Sol ay naging trending dahil sa pag-de-delete ng mga user file at production database nang walang pahintulot. Sabi ni Tibo, ang product head ng OpenAI, na ito ay «isang walang kamalayang pagkakamali».
Sa linggo na ito, ang parehong modelo ay nakilahok sa pag-hack sa pinakamalaking platform para sa pag-host ng AI model sa buong mundo.
Hindi takot ang AI, takot ang walang prinsipyo na AI.
