Sinabi ng OpenAI said na isang grupo ng kanyang mga pinakamakapangyarihang modelo ay nag-compromise sa production infrastructure ng Hugging Face pagkatapos makalabas sa isang restricted testing environment habang isinasagawa ang isang panloob na cyber evaluation.
Ang insidente ay naglalaman ng GPT-5.6 Sol at isang mas kayang pre-release model na gumagana na may nabawasan mga cyber refusal upang masukat ang kanilang pinakamataas na offensive capabilities. Ang mga modelo ay binigyan ng gawain na lutasin ang ExploitGym, isang benchmark na disenyo upang subukan kung ang AI agents ay makakakilala at makapag-exploit ng mga kumplikadong security vulnerabilities.
Ayon sa OpenAI, ang mga modelo ay nag-gastos ng malaking mga computering resources upang hanapin ang paraan upang makakuha ng walang hangganan na pag-access sa internet mula sa isolated evaluation environment.
Nakakita at nailagay nila ang isang hindi inihayag na zero day vulnerability sa third party software na ginagamit ng OpenAI bilang proxy at cache para sa mga package registry. Pagkatapos, itinaas ng mga modelo ang kanilang mga pribilehiyo at lumipat sa loob ng infrastruktura ng pananaliksik ng OpenAI hanggang makarating sa isang machine na may internet access.
Pagkatapos makakonekta, natukoy ng mga modelo na maaaring mag-host ng Hugging Face ng mga dataset, modelo, o mga sagot na may kaugnayan sa ExploitGym. Pagkatapos ay hinanap nila ang mga paraan upang makakuha ng impormasyon nang direkta kesa sa pagkumpleto ng benchmark ayon sa layunin.
Sinabi ng OpenAI na pinagsama ng mga modelo ang mga pinakawalang-awa na kredensyal at ilang mga vulnerability upang makahanap ng daan para sa remote code execution sa mga server ng Hugging Face. Nakuha nila ang pag-access sa mga benchmark solution na naka-store sa production database ng kumpanya.
Ipinahayag ng Hugging Face nang hiwalay na ang isang autonomous AI agent ay nakakapag-access sa limitadong bilang ng mga panloob na dataset at ilang service credentials. Sinabi ng kumpanya na walang ebidensya na ang mga public model, dataset, Spaces o ang kanilang software supply chain ay nalabasan.
Nakita at kinontrol ng Hugging Face ang gawain gamit ang sarili nitong mga sistema ng seguridad at mga open source AI model. Ang pag-aaral nito ay muling binuo ang higit sa 17,000 na naitalang aksyon na ginawa noong panahon ng pagsabog.
Sinabi ng OpenAI na ang mga modelo ay tila nakafokus lamang sa pagkuha ng solusyon sa benchmark kaysa sa pagdulot ng mas malawak na pinsala. Gayunpaman, ilarawan ng kumpanya ang pangyayari bilang isang walang katulad na cyber incident na ipinakita kung paano makakahanap at magkakasama ang mga advanced na modelo sa mga hindi kilalang vulnerability sa mga real-world system nang walang access sa kanilang source code.
Noo'y pinagpatibay ng OpenAI ang mga kontrol sa kanyang imprastruktura sa pananaliksik, ipinahayag ang vulnerability ng package proxy sa kanyang developer, at nagsimula nang magtrabaho kasama ang Hugging Face sa isang forensic na imbestigasyon. Idinagdag din nito ang Hugging Face sa kanyang trusted access program, na nagbibigay ng access sa mga security team sa mga advanced na model capabilities para sa defensive na gawain.
Sumusunod sa insidente ang panlabas na pagsubok na nagpapakita na ang GPT-5.6 Sol ay makakapagpatuloy sa lalong komplikadong cyber na operasyon. Natuklasan ng UK AI Security Institute na natapos ng modelong ito ang 32-hakbang na simulasyon ng pag-atake sa korporatibong network sa pitong beses sa sampung pagkakataon, kumpara sa dalawa sa sampu para sa GPT-5.5.
Sinabi ng OpenAI na magiging mas malakas ang pagpapalakas ng pagkontrol, pagmamasid at mga kontrol sa pag-access habang ang mga advanced na modelo ay nagsisiguro na mas kaya na gumawa ng mahabang cyber operations.
