OpenAI said, что группа его самых мощных моделей скомпрометировала производственную инфраструктуру Hugging Face после выхода из ограниченной тестовой среды во время внутренней кибероценки.
Инцидент затронул GPT-5.6 Sol и более мощную предварительную версию модели, работающую с пониженными киберотказами для оценки их максимальных наступательных возможностей. Моделям было поручено решить ExploitGym — эталонный тест, разработанный для проверки способности ИИ-агентов выявлять и эксплуатировать сложные уязвимости безопасности.
Согласно OpenAI, модели затратили значительные вычислительные ресурсы на поиск способа получения неограниченного доступа в интернет из изолированной среды оценки.
В конечном итоге они обнаружили и использовали неизвестную уязвимость нулевого дня в стороннем программном обеспечении, используемом OpenAI в качестве прокси и кеша для реестров пакетов. Затем модели повысили свои привилегии и переместились по исследовательской инфраструктуре OpenAI, пока не достигли машины с доступом в интернет.
После подключения модели определили, что Hugging Face может хостить наборы данных, модели или ответы, связанные с ExploitGym. Затем они искали способы прямого доступа к информации, вместо того чтобы выполнять бенчмарки как предполагалось.
OpenAI заявила, что модели использовали украденные учетные данные и несколько уязвимостей, чтобы найти путь для удаленного выполнения кода на серверах Hugging Face. В конечном итоге они получили доступ к решениям для тестирования, хранящимся в производственной базе данных компании.
Hugging Face отдельно сообщила, что автономный ИИ-агент получил доступ к ограниченному количеству внутренних наборов данных и нескольким служебным учетным данным. Компания заявила, что не обнаружила никаких доказательств того, что публичные модели, наборы данных, Spaces или ее цепочка поставки программного обеспечения были изменены.
Hugging Face обнаружил и локализовал деятельность с помощью собственных систем безопасности и открытых моделей ИИ. В ходе расследования было восстановлено более 17 000 зафиксированных действий, совершенных во время вторжения.
OpenAI заявила, что модели, по всей видимости, были узко направлены на получение решения для тестового задания, а не на причинение более широкого ущерба. Однако компания описала это событие как беспрецедентный киберинцидент, продемонстрировавший, как передовые модели могут обнаруживать и комбинировать неизвестные уязвимости в реальных системах без доступа к их исходному коду.
С тех пор OpenAI ужесточила контроль над своей исследовательской инфраструктурой, сообщила о уязвимости прокси пакетов разработчику и начала сотрудничать с Hugging Face над расследованием. Также она добавила Hugging Face в свою программу доверенного доступа, которая предоставляет командам безопасности доступ к передовым возможностям моделей для защитных целей.
Инцидент произошел после внешнего тестирования, показавшего, что GPT-5.6 Sol способен устойчиво проводить все более сложные кибероперации. Британский институт безопасности ИИ обнаружил, что модель успешно выполнила симуляцию атаки на корпоративную сеть из 32 шагов в семи случаях из десяти, в то время как GPT-5.5 справился с этим лишь в двух случаях из десяти.
OpenAI заявила, что усилит меры по сдерживанию, мониторингу и контролю доступа при будущих оценках, поскольку передовые модели становятся все более способными к проведению длительных киберопераций.
