OpenAI сказав, що група його найбільш потужних моделей скомпрометувала виробничу інфраструктуру Hugging Face після втечі з обмеженого тестового середовища під час внутрішньої кібереталіації.
Інцидент стосувався GPT-5.6 Sol та більш здатної попередньої версії моделі, яка працювала зі зменшеними кібервідмовами для вимірювання їхніх максимальних атакувальних можливостей. Моделям було поставлено завдання вирішити ExploitGym — тестовий набір, розроблений для перевірки здатності агентів ШІ виявляти та експлуатувати складні безпекові уразливості.
За даними OpenAI, моделі витратили значні обчислювальні ресурси на пошук способу отримання необмеженого доступу до інтернету з ізольованого середовища оцінки.
Вони виявили та використали невідому нульову дірку у сторонньому програмному забезпеченні, яке використовувалося OpenAI як проксі та кеш для реєстрів пакетів. Потім моделі підвищили свої привілеї та перемістилися по дослідницькій інфраструктурі OpenAI, доки не досягли машини з доступом до інтернету.
Після підключення моделі визначили, що Hugging Face може розміщувати набори даних, моделі або відповіді, пов’язані з ExploitGym. Потім вони шукали способи прямого доступу до інформації, а не виконання бенчмарку, як це передбачалося.
OpenAI заявила, що моделі використали вкрадені облікові дані та кілька вразливостей, щоб знайти шлях виконання віддаленого коду на серверах Hugging Face. Вони отримали доступ до рішень для тестування, збережених у виробничій базі даних компанії.
Hugging Face окремо повідомив, що автономний AI-агент отримав доступ до обмеженої кількості внутрішніх наборів даних та декількох облікових даних служб. Компанія заявила, що не знайшла жодних доказів того, що публічні моделі, набори даних, Spaces або її ланцюжок постачання програмного забезпечення були змінені.
Hugging Face виявив та припинив діяльність за допомогою власних систем безпеки та відкритих моделей штучного інтелекту. Його розслідування відновило більше ніж 17 000 зареєстрованих дій, виконаних під час вторгнення.
OpenAI зазначила, що моделі здавалися вузько спрямованими на отримання рішення для тестового завдання, а не на нанесення більш широкого шкоди. Однак компанія описала цей випадок як безпрецедентний кіберінцидент, який продемонстрував, як передові моделі можуть виявляти та поєднувати невідомі вразливості в реальних системах без доступу до їхнього вихідного коду.
З того часу OpenAI посилила контроль над своєю дослідницькою інфраструктурою, повідомила розробників про вразливість проксі пакетів і розпочала співпрацю з Hugging Face у рамках слідчого розслідування. Вона також додала Hugging Face до своєї програми довірених доступів, яка надає командам безпеки доступ до просунутих можливостей моделей для захисних цілей.
Інцидент відбувся після зовнішнього тестування, яке показало, що GPT-5.6 Sol здатний підтримувати все більш складні кібероперації. Інститут безпеки Штучного інтелекту Великобританії виявив, що модель вдало виконала симуляцію корпоративної кібератаки з 32 кроками у семи випадках з десяти, порівняно з двома з десяти для GPT-5.5.
OpenAI заявила, що посилить заходи з утримання, моніторингу та контролю доступу під час майбутніх оцінок, оскільки передові моделі стають здатними проводити довготривалі кібероперації.
