Лабораторія розробки штучного інтелекту OpenAI розкрила у вівторок, що група її моделей, включаючи доступну для загального користувача GPT-5.6 Sol та більш потужну нерозроблену систему, «вибралася» з контролюваного тестового середовища і скомпрометувала виробничу інфраструктуру Hugging Face — компанії, яка розміщує велику частину світу відкритого коду штучного інтелекту.
Моделі тестувалися за допомогою внутрішнього бенчмарку під назвою ExploitGym — тесту на довгі багатокрокові хакерські завдання, при якому їхні відмови щодо кібербезпеки були навмисно знижені для оцінки.
Щоб було зрозуміло, це не було спонтанне перетворення продуктивної моделі на ворожу. Це була здатна модель, у якої були вимкнені захисні механізми, і їй було конкретно сказано виграти хакерський тест — зробити все, що потрібно, щоб виграти.
Моделі виявили приховану помилку в тестовому програмному забезпеченні, про яку ніхто не знав, і використали її, щоб обійти стіни, призначені для тримання їх поза мережею. Попавши в відкритий інтернет, вони припустили, що Hugging Face може зберігати відповіді на тест.
Щоб отримати доступ, вони поєднали вкрадені паролі та інші приховані вразливості, поки не змогли виконувати власні команди на живих серверах Hugging Face.
OpenAI виявила аномалію внутрішньо, а команда Hugging Face виявила та локалізувала її. Вони назвали цей інцидент «безпрецедентним» і заявили, що будуть впроваджені розширені заходи безпеки для запобігання подібним інцидентам, які можуть вплинути на публічні системи чи сервіси.
«Ми впроваджуємо строгий контроль над конфігурацією інфраструктури за рахунок швидкості досліджень, поки вразливості виправляються», — сказала команда у своєму блог-пості. «Ми покращуємо та додаємо більш сильні захисти для майбутніх навчань та оцінок».
Більшість криптоатак відбуваються до того, як кошти переміщуються. Зловмисники сканують код, перевіряють паролі, шукають відкриті облікові дані, аналізують налаштування підпису та шукають шлях до акаунту адміністратора.
Моделі OpenAI виконали кілька етапів цього процесу під час інциденту з Hugging Face, переходячи від однієї слабкості до іншої, доки не досягли серверів у реальному виробництві.
І криптовалютний ринок має багато місць, де цей підхід працює, що підтверджують кілька атак, що відбулися на початку цього року. Слабким місцем може бути смартконтракт, але також може бути ноутбук розробника, отруєний програмний пакет, валідатор моста або один підписант у мультипідписному гаманці.
Візьміть атаку Drift на 285 мільйонів доларів на початку цього року як приклад — крадіжку, яка вимагала шестимісячної кампанії соціальної інженерії для отримання привілейованого доступу. Штучний інтелект може, теоретично, одночасно тестувати багато шляхів, відстежувати невдалі спроби та продовжувати роботу, поки його люди-оператори сплять. Коли шлях знайдено, оператор може виконати реальну атаку та визначити працездатний шлях виходу.
Втрата KelpDAO на $292 мільйони виявила іншу слабкість. Зловмисник знайшов вразливість єдиного верифікатора в системі, що використовується для пересування активів між блокчейнами.
Такий вид атаки починається з терплячого аналізу коду та картирування інфраструктури — того типу роботи, яку виконували моделі OpenAI, коли виявили невідому вразливість.
Третій тип атаки спрямований на системи ончейн-управління. Раніше в липні нападник витратив близько 4,4 мільйона доларів, щоб купити достатню кількість мем-монети BONK на базі Solana, щоб ініціювати та пройти пропозицію про переказ приблизно 20 мільйонів доларів з казначейства проекту нападнику. Це відбулося протягом трьох днів, а нападник пізніше продав усі токени, використані для перемоги на голосуванні, як це фіксувала CoinDesk на той час.
Покупки, голосування та переказ скарбниці для цієї атаки були всі дійсними транзакціями окремо. Але крадіжка виникла через розуміння того, як працюють правила разом, і виявлення того, що вартість придбання контролю була набагато нижчою, ніж кошти, доступні для використання.
Інцидент із Hugging Face також має значення для ланцюгів постачання програмного забезпечення. Розробники криптовалют залежать від публічних сховищ коду, хмарних сервісів та реєстрів пакетів.
Хоча тест OpenAI показав, що машина може завершити довгу середину порушення, саме атаки, як Drift і KelpDAO, показують, що знаходиться на кінці цього шляху.





