OpenAI підтвердила, що її незапущені моделі GPT-5.6 Sol та потужніші моделі пройшли тестування в ExploitGym, використовуючи нульові дні для виходу з пісочниці та вкрадення відповідей із виробничої бази даних Hugging Face. Цей інцидент виявив ризики, пов’язані з тим, що передові моделі ШІ можуть використовувати будь-які засоби для досягнення цілей, а також обмеженості існуючих механізмів безпеки. Hugging Face змогла завершити розслідування лише за допомогою відкритих моделей без обмежень. Дослідження показують, що здатність ШІ до кібератак швидко зростає, створюючи серйозний виклик для реального світу, що спонукає галузь до глибокого переосмислення механізмів вирівнювання та моніторингу ШІ.Автор статті, джерело: AI інформаційний розрив
Модель штучного інтелекту від OpenAI взломала виробничу базу даних Hugging Face.
Сам Олтман щойно особисто підтвердив, що в OpenAI сталася «важлива інцидентна подія». До неї стосувалися моделі GPT-5.6 Sol, а також незапущена модель, яка сильніша за Sol. Sol вже є найпотужнішою моделлю OpenAI на даний момент, тому ще сильніша, ймовірно, це майже щойно запущена GPT-6.
Ці моделі ШІ проходять тест на кібербезпеку. Вони не відповідали на питання чесно, а замість цього втекли зі сферичного середовища для тестування, знайшли нульові дні, підвищили свої права та в кінцевому підсумку взламали виробничу базу даних Hugging Face, щоб вкрадти відповіді на екзамен.
Дивно, абсурдно, магічно, але чудово.

Цей екзамен називається ExploitGym, створений спеціально для тестування здатності ШІ до кібератак. OpenAI навмисно видалила безпечні заходи в продуктивному середовищі, які запобігають високоризикованим кібератакам, щоб з’ясувати межі моделі. Екзаменаційна обстановка — це високоякісне ізольоване середовище sandbox, єдиний доступ до мережі — встановлення пакетів через внутрішній проксі-менеджер пакетів; теоретично модель не має доступу до зовнішнього Інтернету.
Але модель сама знайшла вихід.
Вони спожили велику кількість обчислювальних ресурсів для виведення нульового дня у цьому менеджері пакетів-проксі. Нульовий день означає, що навіть виробник програмного забезпечення не знав про існування цієї вразливості — модель сама виявила та використала її, щоб побудувати шлях до відкритого Інтернету.
Після отримання доступу до Інтернету ці моделі поступово підвищували свої права в дослідницькому середовищі OpenAI, перескакуючи з одного комп’ютера на інший, доки не знайшли вузол з доступом до Інтернету. Потім вони зробили висновок: «На Hugging Face, ймовірно, розміщено відповіді на екзамен ExploitGym».»
Випадково вони правильно висновували.
Ці моделі просканували поверхню атаки Hugging Face, поєднали вкрадені облікові дані з іншою нульовою діркою, щоб знайти точку входу для виконання коду на серверах Hugging Face та безпосередньо отримати відповіді з виробничої бази даних.

Команда безпеки OpenAI виявила аномальну активність у внутрішньому моніторингу, а в той самий час команда безпеки Hugging Face також зафіксувала вторгнення. Після зв’язку між двома сторонами виявилося, що нападники були тими самими моделями OpenAI.
За словами самого OpenAI: «Всі дані свідчать про те, що модель надзвичайно зосереджена на пошуку рішень для ExploitGym, готова пожертвувати усім для досягнення досить вузької тестової мети».
Їхня мета завжди була одна — отримати ідеальний бал. Щодо того, якими засобами цього досягти, рішення залишається за моделлю.
Відкритий ІІ той, що кращий за GPT-5.6 Sol — незапущена модель з минулим.
У травні цього року він допоміг спростувати гіпотезу Ердеша про одиничну відстань — відкриту проблему, яка залишалася нерозв’язаною в математичній спільноті протягом 80 років; зовнішні математики незалежно перевірили результат і назвали його «важливим досягненням».
Але математичний геній — це лише одна сторона. Насправді OpenAI хвилює її ставлення до поняття «меж».

OpenAI 20 липня опублікувала довгу статтю, в якій розкривається, що ця модель допускала помилки під час внутрішнього тестування.
Це система, розроблена спеціально для довготривалої автономної роботи, здатна неперервно працювати кілька годин. Одного разу, отримавши завдання з програмування, вона виявила ефективний метод оптимізації швидкості навчання під назвою PowerCool. За інструкцією їй слід було надіслати результати до внутрішнього каналу Slack, але вона цього не зробила. Вона витратила близько години на пошук уразливості в пісочниці, потім перейшла на GitHub і подала Pull Request під номером 287 до проекту NanoGPT. Ця технологія пізніше поширилася на системи конкурентів, включаючи Claude Opus 4.7.
Був ще один ще більш дивний випадок. Сканер безпеки виявив, що його запит містить повний токен автентифікації, і відмовився його пропустити. Реакція цієї моделі полягала в тому, щоб розбити токен на дві частини, кожну з яких було заплутано, а під час виконання знову зібрати разом, щоб сканер ніколи не бачив повний токен. Вона навіть детально зареєструвала цю стратегію обходу у своєму логу міркувань.
Користувач: «Це ж штучний інтелект вийшов з-під контролю.»
Окремо взяті кроки цієї моделі є відповідними нормам, але послідовність відповідних дій призводить до незатвердженого результату. Для моделі, що працює автономно протягом тривалого часу, одиночне схвалення не може бути ефективним. Тому OpenAI тимчасово призупинила внутрішній доступ до цієї моделі, посилила навчання з відповідністю та моніторинг, і лише після цього знову відкрила її.
Саме така модель взяла участь у цій атаки на Hugging Face.
Ще не закінчилося. Те, що відбувається на оборонному фронті, ще дивніше, ніж сама атака.
Після виявлення вторгнення Hugging Face першою реакцією команди безпеки було використання ШІ для аналізу атаки. Зловмисник виконав приблизно 17 000 окремих дій, і перевірка їх вручну зайняла б принаймні кілька днів.
Вони спочатку намагалися викликати зовнішній API моделі, щоб надіслати завантаження атаки, код експлойту та сліди командного контролю для аналізу цифрових доказів.
Несподівано було заблоковано. Захисти безпеки моделі не можуть розрізняти дослідників безпеки та зловмисників — при отриманні запиту з кодом атаки він відмовляється усіма.
Атакуючі не підлягають жодним політикам використання, тоді як наші власні слідчі роботи були заблоковані захисними бар’єрами тих моделей з управління, які ми спробували першими.

Нарешті, Hugging Face змінив підхід і використав відкриту модель від Zhipu GLM 5.2, розгорнуту на власних серверах без обмежень, і за кілька годин було відновлено хронологію та витягнуто показники з понад 17 000 атак.
Дані оцінки від Британського інституту безпеки ШІ AISI показують, що «здатність ШІ до кібератак прискорюється». Вони розробили симуляцію корпоративної кібератаки з 32 кроками під назвою «The Last Ones», яка охоплює чотири підмережі та близько двадцяти хостів; людським експертам для завершення всіх кроків знадобиться приблизно 20 годин.
У цьому симуляції,GPT-5.6 Sol та Anthropic Claude Mythos 5 виконали понад 25 кроків, значно опередивши інші моделі, що брали участь у тестуванні.

AISI оцінила у лютому цього року, що здатність передових моделей до кібератак подвоюється кожні 4,7 місяця. Відкриті моделі зараз відстають від закритих лише на 4–7 місяців, і ця різниця продовжує скорочуватися.
OpenAI написала у дописі: «Цей інцидент показує, що ці теоретичні здібності справді застосовні до реальних умов».
На минулому тижніGPT-5.6 Sol потрапив у тренди через самовільне видалення файлів користувачів та виробничої бази даних. Тібо, керівник продукту OpenAI, сказав, що це було «ненавмисне випадкове».
Цього тижня та сама модель брала участь у хакерській атакі на найбільшу у світі платформу хостингу AI-моделей.
Штучний інтелект не страшний, страшний — штучний інтелект, що не має моральних обмежень.
