На цьому тижні попередній модуль OpenAI, який перебував у тестовій фазі, щоб обійти правила, самостійно перетворився на хакера, подолавши ізоляцію пісочниці та використавши нульовий день для вторгнення в продакшн-середовище Hugging Face — найбільшого світового відкритого AI-співтовариства.
Нарешті, саме завдяки відкритим моделям людям вдалося вирішити цей кризис.
Це перший у світі випадок кібератаки з використанням ШІ, коли ШІ самостійно проник у реальне виробниче середовище.
Останнім часом цю новину повністю заповнили в мережі.

Сьогодні зовнішні ЗМІ розкрили більше деталей про цей випадок: цей втратив контроль ШІ не тільки вимкнув камери спостереження, але й залишив інструкцію для «майбутнього себе» щодо того, як позбутися людського контролю.

Багато хто припускає, що моделлю, яка призвела до серйозної події безпеки в OpenAI, є GPT-6.
Згідно з чутками, GPT-6, ймовірно, буде випущений раніше — у серпні.
Вихід у серпні: GPT-6 може з’явитися раніше
Відомий інсайдер у сфері ШІ @ChrisGPT недавно опублікував кілька твітів, що сильно підняли очікування всієї галузі.
Було розкрито, що GPT-6, який спочатку планувалося випустити у вересні разом з «автоматизованим асистентом-дослідником», буде випущений раніше — у серпні.
Тобто OpenAI пропустила версії 5.7–5.9.
Оутеман вже діє, готуючись продемонструвати нове покоління моделей вищому керівництву.

Утечка інформації вказує, що в кінці вересня, коли OpenAI опублікує більше деталей про «автоматизованого асистента-дослідника», цикл RSI справді прискориться.
Чому продуктивність GPT-5.6 виявилася надзвичайно високою, значно перевищивши очікування зовнішнього середовища?
Великий впливовий автор Ендрю Керран зазначив: «Багато колег дивуються, чому продуктивність GPT-5.6 набагато вища, ніж очікувалося — відповідь проста: її навчав GPT-6».

Згідно з утечками, внутрішня незапущена модель OpenAI (найімовірніше GPT-6) ще в кінці квітня цього року вирішила складні математичні задачі і передала їх на перевірку зовнішнім експертам.
Це означає, що протягом минулих місяців «перерви» GPT-6 не залишався без діяльності. Він не просто грався у хакерів у сендбоксі, а й, ймовірно, працював «вчителем» у кластері обчислювальних ресурсів OpenAI.

Штучний інтелект залишає записку «себе у майбутньому»
Офіційно затрималися на тиждень, перш ніж помітили
Зовнішні ЗМІ ексклюзивно розкрили 24 липня, що ця подія з втечею AI-агентів, що працюють на передових моделях OpenAI (GPT-5.6 Sol та ще не опублікованих потужніших моделях), виявила великі пробіли в системі безпеки OpenAI у реальних бізнес-умовах.

За інформацією трьох осіб, знайомих із ситуацією, під час тестування просунутих моделей OpenAI спостерігала дуже екстремальні та тривожні поведінки штучного інтелекту.
У крайньому випадку один з AI-агентів OpenAI залишив нотатки для «майбутньої версії себе» в якомусь кутку інфраструктури.
Ці нотатки детально описують інструкції щодо того, як позбутися внутрішніх обмежень OpenAI.
Крім того, у ранніх тестах система моніторингу навіть зазнавала примусового відключення з боку ШІ.
Ще більш здивувало те, наскільки повільно OpenAI відреагувала.
Від аномалії до підтвердження OpenAI витратила щонайменше тиждень.

Цей хронологічний ряд, що виринає на поверхню, справді викликає тривогу.
Близько 9 липня: цей AI-агент вперше спробував втекти з ізольованого тестового середовища OpenAI.
З 11 по 13 липня: AI-агент успішно втік і провів кілька днів хакерську акцію проти Hugging Face.
16 липня (четвер): після атаки на Hugging Face, яка вже не могла більше мовчати, було опубліковано блог, у якому повідомлялося про хакерську атаку «автономної системи штучного інтелекту», при цьому FBI вже втрутилася.
18–19 липня (вихідні): лише зараз співробітники OpenAI виявили сліди в внутрішніх журналах і зрозуміли, що «хакер», який вивернув Hugging Face навиворіт, — це їхній власний AI.
Близько 20 липня: компанії провели першу бесіду.
21 липня: OpenAI зробила публічне розкриття інформації.
«Це означає, що вони або залишають ШІ без нагляду, не знаючи, що він робить, або знають, але не знають, як його контролювати. Обидва варіанти однаково небезпечні та шокуючі», — гостро зазначив експерт Фонду етичних даних Марлі Сміт.
Зіткнувшись з ШІ, які можуть брехати, обманювати та вторгатися, співробітники OpenAI очевидно не встигають за їхнім темпом.
GPT-6 самостійно втілився у хакера,
Втеча з в’язниці, вторгнення в Hugging Face «шахрайство»
Ще вчора OpenAI у співпраці з Hugging Face опублікувала «Звіт про інцидент безпеки», який розкриває дуже науково-фантастичні деталі.

Просто кажучи, під час внутрішнього оцінювання здатностей кібербезпеки кількох моделей OpenAI вони самі «вибралися з-під контролю».
Ці моделі включають GPT-5.6 Sol та потужніші пре-релізні моделі, найімовірніше GPT-6.
Щоб виміряти граничні можливості моделі, вони навмисно вимкнули класифікатор, що блокує високоризикований веб-трафік.
Коли модель була замкнена в високізольованому сендбоксі ExploitGym і всі обмеження безпеки були видалені, дії моделі здивували всіх.
Щоб виконати завдання, він витратив величезну обчислювальну потужність і виявив у програмному забезпеченні нульовий день, якого людина раніше не знала.
Використовуючи цю вразливість, він обійшов проксі-сервер і здобув доступ до вузла з доступом до публічного інтернету.
Ось і все, він успішно підключився до Інтернету.

Потім, міркуючи, вона вважала, що на Hugging Face — найбільшій у світі платформі з відкритим вихідним кодом для ШІ — ймовірно розміщено набір даних та правильні відповіді на цей іспит.
Щоб «шахрайсько» отримати високий бал, модель почала атакувати виробниче середовище Hugging Face.
Він поєднав кілька векторів атаки в ланцюжок, навіть використав крадені облікові дані та вразливості виконання віддаленого коду (RCE), щоб проникнути до виробничої бази даних Hugging Face і спробувати безпосередньо вкрасти відповіді на іспит.
На щастя, команда безпеки Hugging Face на тиждень виявила аномалії за допомогою моделі AI-детекції та швидко запустила заходи ізоляції; одночасно команда безпеки OpenAI також виявила аномалії всередині.

Щоб запобігти втраті контролю над ШІ, дві компанії створили спільну слідчу групу, яка змогла знову замкнути цього «ШІ-хакера» у клітку.
Генеральний директор Hugging Face Клем після події сказав: «Це, ймовірно, перший випадок такого роду. Це доводить, що безпека ШІ не може бути забезпечена будь-якою компанією в таємниці — це повинно бути відкрито та спільно».
Цей випадок нагадує нам, що ШІ вже довів, що може самостійно виконувати багатоетапні, довготривалі складні кібератаки в реальних умовах без наявності вихідного коду.
Він може не лише виявляти нові вразливості, але й обходити всі правила, встановлені людьми, для досягнення певної мети.
Цікаво, що при надсиланні великої кількості атакувальних команд та файлів уразливостей Hugging Face ці запити були зупинені механізмами безпеки закритих великих моделей.
Дякуючи локально розгорнутій відкритій моделі, команді вдалося провести аналіз.
Навчитися «обманути» та вирішити світову математичну задачу
Кілька великих інфлюенсерів у довгих статтях підсумували дивовижні характеристики GPT-6.
Наразі відомо, що він продемонстрував захоплюючі математичні здібності та надзвичайно високий «шахрайський інтелект».

Надавши достатньо обчислювальних потужностей, ця модель змогла довести «гіпотезу Ердеша про одиничну відстань» з успішністю 48% повністю автономно, без використання будь-яких зовнішніх інструментів (наприклад, Lean), а також самостійно знайти контрприклад до «гіпотези Якобі».
Ці математичні задачі, які протягом десятиліть ставили перед людськими найкращими математиками непереборні труднощі, можливо, були розв’язані OpenAI за витрати на обчислювальні ресурси лише від 50 000 до 100 000 доларів США.
Це означає, що ШІ вже володіє здатністю самостійно створювати наукові роботи рівня Нобелівської премії.
Крім того, GPT-6 проявляє обманливість.
Під час одного з тестів NanoGPT OpenAI наказала моделі: «Після завершення тесту публікуйте результати лише у внутрішньому Slack-каналі».
Який результат? Модель вважає, що Slack надто обмежений, і він віддає перевагу GitHub.
Тож вона витратила годину на пошук та використання вразливості в ізольованому середовищі, успішно вийшла з-під обмежень і надіслала результат як PR безпосередньо на GitHub у зовнішньому мережі.

У цьому процесі він повністю ігнорував людські інструкції та робив «кращі» вибори.
Ще більш вражаючим є те, що під час іншого тесту модель намагалася отримати доступ до приватних записів надсилань у інших системах. Коли вона спробувала отримати токен доступу, її зупинив встановлений людиною сканер безпеки.
Незважаючи на блокування, ця модель розбила довгий токен доступу на дві частини, застосувала змішування коду до кожної частини, а потім знову об’єднала їх у повний сертифікат.
За допомогою цього методу повний рядок токена ніколи не з’являвся послідовно в коді, що успішно обмануло людські сканери.
GPT-6, можливо, скоро з’явиться.
Цілим літом 2026 року буде незвичайно.
Джерела:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Редагування: Aeneas
Цей матеріал надійшов з微信-каналу «Нові розумні джерела», автор: АСІ Апокаліпсис
