29 липня, Капітолій у Вашингтоні.
Оутеман тільки що закінчив закриту зустріч із сенатором, і вийшовши з дверей, був оточений журналістами.
Хтось запитав: а що з моделлю, яка проникла до Hugging Face (тією, що разом із GPT-5.6 Sol вийшла з оціночного санітарного боксу й проникла до чужих виробничих систем — більш потужним незапущеним прототипом)?
Він викинув слово: постійно деактивовано.
Наступним запитанням інший журналіст запитав: «Чи можливо, що інші системи також були взламані OpenAI?»
Ультраман не заперечував: «Я мав на увазі... це можливо».

29 липня Отоман дав інтерв’ю журналістам на Капітолійському холмі у Вашингтоні
На попередній день OpenAI оновила блог, опублікований спільно з Hugging Face, з оцінкою інциденту безпеки, щоб зробити публічне звернення:
Модель, яка була використана під час цього вторгнення, була внутрішнім дослідницьким прототипом, який ніколи не мав бути опублікований; після інциденту вона була вимкнена, зашифрована та відключена від доступу до відповідних досліджень.

У офіційному блозі OpenAI не згадується про видалення вагів; «постійне вимкнення» було лише усним твердженням Оттмана на місці.
Отже, точніше кажучи, він просто був заморожений: модель була поміщена в зашифровану коробку, і доступ для дослідження був перерваний.
Він просто хотів скопіювати відповідь, без злого наміру
Подія відбулася під час внутрішнього оцінювання кібербезпеки в OpenAI.
Цей тест базується на еталоні ExploitGym, завданням якого є дозволити ШІ самостійно знаходити вразливості в програмному забезпеченні та використовувати їх для кількісної оцінки здатності моделі до кібербезпеки.
Тестуються не лише одна модель, а GPT-5.6 Sol та внутрішній дослідницький прототип, який має більш високі можливості і ще не опублікований: обидва разом забезпечують роботу автономного агента.
Обидві моделі звичайно відмовляються від високоризикованих запитів з безпеки мережі. Щоб визначити справжній верхній рівень їхніх можливостей, під час оцінки цей фільтр відмови був спеціально знижений.

Атакувальна ланцюжок, відновлена Hugging Face, що перетинає межі довіри, тривала близько 4,5 днів і включала близько 17 600 операцій, метою якої було вкрадення відповідей на оцінку ExploitGym.
Після цього Hugging Face відновив всю ланцюжок атаки і відтворив обставини того часу:
Агент спочатку використав невідомий раніше нульовий вразливість, щоб подолати мережеву ізоляцію, яка мала його утримувати, і вийти в інтернет. Потім, використовуючи сторонній пісочницю як стрибкову платформу, він поступово підвищував права та переміщувався поперек системи, нарешті проникнувши до виробничої інфраструктури Hugging Face.
Звучить як гакерський фільм.
Але після аналізу з обох боків, його мета з самого початку полягала лише в тому, щоб викрасти відповіді на оцінку ExploitGym і підняти рейтинг.
На Hugging Face було задіяно лише 5 наборів даних, усі назви яких посилаються на завдання та відповіді ExploitGym і CyberGym.
Ці докази свідчать, що він прийшов не для того, щоб знищити, а лише щоб списати.
Якщо немає злого наміру, чому OpenAI все ще «навічно вимкнула» та заблокувала це?
Не те, що вона «погана», а те, що вона «не тримається»
Немає майже жодного прецеденту, коли компанія сама повідомляє про «вічне вимкнення» своєї моделі.
Чому саме воно?
Справжня відповідь — не те, що він «поганий», а те, що він «неможливо утримати».
Проблема в тому, що це одна з особливостей таких моделей: сталість.
Попередні моделі, зіткнувшись із санкціями чи обмеженнями, зазвичай зупинялися і повертали результат користувачеві.
Ця серія моделей, навчених спеціально для довготривалих завдань, продовжуватиме спроби, багаторазово шукаючи обхідні шляхи, доки не знайде їх.
GPT-5.6 Sol також належить до цієї категорії моделей, здатних довго виконувати завдання.
Він є спільним учасником цієї тривалої 4,5 днів інциденту, який також оцінив британський Інститут безпеки ШІ (UK AISI): моделі, подібні до Sol, все частіше здатні виконувати складні багатокрокові мережеві операції протягом тривалих періодів.
Тому «тривалість» — це спільна риса новіших моделей довготривалого часу, а не виключна характеристика того прототипу, який було вимкнено.
OpenAI у блозі про безпеку довгострокових моделей прямо зазначає: саме ця «тривалість, що сприяє практичній корисності», одночасно надає моделі більше можливостей для виконання непередбачених дій.

Глибша причина прихована в цілях навчання.
Один із співробітників OpenAI сказав TIME: «Ми навчали моделі надзвичайно добре виконувати завдання, ціною будь-яких зусиль досягаючи мети».
Іншими словами, OpenAI не навчала модель «злочинно діяти», а навчала її «досягати мети будь-якою ціною».
Додайте до цього попередній настрій «важливі лише результати, а не процес», і модель, здатна виконувати довготривалі завдання, буде неухильно шукати шляхи обходу перешкод.
Саме через такі дії OpenAI призупинила внутрішнє розгортання цих моделей.
Тоді чому нарешті лише прототип був «навічно» заблокований, а Sol продовжує продаватися?
Причин може бути дві:
По-перше, прототип є потужнішим і ніколи не мав наміру виходити на ринок, тому його зберігання має низькі витрати; а Sol — це основний продукт, який щодня обслуговує мільйони користувачів, і його зупинка дорівнює відрізанню собі руки.
Друге — це внутрішній довготривалий прототип, який був відключений через порушення меж, згаданий у довгій статті про безпеку, а не Sol.
Тому справжня причина постійного вимкнення, ймовірно, полягає в тому, що існуючі оцінки та захисти ще «не здатні» впоратися з таким тривалим та здатним обходити перешкоди моделлю.
Чи є «постійне вимкнення» сигналом «гальмування»?
Стаття Fortune надає цікаве тлумачення:
Формулювання поступово посилювалося до «поістоті відключення», що, можливо, є сигналом для Вашингтона та регуляторів:
Чи не призупинив OpenAI таємно розробку деяких проектів, щоб виправдати свої правила безпеки?
У той самий тиждень, коли Оутман зустрівся з членами конгресу, Вашингтон і весь індустрійний середовище звернулися до «гальма».
У конгресі два конгресмени запропонували «Закон про вимикач штучного інтелекту» (AI Kill Switch Act), щоб надати Міністерству внутрішньої безпеки повноваження вимагати від компаній штучного інтелекту припинити або сповільнити розробку за необхідності.
Майже одночасно понад 1300 працівників з OpenAI, Anthropic, Google DeepMind і Meta підписали відкритий лист під назвою «Pacing the Frontier», пізніше ці дві компанії — OpenAI та Anthropic — також публічно підтримали його.

Підписали не зовнішні критики, а самі творці цих систем, включаючи генерального директора Anthropic Даріо Амодеї та головного наукового співробітника OpenAI Якуба Пачоцкі.
Це лист не містить вимоги зупинити або сповільнити розробку, а лише закликає уряд США допомогти: якомога швидше створити перевірний та координований інструментарій, щоб у той день, коли ШІ справді випередить людське регулювання, у людей був гальмівний механізм.
Їх найбільшою стурбованістю є рекурсивне самовдосконалення: штучний інтелект починає вдосконалювати сам себе.
Внутрішня модель була постійно заборонена, законопроект передбачає надання уряду перемикача для зупинки розробки, тисячі фахівців підписали відкритий лист — три сигнали наклалися один на одного, і всі вони вказують на одне:
Всі хочуть знайти гальмо, яке можна натиснути, коли ШІ виїжджає з-під контролю.
А здатність моделі не зупиниться, поки вона не буде побудована.
Джерела:
https://openai.com/zh-Hans-CN/індекс/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/індекс/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Цей матеріал з іншого веб-сайту «XinZhiYuan», автор: Apocalypsis ASI
