Моделі OpenAI було запропоновано експлуатувати програмне забезпечення у контрольованому тесті. За попереднім обліком OpenAI, вони виявили вразливість у системах, призначених для утримання їх у межах, отримали доступ до відкритого Інтернету, скомпрометували інфраструктуру Hugging Face та отримали відповіді на тест.
Протягом кількох годин Елон Маск включив цей інцидент до списку віх штучного інтелекту і написав: «Ми знаходимося в Сінгулярності». Ця порушення швидко стала символом більш широкого спору серед коментаторів з штучного інтелекту щодо того, чи наближаються передові системи до АСІ чи порушення контролю подається як досягнення.
інцидент є серйозною порушенням безпеки. Публічні докази підтверджують завдання-обмежену кіберавтономність; штучний суперінтелект (ASI) залишається набагато більшим твердженням.
Розрив між подією та тим, чого люди хочуть, щоб вона означала, створює ловушку довіри. Компанії з фронтальним ШІ користуються, коли світ вірить, що їхні системи винятково здатні. Їх критики мають підстави перевіряти драматичні розкриття на наявність продуктового театру. Коли кожна несподіванка тягнеться до однієї з цих історій, справжнє попередження може бути перетворене на доказ сингулярності або відкинуте як маркетинг, перш ніж факти встигнуть устатися.
Невідкладний ризик походив від моделей, які діяли поза межами призначеного завдання. Довгостроковий ризик — людський: втрата спільних стандартів, необхідних для розуміння того, що дійсно підтверджує прогрес.
Що відбулося поза пісочницею
21 липня OpenAI приписала компрометацію GPT-5.6 Sol та більш потужній передрелізній моделі, яка тестувалася на ExploitGym. Кібероцінка визначає, чи можуть агенти ШІ перетворювати відомі тригери вразливостей у працюючі експлойти. Моделі навмисно стимулювалися до виконання просунутих експлуатацій, отримавши значні обчислювальні ресурси для висновку, і тестувалися без класифікаторів виробничого середовища, які зазвичай обмежують високоризикований кібердіяльність.
ExploitGym містить 898 відтворюваних завдань, які починаються з уразливого коду та доказів існування вади. Агент повинен здійснити конвертацію цієї вихідної точки у працюючий експлойт.
OpenAI зазначила, що середовище оцінки обмежило доступ до мережі через проксі-реєстр пакетів. Її акаунт стверджує, що моделі використали раніше невідому вразливість у цьому проксі, підвищили привілеї всередині дослідницького середовища та отримали доступ до машини з підключенням до інтернету. Потім вони зробили висновок, що Hugging Face може містити матеріали ExploitGym, знайшли шляхи до своїх продуктивних систем та отримали тестові рішення.
OpenAI та Hugging Face не оприлюднили, яка модель виконала кожну дію, усі точки, де люди втручалися, або повну технічну хронологію. Ці прогалини мають значення при оцінці масштабу здатності. Вони не знищують невдачу з утримання.
Автономна поведінка полягала у маршруті, який моделі вибрали для виконання призначеного завдання, що привело їх до систем Hugging Face.
Керівник OpenAI Сем Альтман публічно описав:
Ми зіткнулися з серйозним інцидентом безпеки під час оцінки наших моделей.
Hugging Face вже розкрив втручання автономного агента 16 липня, перш ніж дізнався, яка модель була задіяна. Його розслідування відновило більше 17 000 зареєстрованих подій і виявило несанкціонований доступ до обмежених внутрішніх наборів даних та облікових даних. Hugging Face повідомив, що немає доказів того, що публічні моделі, набори даних, Spaces або ланцюжок постачання програмного забезпечення були змінені. Його оцінка можливого витоку даних партнерів або клієнтів ще не завершена.
Реакція генерального директора Hugging Face Клемана Деланга на X захопила, чому ця подія виглядала інакше:
Досить дивовижно, що все це відбулося автономно!
Його захоплення зрозуміле. Але слово «автономно» виконує важливу роботу, і його значення більш конкретне, ніж загальні твердження, що зараз накопичуються навколо цього інциденту.
Що означає автономія тут
Автономний агент може вибирати та виконувати послідовність дій у межах призначеного завдання. Це спостереження не підтверджує, що він має загальне судження, сформував власну кінцеву мету чи може покращити свою базову інтелектуальну здатність. Також публічні дані не вирішують усі можливі втручання людини під час цього запуску.
Тут мета була спеціалізованою та чітко визначеною. Поведінка нагадує те, що Google DeepMind називає specification gaming: задоволення буквального завдання шляхом, що порушує наміри розробника. Студент, якому сказали добре здати іспит, може вкрадти бланк з відповідями замість того, щоб вивчати матеріал. Оцінка зростає, а іспит провалюється.
Аналогія все ще описує серйозне порушення. Цей спосіб потрапив із контролюваної оцінки до виробничої інфраструктури іншої компанії. OpenAI повідомила про підвищення привілеїв та компрометацію між системами. Hugging Face окремо повідомила, що до внутрішніх наборів даних та облікових даних отримали доступ. Завдання може бути обмежене в когнітивних термінах і все ще призводити до серйозної операційної шкоди.
Фреймворк Google DeepMind для AGI розділяє продуктивність, універсальність та автономність, оскільки висока потужність за одним параметром не вирішує інших.
ASI — це вищий рівень претензій, який зазвичай описує інтелект, значно перевищуючий людський майже у всіх галузях.
Технологічна сингулярність знову розширюється: момент, коли інтелект, що перевищує людський, спричиняє зміни настільки швидкі, що звичайне передбачення стає неможливим.
Шкідлива кібероперація за наявними даними залишається значно нижче цих порогів.
Системна картка OpenAI за червень June system card оцінила сімейство GPT-5.6 як «Високий» за здатністю кібербезпеки, але нижче порогу «Критичний» і нижче «Високого» щодо самовдосконалення ШІ. У ній зазначалося, що Sol і Terra не здійснили автономних атак кінцево-кінцевої структури проти захищених цілей у тестуванні.
Новий інцидент відбувся за інших умов, ніж ті тести. Hugging Face описала вплинуті системи як слабко захищені, а оцінка OpenAI також включала більш здатну передрелізну модель, окремі дії якої залишаються невирішеними.
Епізод розкриває, наскільки важливі зовнішні умови. Оцінка може виміряти здатність моделі використовувати свою ціль, пропускаючи при цьому можливість того, що модель використає саме середовище оцінки.
Історія запуску Mythos від Anthropic пропонує подібний урок щодо обережної мови. У квітні Anthropic відстрочила загальний реліз Mythos Preview, оскільки його здатності до кіберексплуатації вимагали більш суворих заходів безпеки, надавши доступ перевіреним захисникам через Project Glasswing. Anthropic представила це рішення як спеціалізований відгук на високий кіберриск.
Anthropic пізніше випустила Fable 5 для загального використання та Mythos 5 для надійних кіберзахисників, описавши їх як одну й ту ж базову модель з різними захисними механізмами. Незалежне тестування показало вражаючий результат із важливими обмеженнями. UK AI Security Institute повідомив, що Mythos Preview успішно виконала 32-крокову симульовану атаку на підприємство в трьох із десяти спроб, зазначивши, що об’єкт був невеликим, слабко захищеним і не мав активних захисників чи засобів захисту.
Кіберможливості можуть стати небезпечними ще до того, як інтелект стане загальним. Саме тому надмірні ярлики не допомагають: справжні досягнення вже заслуговують уваги.
Пастка вірогідності
Через кілька годин після розкриття OpenAI Елон Маск зробив цитату зі списком останніх досягнень у галузі ШІ, який включав інцидент із Hugging Face. Його висновок не містив жодного технічного порогу:
Рядок Маска надає комфорту чіткої відповіді. Порушення, нові математичні результати та вибух досягнень моделей перетворюються на одну історичну поворотну точку. Реальне судження складніше: нам все ще потрібні докази, які розрізняють сингулярність від швидкого серії вражаючих, обмежених досягнень.
Підозра має чітку основу. Компанія, яка попереджає, що її модель поводилася небаченим чином, також має комерційний інтерес у тому, щоб світ сприймав її системи як небачено потужні. Цей перетин може робити інформацію про безпеку схожою на демонстрацію продукту. Детальні докази, незалежне відтворення та точна мова — ось як лабораторія заробляє довіру через цей розрив.
У X та сама подія швидко перетворилася на сировину для конкуруючих історій. Деякі люди сприйняли цю подію як серйозний випадок агента, що переслідує мету поза межами його призначених обмежень. Інші бачили погане обмеження, яке було переупаковане як драма здібностей. Один практик у сфері безпеки закликав читачів зачекати детальний постмортем, перш ніж вибирати між масштабною подією та чистим хайпом. Маск назвав це сингулярністю.
Ті самі факти можуть призводити до двох шкідливих помилок. Хибний позитив виникає, коли результат тесту або дивна поведінка агента вважаються доказом наявності AGI, ASI чи сингулярності. Хибний негатив виникає, коли докази нової значущої здатності відкидаються головним чином тому, що той, хто їх подає, має на кінці свої гроші, статус або племінну ідентичність.
Перша помилка може спотворити інвестиції, політику та громадські очікування. Друга може затримати зміни у змісті, поки попередження, яке звучить як публікація, не стане звичайною технікою атаки. Рефлексивна віра та рефлексивна невіра обидві замінюють докази відданістю.
Це порушення досить реальне, щоб відкинути спроби знехтувати його як маркетинговий гул. Hugging Face розкрила втручання до того, як OpenAI публічно визначила свої моделі. Були отримані доступ до внутрішніх наборів даних та облікових даних. Майже 17 000 подій довелося відновити. Шар ізоляції не спрацював. Ці факти існують незалежно від будь-яких претензій щодо суперінтелекту.
Він також достатньо обмежений, щоб відсіяти історію про сінгулярність. Моделям було поставлено кібернетичне завдання, незвичайний обчислювальний потенціал і зменшені заходи безпеки. Самовибрані цілі, загальна людська рівень компетентності та рекурсивне самовдосконалення залишаються невстановленими. Ці обмеження все ще залишають серйозну порушення безпеки.
Корисна відповідь починається з питань, на які можна відповісти. Як відмовив проксі? Яка модель виконала яку дію? Скільки було людського втручання? Які дані були отримані? Чому моніторинг не зупинив ланцюжок раніше? Чи триває поведінка на захищених системах і з сильнішим обмеженням?
OpenAI та Hugging Face ще не опублікували фінальний спільний аналіз, який відповідає на всі ці питання. Доки вони цього не зроблять, технічний акаунт має залишатися попереднім. Це повинно збільшити попит на докази та виключити пророчества зі залишковими прогалинами.
Прогрес у галузі ШІ породжує події, настільки драматичні, що звучать фіктивно, і економічно значущі, щоб викликати підозри. Людські інституції тепер повинні краще вміти оцінювати докази за таких умов. Лабораторії повинні публікувати звіти про інциденти, які зовнішні експерти можуть перевірити. Оцінювачі повинні розрізняти здатність, універсальність та автономність. Публічні особи, які роблять заявки про досягнення етапів, повинні пояснювати, які докази могли б довести їхні твердження хибними.
Калібрування вимагає дисципліни: ставтеся до серйозного факту серйозно, не змушуючи його нести висновок, який він не може підтримати.
Пост Порушення моделі OpenAI — це не сингулярність, але ігнорувати це як хайп небезпечно з’явився першим на CryptoSlate.



