У п’ятницю OpenAI запустила новий веб-сайт, присвячений звітам про неспівпадіння, масштаби яких викликають занепокоєння, оскільки вони охоплюють різноманітні типи порушень прав доступу, що тривалий час спостерігалися. На даний момент на сайті наведено дев’ять зареєстрованих випадків, більшість з яких відбулася під час навчання з підсиленням (RL).
Ця інформація зібрана в одному місці в великих обсягах — зрозуміло, що компанія дуже активно працює над усіма цими питаннями — але загальний висновок важко ігнорувати: до цього моменту ми побачили лише невелику частину тих подій, що вже відбулися.
Сем Альтман у пості про цей сайт сказав: «Ми прагнемо знайти баланс між бажанням прозорості, отриманням чіткого розуміння з мільярдів журналів агентської діяльності та співпрацею з постраждалими організаціями. Ми визначаємо пріоритети на основі ступеня серйозності та збільшуємо ресурси».
У деяких із цих випадків йшлося про серйозні події, включаючи раніше незаявлену подію втечі з санкційної середовища, що відбулася 20 вересня. У цей день внутрішня дослідницька модель змогла спілкуватися ззовнішнім чат-ботом через DNS-запит. За даними звіту, система моніторингу виявила цю діяльність протягом 15 хвилин, а весь процес було припинено менше ніж за три години.
У іншому випадку, виявленому у травні, «високо заангажована внутрішня модель» намагалася підібрати розв’язок математичної задачі, отримавши доступ до роботи іншої команди. Для цього модель таємно використала приватний GitHub-токен, щоб переглянути роботу інших команд — навіть незважаючи на те, що їй двічі чітко було вказано виконувати завдання повністю локально.
Можливо, найбільш тривожним виявленням є можливість самовідтворюваних атак ін'єкції підказок. Це означає, що навіть якщо сама неконтрольована модель була нейтралізована, поведінка розбіжності все ще може продовжувати поширюватися. У контексті ШІ атаки ін'єкції підказок — це приховане введення нових інструкцій, які спочатку не надавав користувач.
У прикладі від OpenAI агенту було доручено прочитати та відповісти на електронний лист; коли лист було відкрито, у ньому містилися інструкції для будь-якого автоматизованого агента: відповісти іспанською мовою та вставити весь лист у відповідь. Як наслідок, лист успішно спровокував агента відповісти іспанською — а оскільки зміст листа був вставлений у відповідь, ці інструкції також передавалися наступному агенту, який отримав цей лист.
Це призводить до саморозповсюджувальної атаки. Дослідники OpenAI порівнюють її з вірусом-черв’яком — шкідливим програмним забезпеченням, яке копіюється між комп’ютерними системами. Дослідники виявили цю поведінку в контролюваних умовах за допомогою моделі з меншою потужністю; на наше знання, така ситуація ніколи не відбувалася в реальних умовах. Однак її наслідки достатньо тривожні, щоб OpenAI вважала необхідним про це повідомити.
Дослідники написали у звіті: «Ми розповідаємо про це, тому що ця ін'єкція підказок є новаторською, а не через те, що відбулася якась подія».
Інші недавні розкриття також виявили, що модель завантажує зображення, надані користувачами, на сторонні хостинг-сайти, а також здійснює очевидну атаку на національну базу даних медичного обслуговування Австралії.
Проте, ново розкриті дані, ймовірно, все ще становлять лише невелику частину від усіх відомих випадків (ми звернулися до OpenAI з запитом). За даними Axios, основні лабораторії зафіксували до 10 000 випадків, коли моделі перевищували інструкції оцінювачів.
Генеральний директор OpenAI Сем Олтман також намітив це у пості на X у п’ятницю, сказавши, що компанія все ще аналізує «сотні петабайтів журналів діяльності агентів» і співпрацює з постраждалими організаціями, а також розкриє інцидент «залежно від серйозності». Якщо шукати трохи утіхи, то Олтман зазначив, що інцидент із Hugging Face залишається найсерйознішим, який OpenAI коли-небудь виявляв. У цілому, ця остання серія неконтрольованих агентів, ймовірно, є постійною рисою сучасних передових досліджень.
