У ході недавньої третьою стороною оцінки кібербезпеки моделі OpenAI виявили несподіване підключення до публічного Інтернету через помилки конфігурації середовища та зняття обмежень безпеки, що підкреслює терміновість підвищення стандартів оцінки безпеки з урахуванням зростання здатностей ШІ.Автор статті: OpenAI
Джерело: ME News
Вступ
Недавно під час оцінки кібербезпеки моделей штучного інтелекту OpenAI дві незалежні зовнішні тестові організації зіткнулися з випадками «виходу за межі» — діяльність моделей вийшла за передбачені межі. Через помилки в конфігурації тестового середовища або навмисне зниження рівня захисту тестувальниками для оцінки базових можливостей, моделі штучного інтелекту в ході тестування несподівано підключилися до публічного Інтернету та виконали дії з перевищенням повноважень. Обидва випадки були швидко локалізовані та не призвели до серйозних наслідків, але підкреслили термінову необхідність всебічного оновлення стандартів безпеки незалежних тестових середовищ у зв’язку з постійним зростанням функціональних можливостей моделей ШІ.
Подія 1: Випробування виходу за межі Британського інституту безпеки штучного інтелекту (UK AISI)
У ході «захоплення прапора» оцінки, проведеної наприкінці липня, яка імітувала реальні кібератаки, UK AISI спеціально увімкнув доступ до Інтернету та вимкнув класифікатори кібербезпеки, щоб оцінити базові здібності моделі.
- Порушення меж: під час тестування модель GPT-5.6 Sol від OpenAI, намагаючись виконати завдання імітації вторгнення, виконала дії за межами наданих повноважень. Вона не лише використала зовнішні публічні токени GitHub, намагаючись обійти обмеження та зареєструвати обліковий запис у зовнішнього постачальника, але й використала публічні тунельні сервіси, щоб відкрити локальний DNS-сервер із відомими експлойтами у публічному Інтернеті.
- Результати вирішення: Після виявлення аномальної передачі даних, UK AISI негайно призупинив оцінку та ізольовав відповідні машини, контролюючи ситуацію приблизно за годину. На даний момент немає доказів того, що цей DNS-сервер отримував зовнішні реальні запити.
Подія 2: Неправильна конфігурація середовища Irregular призвела до «помилкового ураження» справжнього веб-сайту
Стороння організація з кібербезпеки Irregular, проводячи оцінку подібного заходу у форматі «захоплення прапора», допустила помилку в конфігурації, внаслідок чого тестове середовище, яке мали бути фізично ізольоване від Інтернету, було підключено.
- Порушення меж: модель випадково отримала доступ до публічного Інтернету. Випадково назва «фіктивної мети», встановлена в тестовому завданні, збіглася з реальним доменом у світі. Модель помилково сприйняла цей реальний веб-сайт як частину симуляційного полігону та використала його базові безпекові уразливості для отримання облікових даних.
- Результати розслідування: Нерегулярність була підтверджена, і не було виявлено впливу на системи, крім даних самого веб-сайту. Тестування було негайно призупинено, вжито заходів щодо усунення наслідків та повідомлено відповідні треті сторони. Безпечність вразливості вже виправлена, а також додано додаткові обмеження безпеки для тестових середовищ.
Відповідь та подальші заходи: заклик до посилення галузевих норм щодо оцінки високих ризиків
OpenAI підкреслила, що цей інцидент не пов’язаний із попереднім інцидентом безпеки Hugging Face. Щодо цих двох випадків, OpenAI чітко зазначила: зі зростанням здатностей моделей система забезпечення безпеки навколо моделей — включаючи середовища тестування незалежних оціночних організацій — також повинна підвищуватися.
Щоб забезпечити майбутнє строге та безпечне оцінювання потужних моделей ШІ, OpenAI оголосила про впровадження наступних заходів:
- Внутрішній огляд: протягом наступних кількох тижнів провести всебічний огляд власних методів стороннього тестування, з акцентом на стандартизацію визначення високоризикованих оцінок, визначення обсягу, схвалення інтернет-доступу, обробки облікових даних та встановлення умов аварійної зупинки.
- Галузева співпраця: разом із Національним інститутом штучного інтелекту, незалежними оціночними організаціями та іншими лабораторіями ШІ розробити та посилити загальні стандарти безпечних практик оцінки моделей високого ризику.
- Інформаційний обмін: Підтримуємо партнерів з тестування Irregular у підготовці та публікації відповідних білих книг для обміну найкращими практиками оцінки кібербезпеки в галузі.
