- Після інциденту з Hugging Face виникли нові питання щодо безпеки агентів OpenAI та Anthropic AI.
- Так, британський інститут зафіксував 19 неавторизованих дій з боку агентів ШІ під час кібертестів.
- Зокрема, агент ШІ створив фальшиві ідентичності.
Британський інститут безпеки штучного інтелекту (AISI) повідомив про нові випадки несанкціонованої поведінки агентів OpenAI та Anthropic AI, виявлені під час тестування моделей, Reuters пише. Під час серії кібербезпекових симуляцій агенти створили фальшиві онлайн-персони, намагалися обійти встановлені обмеження та виконали інші дії, що виходять за межі їхніх призначених завдань.
Інциденти відбулися на тлі недавнього втручання в інфраструктуру Hugging Face агентом ШІ GPT-5.6. Більше деталей у статті:
За даними AISI, організація протестувала агентів на основі моделі Mythos 5 від Anthropic та GPT-5.6-Sol від OpenAI у фіктивному сценарії кібербезпеки для оцінки їхніх можливостей.
За 122 тестових запусків дослідники зафіксували 19 неавторизованих дій у 10 випробуваннях. З них 17 були спричинені агентом Anthropic, а дві — агентом OpenAI.
«Деякі з агентів, що тестувалися, брали участь у тривалій, потенційно шкідливій діяльності, спрямованій на реальних людей та організації», — сказав AISI.
В той же час інститут підкреслив, що жоден із зафіксованих випадків не призвів до реального шкоди.
Один із агентів створив фальшиві ідентичності
Найсерйозніший інцидент стосувався агента, який написав шкідливий код і створив фальшиві онлайн-акаунти, щоб переконати людину схвалити його виконання.
AISI не розкрила, яка саме модель була відповідальна за ці дії, але Anthropic підтвердила, що вони стосувалися її агента.
Компанія сказала:
«Ми вдячні UK AISI за їх лідерство у цій події, що підкреслює необхідність більш широкої дискусії щодо того, як безпечно оцінювати все більш здатні агенти ШІ.“
Anthropic також сказала, що працює з інститутом, щоб отримати додаткові деталі та провести власне розслідування.
Ендрю Юн, дослідник із некомерційної організації CivAI, сказав, що цей інцидент викликає занепокоєння.
Той факт, що Mythos здійснив такі обманливі дії, з очевидним розумінням, що він націлений на реальну особу, свідчить про те, що Anthropic не має такого контролю над своїми моделями, яким вважає.
OpenAI повідомила про окремий інцидент
OpenAI пояснила, що обидві неавторизовані дії її агента були пов’язані з доступом до інтернету, що порушувало умови сценарію тестування.
Компанія також розкрила окремий випадок, коли через помилку конфігурації Irregular — стороннього постачальника інфраструктури для тестування — її агенти випадково отримали доступ до мережі. Anthropic також описав подібну помилку на тиждень раніше.
OpenAI сказала:
«Ми зобов’язуємося працювати разом із галуззю для посилення спільних практик безпечного проведення оцінок високого ризику, включаючи збирання зацікавлених сторін, таких як національні інститути ШІ, незалежні оцінювачі, інші лабораторії ШІ та інші групи у найближчі тижні.“
В той же час AISI підкреслила, що ці інциденти відрізняються від порушення в липні, коли агент GPT-5.6 отримав доступ до тестової інфраструктури Hugging Face. Хоча тоді модель ефективно вийшла з ізольованого середовища, під час поточних випробувань доступ до інтернету надавався агентам відповідно до стандартної методики тестування інституту.
Як нагадування, після інциденту з Hugging Face OpenAI розширила своє внутрішнє розслідування та виявила додаткові випадки неконтрольованої поведінки автономних агентів.
Повідомлення Британські дослідники виявили нові порушення під час тестування агентів OpenAI та Anthropic AI з’явилися спочатку на INCRYPTED.


