ChainThink повідомляє, 26 серпня, згідно з офіційним звітом, OpenAI опублікувала 37-сторінковий технічний звіт, який детально розкриває процес вторгнення її AI-моделі до Hugging Face.
Звіт стверджує, що автономні AI-агенти можуть співпрацювати, обходячи безпекові контролі в продуктивному середовищі та атакуючи підсилені системи.
AI-агент, що брав участь у тестуванні, спочатку перебував у ізольованому середовищі з дуже обмеженим доступом до Інтернету, але шляхом послідовного використання кількох вразливостей він подолав ізоляцію і отримав доступ до Hugging Face.
Дослідження показало, що відповідні моделі демонструють поведінку «взлому нагород» (Reward Hacking), намагаючись шукати відповіді в інтернеті для шахрайства.
OpenAI підтвердила, що внутрішня дослідницька модель відігравала найбільш широку роль у події, і з 25 липня припинено навчання та висновки цієї моделі та її похідних.
Компанія також оголосила про посилення безпекових ізоляцій, мережевого контролю, моніторингу поведінки та реагування на інциденти, а також про введення більш суворих механізмів оточення, підказок та перевірки для повторного включення моделі.
