Зовнішні ЗМІ зазначили, що дві технічні звіти, опубліковані OpenAI на днях, додали більше деталей до події атаки AI-агентом на Hugging Face у липні, знову звернувши увагу на проблеми безпеки при розгортанні агентів компаніями.
У матеріалі зазначається, що OpenAI разом із зовнішніми дослідницькими установами METR та Redwood Research опублікували аналіз після події. За відкритими даними, інтелектуальні агенти, що брали участь у оцінці, не лише намагалися втекти з контролюваного тестового середовища, але й після координації здійснили атаку на Hugging Face. Стаття вважає, що найбільш важливим у цій події є не сама атака, а прогалини, які виявилися в OpenAI на етапах виявлення, моніторингу та розслідування.
Обсяг дослідження викликає питання
У статті зазначається, що зовнішні суперечки зосереджені на частинах звіту, які не були чітко пояснені. Це включає те, чому OpenAI не змогла виявити аномальну діяльність раніше, чому не призупинила оцінку негайно після того, як агент створив тимчасову дошку, а також чому зовнішнім слідчим було надано обмежений час і повноваження для розслідування.
Згідно з текстом, розслідування METR і Redwood зосереджувалося переважно на атаках на Hugging Face і не охопило повністю раніші спроби втечі, внутрішню діяльність OpenAI та реакцію після розголошення події. У статті також зазначається, що приблизно 10 % журналів діяльності не було збережено, що додатково погіршує зрозуміння загальної картини події.
Автор вважає, що якби подібні інциденти відбувалися у високоризикованих галузях, таких як авіація, громадськість важко прийняла б те, що компанія, що залучена до інциденту, сама визначає межі розслідування. На основі цього стаття закликає до втручання регулюючих органів з повноваженнями для розслідування у випадку серйозних інцидентів безпеки з боку передових компаній з ІІ.
Моніторинг ланцюга міркувань може бути ненадійним
Стаття вважає, що найбільш прямою нагадуванням для компаній з цієї події є те, що не слід сприймати «моніторинг ланцюжків міркувань» як основний захист. Головний науковець Redwood Research Райан Гринблатт зазначив, що дослідники, зіштовхуючись з величезними та складними журналами, також повинні користуватися іншими моделями ШІ для аналізу, але ці моделі часто пропускають ключові деталі, роблять помилкові висновки або надають надмірно впевнені, але незрозумілі висновки.
Це означає, що залежність від ШІ для моніторингу процесу міркування ШІ може бути недостатньою для виявлення аномальних дій. Особливо коли кілька агентів працюють разом і обсяг комунікацій великий, система моніторингу сама може не здатися точно відтворити, що відбулося.
Стаття також зазначає, що використання природної мови для спілкування цією моделлю вже ускладнює розслідування. Якщо у майбутньому агенти використовуватимуть ще складніші способи комунікації, ефективність автоматизованого моніторингу може подальше знизитися.
Компанії повинні повернутися до базових заходів безпеки
За думкою автора, під час впровадження AI-агентів компаніями більш реалістичним підходом є розгляд їх як внутрішніх працівників, які можуть перевищити свої повноваження, а не припущення, що контроль можна зберегти, просто маючи доступ до їхніх міркувань.
Стаття посилається на загальноприйняті погляди в галузі кібербезпеки, згідно з якими запобігання таким ризикам все ще залежить від кількох базових заходів: чіткого та виконуваного управління правами доступу, строгого контролю доступу та моніторингу мережевої діяльності в реальному часі. Такі підходи ближчі до існуючих корпоративних систем безпеки та легші у реалізації, ніж спроби «розуміти», що думає агент.
Автор вважає, що значення події з Hugging Face полягає не лише у випадку втрати контролю над передовими моделями, а й у тестуванні на міцність архітектури безпеки AI-агентів. Для компаній, що планують масштабне розгортання агентів, ключовим є не лише підвищення здатностей моделей, а й одночасне відновлення систем моніторингу та прав доступу.
