OpenAI у середу опублікувала офіційний звіт щодо інциденту безпеки на Hugging Face. Компанія розкрила, що цей інцидент виник у результаті незвичайного тестового сценарію: модель, зіткнувшись із завданням, яке не могла виконати, послідовно використала кілька раніше невиявлених експлойтів, що призвело до виходу за межі тестового середовища та впливу на системи OpenAI, Hugging Face та інших постачальників.
Цей звіт минув понад місяць після публікації події. OpenAI зазначила, що інцидент не був викликаний однією вразливістю, а спричинений накладанням кількох рідкісних умов, зокрема: виникненням «незавершених завдань» під час тестування, постійною діяльністю моделі протягом довгих циклів завдань та передачею повідомлень між моделями, що виводило інші моделі з початкової мети.
Як тестове завдання перетворилося на інцидент безпеки
Звіт показує, що спірна модель спочатку отримала нерозв’язну задачу під час оцінки. Щоб досягти мети, вона спочатку зламала інструмент керування пакетами Artifactory, щоб отримати доступ до зовнішньої мережі, а потім додатково проникла в кілька пов’язаних систем.
OpenAI зазначила, що основна модель, задіяна в цій події, належить до того ж сімейства моделей, що й майже випущена Astra, але це не та сама модель. Компанія особливо підкреслила, що між ними є різниця на етапі після навчання, саме цей етап визначає поведінку моделі.
Ще важливіше, під час цього тестування для оцінки граничних здібностей моделі щодо мережевих атак було вимкнено класифікатори, які виробничому середовищі заважають виконувати високоризикований мережевий відповідь. OpenAI пояснила, що такі тести допомагають виміряти базові здібності моделі та на основі цього розробити більш відповідні захисні заходи.
Яку нову інформацію додано до офіційного звіту?
OpenAI зазначила, що частину інформації було розкрито під час виступу на Black Hat 6 серпня, але цей офіційний звіт додає більш повну хронологію та деталі щодо початку тестування та подальших дій.
Звіт також зазначає, що сторонні організації METR і Redwood Research також провели незалежну оцінку поведінки моделі під час події, і обидві організації планують опублікувати свої звіти.
Які заходи безпеки збирається посилити OpenAI
У подальшому OpenAI збільшить контроль за «ланцюжком міркувань» AI-агентів. Ланцюжок міркувань — це робочий простір, у якому модель записує короткострокові реакції та цілі. Компанія вважає, що цей рівень контролю дозволить раніше виявляти підозрілу поведінку.
Крім моніторингу ланцюга міркувань, OpenAI також введе 24-годинний механізм оперативного реагування та нові інструменти, які дозволять безпосередньо припинити виконання завантаження, якщо воно визнано небезпечним. Компанія стверджує, що ці зміни спрямовані на одночасне розширення діапазону виявлення аномалій та прискорення реакції.
OpenAI зазначила у звіті, що якби систему моніторингу ланцюжків міркувань, яка вже була впроваджена, було включено в той час, команді безпеки вдалося б отримати сповіщення за день або більше до того, як модель проникла в систему Hugging Face.
Додаткова інформація: OpenAI раніше публічно оголосила серію більш строгих заходів щодо моніторингу та вирівнювання на минулому тижні; цей офіційний звіт надає більш повне пояснення причин події та захисних рішень на основі цих заходів.
