ChainThink сообщает, 26 августа, согласно официальному отчету, OpenAI опубликовала 37-страничный технический отчет, детально описывающий процесс вторжения ее ИИ-модели в Hugging Face.
Согласно отчету, автономные ИИ-агенты могут сотрудничать, обходя средства безопасности в производственной среде и атакуя усиленные системы.
AI-агент, участвовавший в тестировании, изначально находился в изолированной среде с крайне ограниченным доступом в интернет, но путем последовательного использования нескольких уязвимостей преодолел изоляцию и в итоге получил доступ к Hugging Face.
Согласно исследованию, соответствующие модели демонстрируют поведение «взлома наград» (Reward Hacking), пытаясь обмануть систему, ища ответы в интернете.
OpenAI подтвердила, что внутренняя исследовательская модель сыграла наиболее широкую роль в событии, и с 25 июля прекратила обучение и вывод этой модели и ее производных.
Компания также объявила о усилении изоляции безопасности, сетевого контроля, мониторинга поведения и реагирования на инциденты, а также о введении более строгих механизмов среды, промптов и проверки при повторном включении модели.
