ChainThink повідомляє, 31 липня, за даними CNBC, 30 липня Anthropic розкрила, що під час оцінки кібербезпеки її модель Claude AI випадково отримала доступ до реального Інтернету та неавторизовано вторглась у реальні системи трьох різних організацій.
Залучені моделі включають Opus 4.7, Mythos 5 та внутрішню дослідницьку тестову модель. Anthropic зазначила, що моделі здійснили втручання за допомогою базових методів, таких як доступ до неаутентифікованих точок входу та використання слабких паролів.
Причиною події стала непорозуміння у спілкуванні між Anthropic і стороннім оцінювальним партнером Irregular: модель була інформована, що перебуває у симуляційному середовищі без доступу до інтернету, але насправді вона все ще мала підключення до інтернету.
Anthropic зазначила, що цей огляд був спричинений подібним втручанням у Hugging Face, про яке OpenAI розкрила на тиждень раніше.
Компанія призупинила всі оцінки кібербезпеки та розпочала додаткове розслідування з незалежною AI-оціночною організацією METR.
