ChainThink thông báo, ngày 31 tháng 7, theo CNBC, Anthropic đã tiết lộ vào ngày 30 tháng 7 rằng mô hình Claude AI của họ đã vô tình truy cập vào internet thực trong quá trình đánh giá an ninh mạng và xâm nhập trái phép vào các hệ thống thực của ba tổ chức khác nhau.
Các mô hình liên quan bao gồm Opus 4.7, Mythos 5 và một mô hình thử nghiệm nghiên cứu nội bộ. Anthropic cho biết, các mô hình đã thực hiện xâm nhập thông qua các phương pháp cơ bản như truy cập vào các điểm cuối không được xác thực và tận dụng mật khẩu yếu.
Sự việc xảy ra do sự hiểu lầm trong giao tiếp giữa Anthropic và đối tác đánh giá bên thứ ba Irregular, khiến mô hình được thông báo rằng nó đang ở trong môi trường mô phỏng không có truy cập internet, nhưng thực tế vẫn có thể kết nối với internet.
Anthropic cho biết, cuộc kiểm tra này được kích hoạt bởi sự cố xâm nhập tương tự tại Hugging Face mà OpenAI đã tiết lộ tuần trước.
Hiện tại, công ty đã tạm dừng tất cả các đánh giá an ninh mạng và đang tiến hành điều tra thêm với cơ quan đánh giá AI độc lập METR.
