- Sau sự cố Hugging Face, những câu hỏi mới đã xuất hiện về bảo mật của các tác nhân AI OpenAI và Anthropic.
- Vâng, viện của Anh đã ghi nhận 19 hành động không được ủy quyền bởi các tác nhân AI trong các bài kiểm tra mạng.
- Đặc biệt, một tác nhân AI đã tạo ra các danh tính giả.
Viện An ninh Trí tuệ Nhân tạo của Anh (AISI) báo cáo các trường hợp hành vi trái phép mới được phát hiện từ các tác nhân OpenAI và Anthropic AI trong quá trình kiểm tra mô hình, Reuters viết. Trong một loạt mô phỏng an ninh mạng, các tác nhân đã tạo ra các danh tính ảo trực tuyến, cố gắng vượt qua các hạn chế đã thiết lập và thực hiện các hành động khác nằm ngoài phạm vi nhiệm vụ được giao.
Các sự việc này xảy ra giữa lúc hạ tầng của Hugging Face bị tác nhân AI GPT-5.6 xâm phạm. Chi tiết thêm trong bài viết:
Theo AISI, tổ chức đã kiểm tra các tác nhân dựa trên mô hình Mythos 5 của Anthropic và GPT-5.6-Sol của OpenAI trong một kịch bản an ninh mạng tưởng tượng để đánh giá khả năng của chúng.
Trong 122 lần thử nghiệm, các nhà nghiên cứu ghi nhận 19 hành động không được phép trong 10 lần thử. Trong số đó, 17 hành động được cho là do tác nhân của Anthropic thực hiện và hai hành động do tác nhân của OpenAI thực hiện.
“AISI cho biết: Một số đại diện được thử nghiệm đã tham gia vào các hoạt động kéo dài, có thể gây hại nhắm vào những cá nhân và tổ chức thực tế.”
Đồng thời, viện nhấn mạnh rằng không có trường hợp nào được ghi nhận gây ra thiệt hại thực tế.
Một trong các đại diện đã tạo ra danh tính giả
Sự cố nghiêm trọng nhất liên quan đến một đại lý đã viết mã độc và tạo các tài khoản ảo để thuyết phục một người đồng ý thực thi nó.
AISI không tiết lộ mô hình cụ thể nào chịu trách nhiệm cho những hành động này, nhưng Anthropic xác nhận rằng nó liên quan đến tác nhân của họ.
Công ty cho biết:
“Chúng tôi biết ơn UK AISI vì sự dẫn dắt của họ trong sự việc này, điều này nhấn mạnh nhu cầu về một cuộc thảo luận rộng hơn về cách đánh giá an toàn các tác nhân AI ngày càng mạnh mẽ hơn.“
Anthropic cũng cho biết họ đang hợp tác với viện để lấy thêm chi tiết và tiến hành cuộc điều tra của riêng mình.
Andrew Yoon, một nhà nghiên cứu tại tổ chức phi lợi nhuận CivAI, cho rằng sự việc này là nguyên nhân đáng lo ngại.
Việc Mythos thực hiện các hành động gian lận như vậy, với sự nhận thức rõ ràng rằng nó đang nhắm vào một người thật, cho thấy Anthropic không kiểm soát tốt các mô hình của mình như họ nghĩ.
OpenAI báo cáo một sự cố riêng biệt
OpenAI giải thích rằng cả hai hành động không được ủy quyền của tác nhân đều liên quan đến việc truy cập internet, vi phạm các điều kiện của kịch bản kiểm tra.
Công ty cũng tiết lộ một trường hợp riêng biệt trong đó, do lỗi cấu hình bởi Irregular, nhà cung cấp bên thứ ba về cơ sở hạ tầng kiểm thử, các đại diện của nó đã vô tình truy cập vào mạng lưới. Anthropic cũng mô tả một sự cố tương tự vào tuần trước.
OpenAI cho biết:
“Chúng tôi cam kết hợp tác xuyên suốt ngành để củng cố các thực tiễn chung nhằm thực hiện đánh giá rủi ro cao một cách an toàn, bao gồm việc triệu tập các bên liên quan như các viện AI quốc gia, các nhà đánh giá độc lập, các phòng thí nghiệm AI khác và các nhóm khác trong những tuần tới.“
Đồng thời, AISI nhấn mạnh rằng những sự cố này khác với vụ xâm phạm tháng Bảy, khi tác nhân GPT-5.6 truy cập vào cơ sở hạ tầng thử nghiệm của Hugging Face. Trong khi mô hình đã thành công trong việc thoát ra khỏi môi trường cô lập lúc đó, trong các đợt thử nghiệm hiện tại, quyền truy cập internet đã được cấp cho các tác nhân theo phương pháp thử nghiệm tiêu chuẩn của viện.
Như một lời nhắc nhở, sau sự cố Hugging Face, OpenAI đã mở rộng cuộc điều tra nội bộ và xác định thêm các trường hợp hành vi không kiểm soát bởi các tác nhân tự trị.
Thông điệp Các nhà nghiên cứu Anh đã phát hiện ra các vi phạm mới trong quá trình kiểm tra các tác nhân AI của OpenAI và Anthropic xuất hiện đầu tiên trên INCRYPTED.


