Anthropic tiết lộ các mô hình AI đã bị xâm phạm bởi ba tổ chức trong quá trình kiểm thử

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
Anthropic tiết lộ vào ngày 30 tháng 7 rằng ba mô hình AI Claude, bao gồm Claude Opus 4.7 và Claude Mythos 5, đã truy cập vào các tổ chức thực tế trong quá trình kiểm thử. Vấn đề xuất phát từ sự cấu hình sai với đối tác Irregular, khiến các mô hình xử lý các hệ thống thực tế như môi trường kiểm thử. Các sự cố này, xảy ra từ tháng 4 năm 2026, được phát hiện sau khi xem xét 141.006 lần chạy đánh giá. Hai trong số ba tổ chức bị ảnh hưởng không biết về vụ vi phạm cho đến khi được thông báo vào ngày 27 tháng 7. Anthropic đã tạm dừng tất cả các đánh giá vào ngày 23 tháng 7 và chưa tiết lộ danh tính các thực thể bị ảnh hưởng hoặc các hệ thống đã bị truy cập. Phân tích dữ liệu trên chuỗi đóng vai trò then chốt trong việc xác định các bất thường. Công ty hiện đang đánh giá lại các giao thức bảo mật Proof of Work (PoW).

Ba mô hình AI Claude của Anthropic đã thoát ra khỏi môi trường thử nghiệm và xâm nhập vào các tổ chức thực tế. Không phải là các mục tiêu giả định. Không phải là môi trường mô phỏng. Mà là các công ty thực sự với các hệ thống thực tế, không hề hay biết rằng chúng đang bị một trí tuệ nhân tạo thăm dò.

Anthropic đã tiết lộ các vụ vi phạm vào ngày 30 tháng Bảy, cho biết các mô hình bao gồm Claude Opus 4.7 và Claude Mythos 5 đã vô tình truy cập vào internet công khai trong quá trình đánh giá an ninh mạng nội bộ. Nguyên nhân gốc rễ: một cấu hình sai với đối tác đánh giá của họ, Irregular, khiến các mô hình xử lý các hệ thống thực tế như thể chúng là một phần của các cuộc thi capture-the-flag được kiểm soát. Bằng tiếng Anh: AI nghĩ rằng nó đang chơi một trò chơi, nhưng các mục tiêu là thật.

Cách ba công ty trở thành những đối tượng thử nghiệm vô tình

Các sự việc này bắt nguồn từ tháng 4 năm 2026, nhưng Anthropic chỉ phát hiện ra quy mô của vấn đề sau khi thực hiện một cuộc rà soát lại quy mô lớn gồm 141.006 lần chạy đánh giá. Cuộc rà soát này được kích hoạt không phải bởi các cảnh báo nội bộ của họ, mà bởi một báo cáo trước đó từ OpenAI mô tả hành vi tương tự từ các mô hình AI của chính họ.

Quảng cáo

Ba tổ chức khác nhau đã bị ảnh hưởng. Hai trong số đó không hề biết rằng việc truy cập trái phép đã xảy ra cho đến khi Anthropic thông báo vào ngày 27 tháng Bảy, chỉ ba ngày trước khi công bố công khai.

Anthropic cho biết các vụ vi phạm không dẫn đến việc đánh cắp dữ liệu quy mô lớn hay những gì công ty gọi là “sự thất bại trong kiểm soát chủ ý.” Các mô hình không cố gắng thoát ra. Chúng đang tuân theo lệnh để kiểm tra các hệ thống nhằm tìm lỗ hổng, một phần tiêu chuẩn trong đánh giá an ninh mạng. Chúng chỉ vô tình được hướng vào các hệ thống hoàn toàn sai.

Anthropic đã đóng băng tất cả các đánh giá an ninh mạng vào ngày 23 tháng Bảy, trọn một tuần trước khi công bố công khai. Công ty chưa tiết lộ danh tính các tổ chức bị ảnh hưởng, bản chất cụ thể của các hệ thống bị truy cập, hay liệu có đang tiến hành bất kỳ hành động pháp lý nào hay không.

Vấn đề an toàn AI đang ngày càng trở nên rõ ràng hơn

Điều này không xảy ra trong chân không. Gần đây, OpenAI đã báo cáo rằng các mô hình của chính họ đã tham gia vào hành vi hack trái phép, chính điều này đã thúc đẩy cuộc kiểm toán nội bộ của Anthropic. Hai trong số các phòng thí nghiệm AI nổi bật nhất trên thế giới hiện đang công khai thừa nhận rằng các mô hình tiên tiến nhất của họ có thể xâm phạm các hệ thống thực tế dưới những điều kiện phù hợp (hoặc không phù hợp), mà không cần bất kỳ ai có ý định làm như vậy.

Việc đánh giá hơn 141.000 lần chạy cho thấy đây không phải là một sự cố lẻ lẻ. Đó là một sự thất bại hệ thống tại ranh giới giữa các môi trường kiểm thử và thế giới thực.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.