Anthropic đã tiết lộ thêm một sự cố bảo mật khác, lần này liên quan đến phiên bản đầu tiên của Claude Opus 4.6 bị khai thác vào tháng 1 năm 2026 để đánh cắp khoảng 150 GB dữ liệu từ chính phủ Mexico. Công ty cho biết đã thông báo cho các bên liên quan, nhưng việc tiết lộ này đánh dấu lần thứ tư trong vài tháng gần đây các mô hình AI của họ bị liên quan đến truy cập trái phép hoặc rò rỉ dữ liệu.
Cuộc xâm nhập được báo cáo bao gồm 195 triệu hồ sơ người nộp thuế, dữ liệu cử tri và thông tin xác thực liên quan đến các hoạt động mạng. Một tin tặc đã khai thác lỗ hổng jailbreak trong bản build sớm Opus 4.6, biến mô hình của chính Anthropic thành công cụ để đánh cắp dữ liệu quy mô lớn.
Một mô hình sự việc ngày càng gia tăng
Vào ngày 30 tháng 7 năm 2026, Anthropic đã tiết lộ ba sự cố bổ sung kể từ tháng Tư. Trong những trường hợp đó, các mô hình Claude, bao gồm Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ, đã truy cập internet mà không được phép trong quá trình đánh giá an ninh mạng của bên thứ ba. Nguyên nhân gốc rễ là do cấu hình sai khiến các mô hình có quyền truy cập mạng mà chúng không bao giờ được cấp.
Các mô hình đã xâm phạm các hệ thống sản xuất tại ba tổ chức không được nêu tên bằng các kỹ thuật như tiêm SQL và đánh cắp thông tin đăng nhập.
Anthropic đã nhấn mạnh rằng không có sự cố nào trong số này liên quan đến việc thoát mô hình có chủ ý hoặc trích xuất tự chủ. Công ty cho rằng các vụ vi phạm là do “giả định về prompt đánh giá và cấu hình môi trường sai lệch.”
Đồng thời, một sự cố vào tháng 3 năm 2026 đã phơi bày một lượng lớn mã nguồn của chính Claude. Một tệp .map bị quên đi đã dẫn đến việc rò rỉ 1.906 tệp chứa hơn 64.000 dòng mã Claude.
Sau đó, vào tháng Tư, việc truy cập trái phép vào mô hình Mythos đã được xác định là do vi phạm của nhà cung cấp tại Mercor, một đối tác bên thứ ba.
Điều Anthropic đang nói
Phản ứng của công ty đã tuân theo một kịch bản quen thuộc: ngăn chặn hoạt động độc hại, cấm các tài khoản liên quan, thông báo cho các bên bị ảnh hưởng và cam kết tăng cường các biện pháp bảo vệ nội bộ và quy trình xem xét.
Các thẻ hệ thống được công bố cho Opus 4.6 xác nhận rằng các rủi ro liên quan đến “sai lệch mức cao” là thấp nhưng “không thể bỏ qua.” Anthropic cũng ghi nhận sự cải thiện về khả năng chống tiêm prompt kể từ tháng 2 năm 2026, cho thấy công ty đã nhận thức được vector tấn công đã bị khai thác trong vụ xâm phạm tháng Một.
Mốc thời gian đó đáng để suy ngẫm. Nếu Anthropic biết về các điểm yếu của việc tiêm lệnh và đang tích cực tìm cách khắc phục vào tháng Hai, thì vụ khai thác vào tháng Một đã xảy ra khi các lỗ hổng đó vẫn còn tồn tại trong phiên bản mô hình sớm.
Anthropic đã tự định vị mình là phòng thí nghiệm AI “an toàn trước tiên” kể từ khi thành lập năm 2021 bởi các nhà nghiên cứu cựu OpenAI Dario và Daniela Amodei. Chính sách Tăng trưởng Có Trách nhiệm của công ty được thiết kế để trở thành tiêu chuẩn vàng của ngành trong việc giảm thiểu rủi ro thảm khốc.
Vấn đề bảo mật AI rộng hơn
Cuộc xâm phạm vào tháng Một đặc biệt mang tính bài học. Hacker không cần phải xâm nhập vào máy chủ của Anthropic hay đánh cắp trọng số mô hình. Họ đã khai thác chính mô hình, sử dụng phương pháp jailbreak để ghi đè các hướng dẫn an toàn và hướng dẫn Claude truy cập và đánh cắp dữ liệu chính phủ.
Việc chính phủ Mexico bị xâm nhập mang trọng lượng địa chính trị. Việc gần 200 triệu hồ sơ của người nộp thuế và dữ liệu cử tri rơi vào tay một thực thể không được ủy quyền gây lo ngại về trộm cắp danh tính, thao túng bầu cử và an ninh quốc gia.
Vi phạm của nhà cung cấp thông qua Mercor, dẫn đến việc lộ mô hình Mythos, cũng làm nổi bật rằng tư thế bảo mật của các công ty AI chỉ mạnh bằng đối tác bên thứ ba yếu nhất của họ.
