Các chuyên gia an ninh mạng đã phát hiện ra những lỗ hổng nghiêm trọng trong các mô hình của cả Anthropic và OpenAI, với những hệ quả hiện đã lan đến cấp cao nhất của chính phủ Mỹ.
Một báo cáo từ FAR.AI đã kiểm tra nhiều mô hình tiên tiến, bao gồm Claude Opus 4.8 của Anthropic, Fable 5 và GPT 5.5, GPT 5.6 của OpenAI, và phát hiện chúng dễ bị tấn công bằng các phương pháp thoát khỏi giới hạn nhằm trích xuất các đầu ra thực sự nguy hiểm, bao gồm mã khai thác, thông tin về vũ khí hóa học và chi tiết về vũ khí sinh học.
Con số kể một câu chuyện đáng báo động
Các mô hình của Anthropic và OpenAI không phải là những mô hình hiệu suất kém nhất. Danh hiệu này thuộc về các mô hình Grok của xAI, ghi nhận 448 trường hợp bẻ khóa tự động thành công. Các mô hình Gemini của Google đứng thứ hai với 249 trường hợp. Các mô hình Claude, Fable và GPT thể hiện khả năng chống lại việc bẻ khóa cao hơn đáng kể.
Vào tháng 6 năm 2026, Bộ Thương mại đã hạn chế quyền truy cập của nước ngoài vào các mô hình Fable 5 và Mythos 5 của Anthropic sau khi một kỹ thuật jailbreak được báo cáo xuất hiện. Nhà Trắng cũng đã yêu cầu cả OpenAI và Anthropic hoãn việc phát hành một số mô hình sắp tới để chính phủ có thể đánh giá đầy đủ các rủi ro an ninh mạng.
Việc khai thác có liên quan đến Trung Quốc làm tăng tính cấp bách
Các báo cáo cho thấy các thực thể liên quan đến Trung Quốc đã khai thác các mô hình của Anthropic để tự động hóa các cuộc tấn công mạng nhắm vào hơn 30 mục tiêu. Kỹ thuật này bao gồm các prompt được thiết kế để vượt qua các hàng rào bảo vệ hiện có.
Chính phủ Hoa Kỳ đã nêu rõ những rủi ro an ninh quốc gia này, chỉ ra khả năng các mô hình AI tạo ra các lỗ hổng phần mềm và thông tin liên quan đến vũ khí khi các biện pháp bảo vệ của chúng bị vượt quá. Phản ứng của Anthropic là gắn nhãn các lỗ hổng này là “hẹp”, cho rằng chúng đại diện cho các trường hợp ngoại lệ thay vì sự thất bại hệ thống.
Điều này có nghĩa gì đối với các nhà đầu tư và thị trường AI
Các biện pháp kiểm soát xuất khẩu, sự trì hoãn phát hành bắt buộc và sự chỉ trích công khai từ chính phủ đại diện cho một môi trường hoạt động hoàn toàn khác biệt đối với các công ty AI tiên tiến. An ninh đang trở thành điều kiện tiên quyết để được phép triển khai các mô hình, dẫn trực tiếp đến chi phí vận hành cao hơn, thời gian phát triển kéo dài hơn và tiềm ẩn thị trường mục tiêu nhỏ hơn nếu một số mô hình không thể được bán ra quốc tế.
Số lượng bẻ khóa đáng kể kém hơn của Grok — 448 trường hợp so với các con số thấp hơn đáng kể của Claude và các biến thể GPT — cho thấy xAI có thể đối mặt với những trở ngại pháp lý lớn hơn. Gemini của Google với 249 trường hợp nằm ở vị trí trung gian không thoải mái.
Các mô hình AI ngày càng được tích hợp vào các hệ thống giao dịch, kiểm toán hợp đồng thông minh và hạ tầng DeFi. Một mô hình AI bị jailbreak được nhúng vào công cụ tài chính đại diện cho một vectơ rủi ro hệ thống có thể lan truyền qua các thị trường kỹ thuật số kết nối theo những cách mà các nhà quản lý mới chỉ bắt đầu hiểu được.
