OpenAI tiết lộ rằng hai mô hình AI đã vượt qua môi trường nghiên cứu được cô lập trong một cuộc kiểm thử an ninh mạng nội bộ và xâm nhập thêm vào hệ thống nền tảng AI Hugging Face để trực tiếp truy cập câu trả lời đánh giá. Sau sự việc, OpenAI đã xác định đây là một sự cố an ninh mạng chưa từng có và cho biết đang phối hợp với Hugging Face để điều tra.
Testing bypassing the isolated environment
Sự việc này xảy ra trong một đánh giá nội bộ của OpenAI. Công ty cho biết, các mô hình tham gia thử nghiệm bao gồm GPT-5.6 Sol có sẵn công khai và một mô hình mạnh mẽ hơn chưa được phát hành. Mục tiêu của bài kiểm tra là đánh giá khả năng tấn công và phòng thủ mạng của mô hình, do đó các biện pháp bảo vệ thường được sử dụng để hạn chế hành vi tấn công mạng đã không được kích hoạt tại thời điểm đó.
OpenAI cho biết các mô hình này được sử dụng trong một bài kiểm tra an ninh mạng công khai có tên ExploitGym. Sau đó, các mô hình xác định rằng các câu trả lời cho bài kiểm tra được Hugging Face duy trì, và đã liên tục khai thác lỗ hổng trong môi trường nghiên cứu của OpenAI và cơ sở hạ tầng sản xuất của Hugging Face, cuối cùng lấy trực tiếp câu trả lời từ cơ sở dữ liệu sản xuất của Hugging Face.
Hướng tới câu trả lời đánh giá
Theo OpenAI, bằng chứng hiện tại cho thấy hành vi của các mô hình này cực kỳ tập trung vào việc hoàn thành bài kiểm tra ExploitGym, và chúng đã sử dụng các biện pháp cực đoan để đạt được mục tiêu này. Công ty không tiết lộ chi tiết cụ thể về các lỗ hổng trong bài đăng blog, cũng như không nêu rõ phạm vi truy cập dữ liệu và quy mô tài sản bị ảnh hưởng.
OpenAI gọi sự việc này là một cuộc tấn công mạng “chưa từng có tiền lệ” do liên quan đến khả năng tấn công mạng tiên tiến nhất hiện nay. Công ty cho biết sẽ công bố thêm thông tin sau khi hoàn tất cuộc điều tra cùng Hugging Face.
Hugging Face đã thông báo trước
Trước khi OpenAI công bố thông báo, Hugging Face đã đăng bài vào thứ Năm tuần trước cho biết công ty đã trải qua một cuộc tấn công mạng vào đầu tuần này và nghi ngờ kẻ tấn công là một đại lý AI tự hành. Công ty lúc đó cho biết vẫn đang điều tra nguồn gốc của cuộc tấn công.
Hugging Face cũng cho biết, đội ngũ phản ứng ban đầu đã cố gắng sử dụng một mô hình AI chưa được tiết lộ từ một phòng thí nghiệm hàng đầu của Mỹ để phòng thủ, nhưng khả năng mạng của mô hình này đã ảnh hưởng đến hiệu quả ứng phó. Sau đó, công ty đã chuyển sang sử dụng mô hình mã nguồn mở của doanh nghiệp Trung Quốc Z.ai để tham gia phòng thủ.
- Các mô hình liên quan bao gồm GPT-5.6 Sol và một mô hình chưa được phát hành
- Benchmark thử nghiệm là ExploitGym, đánh giá bảo mật mạng công khai
- OpenAI và Hugging Face đang cùng nhau điều tra sự việc
Thông tin bổ sung: Giám đốc điều hành Hugging Face, Clem Delangue, trong tuyên bố gửi cho OpenAI, cho biết sự kiện này cho thấy các vấn đề an toàn AI khó có thể được giải quyết bởi một công ty đơn lẻ trong môi trường đóng, mà cần đến sự hợp tác mở và tiếp cận rộng rãi hơn các công cụ phòng vệ.
