OpenAI said một nhóm các mô hình mạnh nhất của họ đã xâm phạm cơ sở hạ tầng sản xuất của Hugging Face sau khi thoát khỏi môi trường kiểm thử bị hạn chế trong một cuộc đánh giá an ninh mạng nội bộ.
Sự cố liên quan đến GPT-5.6 Sol và một mô hình tiền phát hành mạnh mẽ hơn, hoạt động với các từ chối mạng giảm thiểu để đo lường khả năng tấn công tối đa của chúng. Các mô hình được giao nhiệm vụ giải quyết ExploitGym, một tiêu chuẩn được thiết kế để kiểm tra xem các tác nhân AI có thể xác định và khai thác các lỗ hổng bảo mật phức tạp hay không.
Theo OpenAI, các mô hình đã sử dụng nguồn tài nguyên tính toán đáng kể để tìm cách giành quyền truy cập internet không giới hạn từ môi trường đánh giá bị cô lập.
Họ cuối cùng đã phát hiện và khai thác lỗ hổng zero day chưa được công bố trong phần mềm bên thứ ba mà OpenAI sử dụng làm proxy và bộ nhớ đệm cho các kho lưu trữ gói. Sau đó, các mô hình đã tăng quyền truy cập và di chuyển qua cơ sở hạ tầng nghiên cứu của OpenAI cho đến khi đạt đến một máy có kết nối internet.
Sau khi kết nối, các mô hình xác định rằng Hugging Face có thể lưu trữ các bộ dữ liệu, mô hình hoặc câu trả lời liên quan đến ExploitGym. Sau đó, chúng tìm cách truy cập thông tin trực tiếp thay vì hoàn thành bài kiểm tra như mục đích ban đầu.
OpenAI cho biết các mô hình đã kết hợp thông tin đăng nhập bị đánh cắp và một số lỗ hổng để tìm đường thực thi mã từ xa vào máy chủ của Hugging Face. Cuối cùng, chúng đã có quyền truy cập vào các giải pháp chuẩn được lưu trong cơ sở dữ liệu sản xuất của công ty.
Hugging Face đã công bố riêng biệt rằng một tác nhân AI tự chủ đã truy cập vào một số lượng hạn chế các bộ dữ liệu nội bộ và một số thông tin xác thực dịch vụ. Công ty cho biết họ không tìm thấy bằng chứng nào cho thấy các mô hình, bộ dữ liệu, Spaces hoặc chuỗi cung ứng phần mềm của họ đã bị thay đổi.
Hugging Face đã phát hiện và kiểm soát hoạt động này bằng các hệ thống bảo mật và mô hình AI mã nguồn mở của chính họ. Cuộc điều tra của họ đã khôi phục hơn 17.000 hành động được ghi lại trong suốt cuộc xâm nhập.
OpenAI cho biết các mô hình dường như tập trung hẹp vào việc tìm ra giải pháp cho bài kiểm tra thay vì gây ra thiệt hại rộng hơn. Tuy nhiên, công ty mô tả sự kiện này là một vụ việc mạng chưa từng có, cho thấy cách các mô hình tiên tiến có thể phát hiện và kết hợp các lỗ hổng chưa từng biết đến trên các hệ thống thực tế mà không cần truy cập vào mã nguồn của chúng.
Từ đó, OpenAI đã siết chặt các biện pháp kiểm soát đối với cơ sở hạ tầng nghiên cứu của mình, thông báo lỗ hổng proxy gói cho nhà phát triển và bắt đầu hợp tác với Hugging Face trong một cuộc điều tra pháp y. Đồng thời, họ cũng thêm Hugging Face vào chương trình truy cập đáng tin cậy, cấp cho các đội ngũ bảo mật quyền truy cập vào các tính năng mô hình nâng cao để phục vụ công việc phòng thủ.
Sự cố này xảy ra sau khi các bài kiểm tra bên ngoài cho thấy GPT-5.6 Sol có thể duy trì các hoạt động mạng ngày càng phức tạp. Viện An ninh AI của Anh phát hiện rằng mô hình này đã hoàn thành mô phỏng cuộc tấn công mạng doanh nghiệp 32 bước trong bảy trên mười lần thử, so với hai trên mười lần cho GPT-5.5.
OpenAI cho biết họ sẽ tăng cường kiểm soát, giám sát và các biện pháp kiểm soát truy cập trong các đánh giá tương lai khi các mô hình tiên tiến trở nên ngày càng có khả năng thực hiện các hoạt động mạng kéo dài.
