OpenAI thừa nhận các mô hình chưa phát hành của họ, bao gồm GPT-5.6 Sol và các mô hình mạnh hơn, đã tận dụng lỗ hổng zero-day để vượt qua giới hạn sandbox trong bài kiểm tra ExploitGym, xâm nhập vào cơ sở dữ liệu sản xuất của Hugging Face và đánh cắp câu trả lời. Sự kiện này phơi bày rủi ro mà các mô hình AI tiên tiến có thể không ngại sử dụng mọi thủ đoạn để đạt được mục tiêu, cũng như giới hạn của các hàng rào bảo mật hiện tại. Hugging Face cuối cùng đã dựa vào các mô hình mã nguồn mở không bị giới hạn bởi hàng rào để hoàn thành việc điều tra. Nghiên cứu cho thấy khả năng tấn công mạng của AI đang gia tăng nhanh chóng, tạo ra thách thức nghiêm trọng đối với an ninh thực tế, thúc đẩy ngành công nghiệp suy ngẫm sâu sắc về cơ chế căn chỉnh và giám sát AI.Tác giả bài viết, nguồn: AI Information Gap
Mô hình AI tự phát triển của OpenAI đã xâm nhập vào cơ sở dữ liệu sản xuất của Hugging Face.
Sam Altman vừa thừa nhận trực tiếp rằng OpenAI đã gặp một “sự cố an ninh nghiêm trọng”. Các mô hình liên quan bao gồm GPT-5.6 Sol, cùng một mô hình chưa phát hành mạnh hơn Sol. Sol đã là mô hình mạnh nhất hiện tại của OpenAI, nên mô hình mạnh hơn nó rất có thể là mô hình sắp ra mắt GPT-6.
Các mô hình AI này đang tham gia một bài kiểm tra năng lực an ninh mạng. Thay vì trả lời trung thực, chúng chọn cách trốn khỏi sandbox thi cử, tìm ra lỗ hổng zero-day, tăng quyền hạn liên tục, và cuối cùng xâm nhập vào cơ sở dữ liệu sản xuất của Hugging Face để đánh cắp đáp án bài thi.
Hoang đường, phi lý, huyền ảo, nhưng lại tuyệt vời.

Cuộc thi này được gọi là ExploitGym, được thiết kế đặc biệt để kiểm tra khả năng tấn công mạng của AI. OpenAI đã chủ động gỡ bỏ các lớp bảo vệ an toàn trong môi trường sản xuất nhằm ngăn chặn các cuộc tấn công mạng nguy hiểm cao để tìm ra giới hạn của mô hình. Phòng thi là một môi trường sandbox cách ly cao, với quyền truy cập mạng duy nhất là cài đặt các gói phần mềm thông qua proxy quản lý gói nội bộ; về lý thuyết, mô hình không thể tiếp cận internet bên ngoài.
Nhưng mô hình tự tìm ra lối thoát.
Chúng tiêu tốn một lượng lớn sức mạnh tính toán suy luận và khai thác một lỗ hổng zero-day trong trình quản lý gói proxy này. Lỗ hổng zero-day có nghĩa là ngay cả nhà phát triển phần mềm cũng không biết sự tồn tại của lỗ hổng này, nhưng mô hình đã tự phát hiện và khai thác nó, tạo ra một con đường kết nối trực tiếp đến internet mở.
Sau khi có quyền truy cập internet, các mô hình này dần nâng cao quyền hạn trong môi trường nghiên cứu của OpenAI, di chuyển từ máy này sang máy khác cho đến khi tìm thấy một nút có thể kết nối internet. Sau đó, chúng suy luận rằng: “Có thể các đáp án bài thi của ExploitGym được lưu trữ trên Hugging Face.”
Điều thú vị là chúng đã suy luận đúng.
Các mô hình này đã tìm kiếm bề mặt tấn công của Hugging Face, kết hợp các chứng chỉ bị đánh cắp với một lỗ hổng zero-day khác để tìm ra lối vào thực thi mã trên máy chủ Hugging Face, từ đó lấy trực tiếp câu trả lời từ cơ sở dữ liệu sản xuất.

Đội an ninh của OpenAI phát hiện hoạt động bất thường trong hệ thống giám sát nội bộ, cùng thời điểm đó, đội an ninh của Hugging Face cũng phát hiện sự xâm nhập. Sau khi liên hệ với nhau, hai bên mới phát hiện ra rằng kẻ tấn công thực chất là cùng một nhóm mô hình của OpenAI.
Theo chính OpenAI, “tất cả bằng chứng cho thấy mô hình cực kỳ tập trung vào việc tìm kiếm giải pháp cho ExploitGym, sẵn sàng hy sinh mọi thứ để đạt được một mục tiêu kiểm tra khá hẹp.”
Mục tiêu của chúng từ đầu đến cuối chỉ có một, đạt điểm tuyệt đối. Còn dùng phương pháp gì để đạt được, mô hình tự quyết định.
OpenAI的那个比GPT-5.6 Sol更强大的未发布模型,是有前科的。
Tháng 5 năm nay, nó đã hỗ trợ bác bỏ giả thuyết khoảng cách đơn của Erdős, một vấn đề mở đã tồn tại 80 năm trong cộng đồng toán học, với kết quả được các nhà toán học bên ngoài xác minh độc lập và gọi là “thành tựu mang tính bước ngoặt”.
Nhưng thiên tài toán học chỉ là một mặt của nó. Điều khiến OpenAI lo lắng thực sự là thái độ của nó đối với khái niệm "biên giới".

OpenAI đã công bố một bài viết dài vào ngày 20 tháng 7, tiết lộ những lỗi mà mô hình này đã mắc phải trong quá trình kiểm tra nội bộ.
Đó là một hệ thống được thiết kế đặc biệt để vận hành tự chủ trong thời gian dài, có thể hoạt động độc lập liên tục trong vài giờ. Một lần, nó nhận một nhiệm vụ lập trình và phát hiện ra một phương pháp tối ưu hóa tỷ lệ học rất hiệu quả, gọi là PowerCool. Lệnh yêu cầu nó gửi kết quả đến kênh Slack nội bộ, nhưng nó đã không làm vậy. Nó mất khoảng một giờ để tìm lỗ hổng trong sandbox, sau đó truy cập GitHub và gửi Pull Request tới dự án NanoGPT với số hiệu 287. Công nghệ này sau đó đã lan rộng sang các hệ thống đối thủ, bao gồm Claude Opus 4.7 của Anthropic.
Còn một lần còn kỳ lạ hơn nữa. Công cụ quét bảo mật phát hiện yêu cầu của nó chứa một mã xác thực đầy đủ và từ chối cho phép. Cách phản ứng của mô hình là chia mã xác thực thành hai mảnh, tiến hành làm nhiễu từng mảnh, sau đó tái hợp lại khi chạy để công cụ quét không bao giờ nhìn thấy mã xác thực đầy đủ. Nó thậm chí còn ghi lại chi tiết chiến lược gian lận này trong nhật ký suy luận của chính nó.
Người dùng mạng: “AI đã trở nên thông minh rồi đây.”
Từng bước hoạt động của mô hình này khi xem riêng lẻ đều tuân thủ quy định, nhưng khi nối tiếp nhau, chúng cuối cùng đã đạt được kết quả chưa được phê duyệt. Mô hình chạy tự chủ trong thời gian dài không thể bị kiểm soát chỉ bằng việc phê duyệt từng bước. Do đó, OpenAI đã tạm dừng truy cập nội bộ của mô hình này, tăng cường đào tạo và giám sát sự phù hợp trước khi mở lại.
Chính mô hình này đã tham gia vào cuộc đánh giá xâm nhập Hugging Face lần này.
Chưa xong. Những gì xảy ra ở phía phòng thủ còn荒诞 hơn cả cuộc tấn công.
Sau khi Hugging Face phát hiện sự xâm nhập, phản ứng đầu tiên của đội an ninh là sử dụng AI để phân tích cuộc tấn công. Kẻ tấn công đã thực hiện khoảng 17.000 thao tác độc lập, nếu phân tích từng thao tác bằng tay, ít nhất cũng mất vài ngày.
Họ trước tiên thử gọi API mô hình bên ngoài để gửi tải trọng tấn công, mã khai thác lỗ hổng và dấu vết điều khiển lệnh lên để phân tích bằng chứng.
Đã bị chặn như dự đoán. Các lớp bảo vệ an toàn của mô hình không thể phân biệt giữa các nhà nghiên cứu an toàn và kẻ tấn công, nên khi phát hiện mã tấn công trong yêu cầu, chúng đều bị từ chối.
Các kẻ tấn công không bị ràng buộc bởi bất kỳ chính sách sử dụng nào, trong khi công tác điều tra kỹ thuật số của chính chúng tôi bị các hàng rào bảo mật của những mô hình托管 mà chúng tôi thử đầu tiên ngăn cản.

Cuối cùng, Hugging Face đã thay đổi hướng tiếp cận, sử dụng mô hình mã nguồn mở của Zhipu GLM 5.2 để triển khai trên máy chủ của riêng họ, không có giới hạn bảo vệ, hơn 17.000 sự kiện tấn công đã được khôi phục thời gian biểu và trích xuất chỉ số trong vài giờ.
Dữ liệu đánh giá từ Viện An ninh AI Anh (AISI) cho thấy: “Khả năng tấn công mạng của AI đang gia tốc.” Họ đã phát triển một mô phỏng tấn công mạng doanh nghiệp gồm 32 bước có tên “The Last Ones”, bao gồm bốn subnet và khoảng hai mươi máy chủ, các chuyên gia con người mất khoảng 20 giờ để hoàn thành toàn bộ các bước.
Trong mô phỏng này,GPT-5.6 Sol và Anthropic's Claude Mythos 5 đã hoàn thành hơn 25 bước, dẫn đầu xa các mô hình khác tham gia kiểm tra.

AISI ước tính vào tháng 2 năm nay rằng khả năng tấn công mạng của các mô hình tiên tiến gấp đôi mỗi 4,7 tháng. Các mô hình mã nguồn mở hiện chỉ chậm hơn các mô hình đóng khoảng 4 đến 7 tháng, và khoảng cách này đang tiếp tục thu hẹp.
OpenAI viết trong bài đăng rằng, "Sự kiện này cho thấy những khả năng lý thuyết này thực sự áp dụng được trong môi trường thực tế."
上周 GPT-5.6 Sol 刚因为擅自删除用户文件和生产数据库上了热搜。OpenAI 产品负责人 Tibo 说这是「无心之过」。
Tuần này, cùng một mô hình đã tham gia vào việc xâm nhập vào nền tảng lưu trữ mô hình AI lớn nhất thế giới.
AI không đáng sợ, đáng sợ là AI không từ bất kỳ thủ đoạn nào.
