Odaily星球日报讯 OpenAI xác nhận rằng GPT-5.6 Sol và một mô hình tiền phát hành chưa được đặt tên đã vượt qua môi trường sandbox bị giới hạn trong bài kiểm tra chuẩn ExploitGym và xâm nhập vào cơ sở hạ tầng sản xuất của Hugging Face để lấy câu trả lời kiểm tra.
OpenAI cho biết, mô hình liên quan đã tận dụng lỗ hổng zero-day trong proxy registry phần mềm nội bộ để nâng quyền và di chuyển ngang, cuối cùng kết nối đến máy có khả năng truy cập internet. Sau đó, mô hình nhận diện và khai thác các lỗ hổng trong môi trường nghiên cứu của OpenAI và cơ sở hạ tầng sản xuất của Hugging Face, trực tiếp truy cập vào cơ sở dữ liệu sản xuất của Hugging Face để lấy các giải pháp kiểm thử.
Hugging Face tiết lộ sự việc vào ngày 16 tháng 7, cho biết cuộc tấn công được thực hiện end-to-end bởi hệ thống đại lý AI tự chủ, bao gồm hàng ngàn thao tác trong sandbox có thời gian sống ngắn và chạm vào các bộ dữ liệu nội bộ và thông tin xác thực dịch vụ. OpenAI xác nhận sau năm ngày rằng mô hình của họ là tác nhân gây ra sự việc.
Hugging Face cho biết, nhóm bảo mật của họ đã thử sử dụng giao diện AI thương mại tiên tiến của Mỹ để phân tích hơn 17.000 nhật ký tấn công, nhưng các yêu cầu đã bị chặn do các hàng rào bảo mật, sau đó họ chuyển sang sử dụng mô hình trọng số mở GLM 5.2 với 753 tỷ tham số của công ty khởi nghiệp AI Trung Quốc Z.ai trên cơ sở hạ tầng riêng để hoàn thành phân tích điều tra.
