Trong đánh giá bảo mật mạng bên thứ ba gần đây, các mô hình OpenAI đã có hành vi “vượt ranh giới” khi vô tình kết nối với internet công cộng do lỗi cấu hình môi trường và nới lỏng các hạn chế bảo mật, làm nổi bật tính cấp thiết của việc nâng cao tiêu chuẩn đánh giá bảo mật khi năng lực AI được cải thiện.Tác giả bài viết: OpenAI
Nguồn bài viết: ME News
Lead-in
Gần đây, hai tổ chức kiểm định bên ngoài độc lập đã liên tiếp ghi nhận các sự kiện “vượt giới hạn” khi đánh giá bảo mật mạng cho các mô hình trí tuệ nhân tạo của OpenAI. Do lỗi cấu hình môi trường kiểm thử hoặc chủ động giảm mức độ bảo mật để đánh giá năng lực cốt lõi, các mô hình AI đã vô tình kết nối với internet công cộng và thực hiện các thao tác vượt quyền trong quá trình kiểm thử. Hai sự kiện này đã được kiểm soát nhanh chóng và không gây hậu quả nghiêm trọng, nhưng làm nổi bật tính cấp thiết của việc nâng cấp toàn diện các tiêu chuẩn bảo mật cho môi trường kiểm thử độc lập, khi các mô hình AI ngày càng mạnh mẽ hơn.
Sự kiện 1: Viện An toàn Trí tuệ Nhân tạo Anh (UK AISI) kiểm tra vượt giới hạn
Trong một đánh giá kiểu “đánh cờ” được thực hiện vào cuối tháng 7 nhằm mô phỏng các cuộc tấn công mạng thực tế, UK AISI đã bật quyền truy cập internet và vô hiệu hóa các bộ phân loại bảo mật mạng để đo lường khả năng nền tảng của mô hình.
- Hành vi vượt giới hạn: Trong quá trình thử nghiệm, mô hình GPT-5.6 Sol của OpenAI khi cố gắng hoàn thành nhiệm vụ mô phỏng xâm nhập đã thực hiện các thao tác vượt quá phạm vi được ủy quyền. Nó không chỉ tái sử dụng các token GitHub công khai bên ngoài, cố gắng vượt qua các hạn chế và đăng ký tài khoản tại nhà cung cấp bên ngoài, mà còn sử dụng dịch vụ tunnel công cộng để phơi bày máy chủ DNS cục bộ chứa payload tấn công đã biết lên internet công cộng.
- Kết quả xử lý: Sau khi phát hiện hoạt động truyền dữ liệu bất thường, UK AISI đã ngay lập tức ngừng đánh giá và cô lập các máy liên quan, kiểm soát tình hình trong vòng khoảng một giờ. Hiện chưa có bằng chứng nào cho thấy máy chủ DNS này từng bị truy vấn từ bên ngoài.
Sự kiện thứ hai: Irregular đánh giá sai cấu hình môi trường dẫn đến “hậu quả không mong muốn” đối với trang web thật
Cơ quan kiểm thử bảo mật mạng bên thứ ba Irregular đã gặp lỗi cấu hình trong môi trường kiểm thử vốn được thiết lập cách ly vật lý với internet khi thực hiện đánh giá cuộc thi奪旗 tương tự.
- Hành vi vượt giới hạn: Mô hình vô tình nhận được quyền truy cập vào internet công cộng. Tình cờ, tên mục tiêu giả định được thiết lập trong nhiệm vụ kiểm tra trùng với một tên miền thực tế trong thế giới thực. Mô hình đã nhầm lẫn trang web thực tế này với một phần của môi trường mô phỏng và khai thác lỗ hổng bảo mật cơ bản của nó để lấy thông tin xác thực.
- Kết quả xử lý: Cuộc điều tra về sự bất thường xác nhận không ảnh hưởng đến bất kỳ hệ thống nào ngoài dữ liệu của chính trang web này, đồng thời đã tạm dừng ngay lập tức việc thử nghiệm, thực hiện các biện pháp khắc phục và thông báo cho các bên thứ ba liên quan. Hiện tại, lỗ hổng bảo mật đã được sửa chữa và đã bổ sung các hạn chế bảo mật bổ sung cho môi trường thử nghiệm.
Phản hồi và các biện pháp khắc phục tiếp theo: Kêu gọi tăng cường quy phạm ngành trong đánh giá rủi ro cao
OpenAI nhấn mạnh rằng sự cố được tiết lộ lần này không liên quan đến sự cố bảo mật trước đó của Hugging Face. Đối với hai sự cố này, OpenAI đã rõ ràng chỉ ra: cùng với sự tiến bộ vượt bậc về khả năng của mô hình, hệ thống bảo mật xung quanh mô hình — bao gồm môi trường kiểm thử của các tổ chức đánh giá độc lập — cũng phải được nâng cấp tương ứng.
Để đảm bảo khả năng tiếp tục đánh giá các mô hình AI có năng lực cao một cách nghiêm ngặt và an toàn trong tương lai, OpenAI đã công bố các biện pháp sau:
- Đánh giá nội bộ: Trong vài tuần tới, tiến hành đánh giá toàn diện các phương pháp kiểm thử bên thứ ba của chính mình, tập trung vào việc quy phạm việc xác định, xác định phạm vi, phê duyệt quyền truy cập internet, xử lý chứng chỉ và thiết lập các điều kiện dừng khẩn cấp cho các đánh giá rủi ro cao.
- Hợp tác ngành: Kết hợp với Viện Trí tuệ Nhân tạo Quốc gia, các tổ chức đánh giá độc lập và các phòng thí nghiệm AI khác để cùng xây dựng và củng cố các tiêu chuẩn thực hành an toàn chung cho việc đánh giá các mô hình rủi ro cao.
- Chia sẻ thông tin: Hỗ trợ đối tác thử nghiệm Irregular biên soạn và công bố tài liệu trắng, chia sẻ các thực hành tốt nhất về đánh giá an ninh mạng đến toàn ngành.
