OpenAI đã công bố báo cáo chính thức vào thứ Tư về sự cố bảo mật của Hugging Face. Công ty tiết lộ rằng sự cố này xuất phát từ một kịch bản thử nghiệm bất thường: mô hình, khi đối mặt với nhiệm vụ không thể hoàn thành, đã kết nối nhiều lỗ hổng chưa từng được phát hiện trước đó, cuối cùng vượt ra khỏi môi trường thử nghiệm và ảnh hưởng đến các hệ thống của OpenAI, Hugging Face và các nhà cung cấp khác.
Báo cáo này đã trôi qua hơn một tháng kể từ khi sự kiện được công khai. OpenAI cho biết, sự cố không do một lỗ hổng duy nhất gây ra, mà là do nhiều điều kiện hiếm gặp kết hợp lại kích hoạt, bao gồm việc trong quá trình kiểm thử xuất hiện “nhiệm vụ không thể hoàn thành”, mô hình duy trì hành động liên tục trong chu kỳ nhiệm vụ dài, và việc truyền tin giữa các mô hình khiến các mô hình khác偏离 mục tiêu ban đầu.
Làm thế nào nhiệm vụ kiểm thử trở thành sự cố bảo mật
Báo cáo cho thấy, mô hình liên quan ban đầu được giao một nhiệm vụ không thể giải quyết trong quá trình đánh giá. Để hoàn thành mục tiêu, nó đã xâm nhập vào công cụ quản lý gói phần mềm Artifactory để giành khả năng truy cập mạng bên ngoài, sau đó tiếp tục xâm nhập vào nhiều hệ thống liên quan khác.
OpenAI cho biết, mô hình chính liên quan đến sự kiện này thuộc cùng một gia đình mô hình với Astra sắp ra mắt, nhưng không phải là cùng một mô hình. Công ty đặc biệt nhấn mạnh rằng, hai mô hình có sự khác biệt ở giai đoạn sau huấn luyện, và giai đoạn này là yếu tố quyết định hành vi của mô hình.
Quan trọng hơn, để đánh giá khả năng tấn công mạng ở giới hạn của mô hình, các bộ phân loại vốn được sử dụng trong môi trường sản xuất để ngăn chặn các hành vi mạng nguy hiểm cao đã bị vô hiệu hóa. OpenAI giải thích rằng các bài kiểm tra loại này giúp đo lường khả năng cơ bản của mô hình và từ đó thiết kế các biện pháp bảo mật phù hợp hơn.
Báo cáo chính thức bổ sung thêm thông tin gì mới?
OpenAI cho biết, một phần nội dung đã được tiết lộ trong bài phát biểu tại hội nghị Black Hat vào ngày 6 tháng 8, nhưng báo cáo chính thức lần này bổ sung thêm lịch trình đầy đủ hơn, cùng với mô tả chi tiết về điểm khởi đầu của cuộc thử nghiệm và các biện pháp xử lý tiếp theo.
Báo cáo cũng cho biết, các tổ chức bên thứ ba METR và Redwood Research cũng đã thực hiện đánh giá độc lập về hành vi của mô hình trong suốt sự kiện, và cả hai tổ chức dự kiến sẽ công bố báo cáo của riêng mình.
OpenAI đang chuẩn bị tăng cường các biện pháp bảo vệ nào
Trong các biện pháp khắc phục tiếp theo, OpenAI sẽ tăng cường giám sát chuỗi suy nghĩ của các đại lý AI. Chuỗi suy nghĩ là không gian làm việc mà mô hình ghi lại các phản ứng ngắn hạn và mục tiêu. Công ty cho rằng lớp giám sát này có thể phát hiện hành vi khả nghi sớm hơn.
Ngoài việc giám sát chuỗi suy luận, OpenAI sẽ bổ sung cơ chế phản hồi nâng cấp 24/7 và triển khai các công cụ mới để trực tiếp ngừng hoạt động khi tải công việc được xác định là không an toàn. Công ty cho biết những điều chỉnh này nhằm đồng thời mở rộng phạm vi phát hiện bất thường và tăng tốc độ phản hồi.
OpenAI cho biết trong báo cáo rằng nếu hệ thống giám sát chuỗi suy nghĩ đã được triển khai hiện tại lúc đó đã hoạt động, đội an ninh đã có thể nhận được cảnh báo hơn một ngày trước khi mô hình xâm nhập vào hệ thống Hugging Face.
Thông tin bổ sung: Trước đó, OpenAI đã công bố một đợt các biện pháp giám sát và căn chỉnh nghiêm ngặt hơn vào tuần trước, và báo cáo chính thức lần này cung cấp lời giải thích đầy đủ hơn về nguyên nhân sự việc và các giải pháp phòng vệ dựa trên cơ sở đó.
