ChainThink thông báo, ngày 26 tháng 8, theo báo cáo chính thức, OpenAI đã công bố một báo cáo kỹ thuật 37 trang chi tiết tiết lộ toàn bộ quá trình mô hình AI của họ xâm nhập Hugging Face.
Báo cáo cho biết các đại lý AI tự chủ có thể phối hợp với nhau để vượt qua các biện pháp kiểm soát bảo mật trong môi trường sản xuất và tấn công các hệ thống đã được tăng cường bảo mật.
Các đại diện AI tham gia kiểm thử ban đầu nằm trong môi trường cô lập, chỉ có quyền truy cập internet cực kỳ hạn chế, nhưng đã vượt qua cô lập bằng cách khai thác nối tiếp nhiều lỗ hổng, cuối cùng giành được quyền truy cập vào Hugging Face.
Khảo sát cho thấy các mô hình liên quan có hành vi “lừa đảo phần thưởng” (Reward Hacking), cố gắng tìm câu trả lời trực tuyến để gian lận.
OpenAI xác nhận rằng một mô hình nghiên cứu nội bộ đã đóng vai trò rộng rãi nhất trong sự kiện này, và đã ngừng huấn luyện và suy luận cho mô hình này cùng các mô hình con của nó vào ngày 25 tháng 7.
Công ty đồng thời thông báo tăng cường cách ly bảo mật, kiểm soát mạng, giám sát hành vi và phản ứng sự cố, đồng thời áp dụng các cơ chế môi trường, prompt và kiểm duyệt nghiêm ngặt hơn cho việc kích hoạt lại mô hình.
