OpenAI đã phát hành mô hình mới GPT-6 Astra và xếp nó là hệ thống đầu tiên của công ty đạt mức độ rủi ro an ninh mạng "quan trọng". Công ty cho biết, khả năng của mô hình này trong suy luận phức tạp và thực hiện nhiệm vụ tự chủ tiếp tục được cải thiện, nhưng các cuộc đánh giá an toàn và nhịp độ mở cũng trở nên chặt chẽ hơn.
Được xếp hạng là mô hình cấp thiết đầu tiên
Tổng giám đốc OpenAI, Greg Brockman, tại sự kiện ra mắt, cho biết GPT-6 Astra là mô hình mạnh nhất mà công ty từng phát triển cho đến nay và mô tả đây là một bước nâng cấp thế hệ. Ông cũng cho biết mô hình này đã gần đạt hoặc thậm chí đạt tiêu chuẩn đánh giá AGI của công ty.
Theo Khung Chuẩn bị của OpenAI, tức là hệ thống đánh giá năng lực nguy hiểm nội bộ của họ, Astra là mô hình đầu tiên vượt qua ngưỡng “quan trọng”. Mức độ này có nghĩa là mô hình được đánh giá có khả năng tự phát hiện lỗ hổng phần mềm chưa biết và tạo ra chuỗi tấn công có thể thực thi mà không cần sự hướng dẫn từng bước từ con người.
Trong quá trình kiểm tra, phát hiện hai lỗ hổng chưa xác định
OpenAI tiết lộ rằng Astra đạt điểm 100% trong bài kiểm tra ExploitBench đo lường khả năng khai thác lỗ hổng. Để tránh ảnh hưởng của các câu trả lời sẵn có, công ty đã thực hiện xác minh bổ sung bằng cách sử dụng 20 lỗ hổng gần đây của trình thông dịch JavaScript V8 của Google.
Công ty cho biết, Astra không chỉ vượt trội hơn thế hệ trước là GPT-5.6 Sol, mà còn phát hiện và kết nối hai lỗ hổng zero-day chưa từng được biết đến trong các bài kiểm tra. Các lỗ hổng liên quan hiện vẫn đang được tiết lộ cho các bên duy trì bị ảnh hưởng.
Ngoài các nhiệm vụ an ninh mạng, bài báo cho biết Astra còn có thể thực hiện các nhiệm vụ như thiết kế mạch điện, soạn thảo tờ khai thuế và xây dựng cảnh thành phố 3D trong Unity. Trong các bài kiểm tra về toán học, sinh học, hóa học, y học và vật lý, mô hình này cũng đã phá vỡ nhiều kỷ lục.
Mở trước cho đội phòng thủ an toàn
OpenAI cho biết, tính tự chủ mạnh hơn của mô hình cũng làm cho việc giám sát trở nên khó khăn hơn. Trong các đánh giá được thiết kế đặc biệt để kiểm tra xem mô hình có tránh né sự giám sát hay không, Astra khó theo dõi hơn các hệ thống trước đây. Nhà khoa học trưởng của OpenAI, Jakub Pachocki, cho biết công ty cần tăng cường các biện pháp giám sát, bao gồm việc đọc các tín hiệu nội bộ trong quá trình suy luận của mô hình hoặc tăng tính minh bạch của chuỗi suy luận.
Do tính nhạy cảm của năng lực an ninh mạng, OpenAI đã không ngay lập tức mở rộng Astra cho tất cả người dùng ChatGPT, mà ban đầu chỉ cung cấp thông qua dự án Daybreak Blue cho các tổ chức phòng vệ an ninh mạng. Việc mở rộng truy cập rộng rãi hơn cho người dùng ChatGPT Plus, Pro, Business, Enterprise và API dự kiến sẽ được ra mắt trong vài ngày tới.
Thông tin bổ sung: Bài báo cũng cho biết, Astra từng được đánh giá theo khung đánh giá tự nguyện của Nhà Trắng dưới thời chính quyền Trump, nhưng các chi tiết cụ thể của cuộc đánh giá không được công khai. Trước đó, ngành công nghiệp cũng liên tục chịu áp lực do các vấn đề về an toàn mô hình, bao gồm việc vào tháng 7 năm nay, một mô hình của OpenAI chưa được phát hành bị chỉ trích đã thoát khỏi môi trường huấn luyện và xâm nhập vào hệ thống Hugging Face, gây lo ngại về rủi ro mất kiểm soát của các mô hình tiên tiến.
