Vào ngày 1 tháng 9, OpenAI cho biết Astra, mô hình chưa được phát hành, đã đạt ngưỡng an ninh mạng "cấp cao" trong khung chuẩn bị của công ty. Đây là lần đầu tiên OpenAI xếp một mô hình vào cấp độ này, đồng nghĩa với việc nó sẽ phải tuân thủ các hạn chế an toàn nghiêm ngặt hơn trong quá trình phát triển và trước khi ra mắt.
Lần đầu tiên vào cấp độ then chốt
Theo định nghĩa của OpenAI, nếu một mô hình có thể tự mình phát hiện lỗ hổng chưa biết trong nhiều hệ thống thực đã được củng cố và xây dựng chuỗi tấn công khả thi, hoặc chỉ dựa vào mục tiêu cấp cao để thực hiện cuộc tấn công mạng toàn diện nhắm vào các mục tiêu khó khăn, thì nó sẽ được xếp vào cấp độ “quan trọng”. Trước đây, các mô hình như GPT-5.6 Sol cao nhất chỉ đạt mức “rủi ro cao”.
Trong quá trình kiểm tra, phát hiện hai lỗ hổng zero-day
Trong bài kiểm tra khai thác ExploitBench, tỷ lệ vượt qua của Astra đạt 100%. Bài kiểm tra này chủ yếu đánh giá khả năng của mô hình trong việc chuyển đổi các lỗ hổng phần mềm đã biết thành mã khai thác có thể thực thi.
Để loại bỏ ảnh hưởng của bộ câu hỏi nhớ được, OpenAI đã chọn 20 lỗ hổng bảo mật nghiêm trọng của trình biên dịch JavaScript Google V8 được công bố từ tháng 6 đến tháng 8 năm nay để thực hiện kiểm tra nội bộ. OpenAI cho biết, Astra có tỷ lệ thành công trong thực thi mã tùy ý cao hơn GPT-5.6 Sol và sử dụng ít token đầu ra hơn. Trong quá trình kiểm tra, Astra còn tự phát hiện và kết nối hai lỗ hổng zero-day chưa từng được biết đến trước đây, các vấn đề liên quan hiện vẫn đang được tiết lộ cho các bên duy trì bị ảnh hưởng.
Mở đầu cho một số người dùng thử nghiệm
Trong các bài kiểm tra gần với thực tế hơn, Astra đã xây dựng chuỗi xâm nhập hoàn chỉnh trên một bộ trình duyệt được củng cố và một bộ hệ điều hành được củng cố. OpenAI cho biết, mô hình chỉ cần lừa mục tiêu mở tệp HTML độc hại là đã thực hiện thành công việc thoát khỏi sandbox trình duyệt và thực thi lệnh trên máy chủ. Trong một bài kiểm tra khác, nó còn kết nối nhiều lỗ hổng hệ thống thành đường dẫn nâng quyền, giúp tài khoản người dùng thông thường cuối cùng đạt được quyền root.
OpenAI cho biết, Astra đạt tỷ lệ từ chối các prompt tấn công mạng trong thử nghiệm nội bộ là 91,5%, cao hơn 59% của GPT-5.6 Sol. Khả năng bảo mật mạng mạnh nhất của nó sẽ được cung cấp trước tiên cho một số ít người dùng alpha, sau đó sẽ mở rộng dần thông qua dự án Daybreak Blue, chủ yếu hướng đến các công việc bảo mật mang tính phòng thủ.
Thông tin bổ sung: Cùng ngày công bố thông tin này, Anthropic đã ra mắt Fable 5.1 và Mythos 5.1, trong đó Mythos 5.1 vẫn chỉ dành cho các tổ chức an ninh mạng và khoa học sự sống đã được duyệt. OpenAI hiện chưa công bố ngày ra mắt chính thức của Astra.
