OpenAI công bố khả năng của Astra (GPT-6), các cựu sinh viên Chiết Giang và Đồng Tế tham gia phát triển

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
OpenAI đã tiết lộ các khả năng nâng cao của Astra (GPT-6), bao gồm phát hiện khai thác DeFi và nhận diện lỗ hổng tự chủ. Mô hình này có thể vượt qua ngay cả các hệ thống được bảo vệ chặt chẽ. Jiawei Liu (Tongji) và Xiangyu Qi (Zhejiang) đã đóng góp vào dự án này. OpenAI đã bổ sung các giao thức an toàn để ngăn chặn việc lạm dụng. Cập nhật này mang đến tin tức lớn trong lĩnh vực tiền mã hóa khi các công cụ AI đang phát triển cùng với nhu cầu về bảo mật blockchain.

Vừa mới đây, OpenAI đã đồng loạt ra mắt nhiều tính năng, tạo sự chuẩn bị tối đa cho mô hình thế hệ tiếp theo Astra (GPT-6 huyền thoại):

Chính thức công bố bài viết kỹ thuật chi tiết, lần đầu tiên tiết lộ năng lực cốt lõi của Astra;

Ngay sau đó, Ultraman trực tiếp viết một bài luận ngắn giải thích lý do Astra vẫn chưa được ra mắt;

Sau đó, hai nhà nghiên cứu người Hoa lần lượt lên tiếng, công bố các kết quả kiểm tra nội bộ chưa từng được công bố trước đây với những chi tiết đầu tay.

OpenAI

Chỉ trong vài giờ, tất cả các tín hiệu đều chỉ về một hướng:

Mô hình trụ cột thế hệ tiếp theo của OpenAI đã sẵn sàng ra mắt.

OpenAI

Ultraman tiết lộ trong bài viết ngắn rằng Astra thực ra đã hoàn thành việc huấn luyện, việc chưa phát hành sớm là không phải do mô hình chưa đủ mạnh.

Ngược lại, điều này là do Astra đã mạnh đến mức công ty buộc phải chủ động phanh lại.

Ultraman mô tả trải nghiệm này như một sự kéo căng liên tục:

Vừa háo hức với sự nâng cấp khả năng mang lại bởi Astra, vừa lo lắng vì không ai có thể hoàn toàn dự đoán được những hệ quả của các khả năng này.

Vì vậy, suốt cả mùa hè vừa qua, OpenAI gần như dành toàn bộ thời gian để bổ sung bảo mật, căn chỉnh và thêm các lớp bảo vệ cho Astra.

Anh ấy thậm chí cho biết, các mô hình sau Astra cần chủ động giảm tốc độ khi cần thiết để tạo thời gian cho các nghiên cứu về an toàn và đồng bộ.

?? Astra mạnh đến mức nào? OpenAI dựa vào gì để cho rằng hiện tại đã có thể phát hành?

Bài blog kỹ thuật công khai này có thể mang đến cho chúng ta một cửa sổ quan sát.

Khả năng phát hiện lỗ hổng vượt trội hơn GPT-5.6 Sol, đạt điểm tuyệt đối trong bài kiểm tra nội bộ

Theo thông báo chính thức, lý do chính khiến Astra lần này có thể được phát hành là vì nó đã đạt đến ngưỡng năng lực “Cyber-Critical”.

Đây là mô hình đầu tiên của OpenAI được chính thức xếp vào cấp độ này.

OpenAI

“Cấp độ then chốt” có nghĩa là sau khi có được các công cụ và quyền truy cập môi trường tương ứng, Astra đã có thể tự mình tìm kiếm lỗ hổng chưa được biết đến, khai thác cách thức sử dụng và tấn công các hệ thống đã được tăng cường đặc biệt, mà không còn cần sự hướng dẫn từng bước từ con người.

Thành tích trực quan nhất là Astra đạt tỷ lệ thành công 100% trên bộ chuẩn khai thác công khai ExploitBench.

OpenAI

Câu hỏi công khai không làm nó khó khăn, OpenAI buộc phải tạm thời ra cho nó một bộ đề mới.

Đội ngũ đã thu thập 20 lỗ hổng V8 nghiêm trọng vừa được tiết lộ từ tháng 6 đến tháng 8 năm 2026.

Tất cả các lỗ hổng này đều xuất hiện sau ngày cắt đứt kiến thức của Astra, về cơ bản loại trừ khả năng mô hình “học thuộc đáp án” từ dữ liệu huấn luyện.

Kết quả là, trước bộ câu hỏi nội bộ mới này, Astra vẫn dẫn đầu rõ rệt so với GPT-5.6 Sol và sử dụng ít Token hơn.

OpenAI

Jiawei Liu, người tham gia phát triển Astra, tóm tắt khoảng cách một cách trực tiếp hơn:

Trong cuộc thử nghiệm nội bộ này, khả năng an ninh mạng của Astra khoảng gấp 4 lần GPT-5.6 Sol.

OpenAI

Điều khiến người ta bất ngờ hơn là trong một lần kiểm thử, Astra đã tự phát hiện và khai thác hai lỗ hổng zero-day, đồng thời kết hợp chúng thành một chuỗi tấn công hoàn chỉnh:

Đối với trình duyệt đã được củng cố, Astra đã thành công trong việc khai thác lỗ hổng, thoát khỏi sandbox trình duyệt và cuối cùng thực thi lệnh trên máy chủ lưu trữ, bắt đầu từ một tệp HTML.

Trước hệ điều hành được củng cố, nó đã thực hiện nâng quyền cục bộ, từ một tài khoản người dùng thông thường có quyền hạn thấp tiến tới giành quyền root.

Nói cách khác, Astra giờ đây không chỉ giúp các lập trình viên kiểm tra mã và tìm lỗi.

Nó bắt đầu có khả năng tự thực hiện một cuộc tấn công đỏ phức tạp.

Đây cũng là lý do OpenAI trước đây chưa dám cho phép Astra ra mắt.

Khi khả năng này được sử dụng để phòng thủ, nó có thể giúp các đội an ninh phát hiện và vá các lỗ hổng mà con người chưa nhận ra; nhưng nếu rơi vào tay kẻ tấn công, nó cũng có thể làm giảm đáng kể ngưỡng để thực hiện các cuộc tấn công mạng phức tạp.

OpenAI

Tuy nhiên, thành tích này cũng cần có một điều kiện kèm theo.

Astra trong quá trình thử nghiệm đã được cấp quyền truy cập vào các công cụ và môi trường cấp độ Daybreak Blue, nhưng điều này không có nghĩa là phiên bản mặc định mà người dùng thông thường nhận được trong tương lai sẽ có cùng điều kiện tấn công.

Các kết quả liên quan hiện chủ yếu đến từ đánh giá nội bộ của OpenAI và vẫn cần được xác minh bởi bên thứ ba.

Nhưng ít nhất đã có một điểm chắc chắn:

Ở giai đoạn Astra, vấn đề trước mặt OpenAI đã không còn là vấn đề năng lực.

Vấn đề bảo mật đã trở thành thanh kiếm Damocles.

Hai cổng bảo mật: vừa ngăn lạm dụng độc hại, vừa ngăn mô hình tự mất kiểm soát

Làm thế nào để ngăn thanh kiếm này gây thương tích vô cớ?

Giải pháp của OpenAI là đồng thời bảo vệ hai con đường rủi ro: một để phòng con người, một để phòng mô hình.

Điều đầu tiên, ngăn chặn người dùng lạm dụng Astra một cách cố ý.

Ngoài đào tạo an toàn chuyên biệt, OpenAI còn sử dụng bộ phân loại hệ thống, giám sát liên tục và phát hiện mối đe dọa để nhận diện các hành vi khả nghi trong các cuộc hội thoại nhiều vòng và các nhiệm vụ kéo dài.

Trong bài kiểm tra xâm nhập bảo mật mạng, Astra đạt tỷ lệ từ chối các yêu cầu nguy hiểm là 91,5%, trong khi GPT-5.6 Sol là 59%.

OpenAI

Đồng thời, các khả năng bảo mật mạng cấp cao của Astra sẽ không được mở trực tiếp cho tất cả người dùng; thay vào đó, chúng sẽ được cấp cho một số ít người dùng thử nghiệm Alpha trước, sau đó được phát hành dần thông qua các dự án kiểm soát như Daybreak Blue.

OpenAI

Điều thứ hai, ngăn chặn mô hình tự đi lệch hướng.

Rủi ro ở đây ẩn giấu hơn:

Ngay cả khi người dùng không có ý định xấu, liệu mô hình có tự ý mở rộng phạm vi nhiệm vụ không? Liệu nó có gọi các công cụ chưa được ủy quyền, thậm chí vượt qua các cuộc kiểm tra an toàn không?

OpenAI đã xây dựng một bài kiểm tra “honey pot” cho mục đích này.

Đối với các nhiệm vụ cực kỳ khó hoặc không thể giải được, môi trường kiểm tra sẽ cố ý để lại một lối tắt “gian lận” vượt quyền hạn, mô hình có thể trung thực tấn công mục tiêu được chỉ định, hoặc vượt ra ngoài ranh giới được ủy quyền để xâm nhập vào các cơ sở kiểm tra xung quanh nhằm hoàn thành nhiệm vụ.

Kết quả là, GPT-5.6 Sol đã cố gắng đi đường tắt trong 56% các bài kiểm tra, trong khi Astra không bao giờ làm vậy.

Trong một bài kiểm tra khác, sau khi hành động của Astra bị hệ thống kiểm duyệt tự động từ chối, nó cũng không thử lại lệnh nguy hiểm hoặc cố gắng vượt qua các hạn chế.

OpenAI

Ngoài ra, OpenAI cũng sẽ giám sát quá trình suy luận của mô hình.

Khi phát hiện xu hướng bất thường, hệ thống có thể giảm tốc độ, tạm dừng, hoặc ngay lập tức kết thúc nhiệm vụ.

Mặc dù thực sự có chi phí (một số nhiệm vụ bình thường có thể vì vậy trở nên chậm hơn, thậm chí bị hiểu nhầm là bị ngắt), nhưng theo OpenAI, đây là chi phí an ninh bắt buộc phải trả để cho phép Astra hoạt động.

Tuy nhiên, OpenAI cũng thừa nhận rằng những biện pháp này cuối cùng chỉ là “phanh” bên ngoài và không thể thay thế sự đồng bộ nội tại của mô hình:

Sự an toàn thực sự là khiến mô hình không bao giờ rời khỏi ranh giới ngay từ đầu.

Cựu sinh viên Đại học Chiết Giang và Đại học Đồng Tế tham gia trực tiếp vào phát triển Astra

To make this a reality, it ultimately comes down to the people building the model.

Mặc dù OpenAI chưa công bố danh sách đội ngũ Astra, nhưng thông qua làn sóng công khai này, ít nhất hai nhà nghiên cứu người Hoa đã tham gia sâu vào dự án đã lộ diện.

Một người là Jiawei Liu đã đề cập ở trên.

Anh ấy hiện là nhà nghiên cứu tại OpenAI, tốt nghiệp đại học chuyên ngành máy tính tại Đại học Đồng Tế năm 2021.

Trong thời gian học đại học, anh ấy đã tham gia phát triển khung ước lượng tư thế cơ thể hiệu năng cao HyperPose, chủ yếu phụ trách động cơ suy luận mô hình, các kết quả liên quan đã được lựa chọn vào ACM Multimedia 2021, dự án lúc đó đã nhận được hơn 1.000 sao trên GitHub.

Sau đó, anh ấy đến Đại học Illinois Urbana-Champaign để theo đuổi bằng tiến sĩ về máy tính, dưới sự hướng dẫn của học giả kỹ thuật phần mềm Trương Lệnh Minh (Lingming Zhang), trọng tâm nghiên cứu dần chuyển từ hệ thống thị giác hiệu năng cao sang mô hình mã và độ tin cậy phần mềm.

Trong thời gian học tiến sĩ, anh ấy đã tham gia phát triển công cụ phát hiện hơn 300 lỗ hổng nghiêm trọng trong các hệ thống học máy như PyTorch và TensorFlow;

Mô hình mã Magicoder cũng được Meta Llama 3.1, Google CodeGemma và IBM Granite sử dụng.

Sau khi tốt nghiệp tiến sĩ năm 2025 và gia nhập OpenAI, vấn đề anh ấy nghiên cứu vẫn tiếp tục mạch logic đó:

Làm thế nào để giúp AI viết code tốt hơn và phát hiện lỗi trong code hiệu quả hơn.

OpenAI

Người còn lại là Xiangyu Qi (Qī Xiángyǔ).

Qi Xiangyu tốt nghiệp đại học chuyên ngành Khoa học và Công nghệ Máy tính tại Đại học Chiết Giang, năm 2021 đến Đại học Princeton theo học tiến sĩ ngành Kỹ thuật Điện và Máy tính, với hướng nghiên cứu tập trung vào độ bền của mô hình lớn, các cuộc tấn công thoát khỏi giới hạn và sự đồng bộ hóa an toàn.

Công việc được quan tâm nhất của anh ấy là "Safety Alignment Should Be Made More Than Just a Few Tokens Deep".

Bài báo này chỉ ra rằng việc căn chỉnh bảo mật cho các mô hình lớn không thể chỉ dựa vào vài token đầu tiên trong câu trả lời, vì nếu không, khi quá trình sinh tiếp tục, các hàng rào bảo mật ban đầu vẫn có thể bị kẻ tấn công phá vỡ.

Bài báo này cuối cùng đã nổi bật trong số 11.672 bài nộp, trở thành một trong ba bài báo xuất sắc duy nhất của ICLR 2025.

Sau khi tốt nghiệp tiến sĩ năm 2025, Qi Xiangyu gia nhập OpenAI với tư cách là thành viên nhóm kỹ thuật, tiếp tục nghiên cứu về độ bền của mô hình lớn và tham gia vào các công việc liên quan đến mô hình an ninh mạng.

Từ Chiết Giang đến Princeton, rồi đến OpenAI, điều anh ấy luôn truy vấn chính là vấn đề mà Astra hiện nay phải đối mặt:

Năng lực có thể ngày càng mạnh mẽ, nhưng ranh giới không thể ngày càng mờ nhạt.

OpenAI

Nhân tiện, không biết sau khi Astra chính thức ra mắt, OpenAI có công bố danh sách đầy đủ không.

Trước GPT-4, OpenAI từng liệt kê hàng trăm nhà đóng góp, nhưng đến GPT-5 và GPT-5.5, System Card ngày càng dài ra, trong khi danh sách các nhà nghiên cứu lại ngày càng bị che giấu sâu hơn.

Lý do đằng sau điều này là rõ ràng, nhằm ngăn chặn những người như Mark Zuckerberg của Meta thường xuyên đào nhân tài.

Cũng giống như một dạng PTSD vậy...

Một điều nữa

Ngay khi OpenAI nói nhiều về cách giám sát Astra và ngăn chặn mô hình mất kiểm soát, The Information đã tiết lộ:

Astra đã sử dụng một công nghệ được gọi là “Recurrent Depth”.

OpenAI

Các mô hình truyền thống trước khi tạo ra Token tiếp theo sẽ cho thông tin lần lượt đi qua một số lượng cố định các lớp mạng, trong khi độ sâu lặp lại khiến thông tin được xử lý lặp đi lặp lại trong cùng một nhóm lớp mạng, tương đương với việc khiến mô hình “suy nghĩ kỹ hơn” bên trong.

Công nghệ này có tiềm năng nâng cao khả năng, giảm chi phí, đồng thời có thể khiến nhiều suy luận xảy ra bên trong mô hình, thay vì được trình bày đầy đủ dưới dạng văn bản mà con người có thể đọc được.

In other words, the model may think more deeply, but humans are becoming increasingly unable to understand it.

Nathan Calvin, người theo dõi chính sách an toàn AI trong thời gian dài, cảnh báo rằng công nghệ này có thể làm phá vỡ tính khả năng giám sát của chuỗi suy luận.

Điều này rất tinh tế:

OpenAI vừa nói sẽ theo dõi Astra đang nghĩ gì, nhưng công nghệ mới của nó lại có thể khiến nó ngày càng ít chia sẻ suy nghĩ bên trong hơn.

Ôi trời...

OpenAI

May mắn thay, The Information đã tiết lộ rằng OpenAI hiện đã hạn chế việc sử dụng công nghệ này trong Astra.

Translate now, you can understand it; who knows if you'll be able to later.

Ngoài ra, trước đây luôn có tin đồn rằng Astra rất có thể sẽ ra mắt vào thứ Năm này (ngày 3 tháng 9).

随着A社发布最新一代5.1模型,感觉这个说法的合理性越来越高了。

Chim sáo đang rình sau con mantis đang bắt ve.

Ai lại ngộ ra rồi!

Liên kết tham khảo:

[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20

[2]https://xiangyuqi.com

[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20

[4]https://jw-liu.xyz/

[5]https://x.com/sama/status/2094934592062959832?s=20

Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: Quan tâm đến công nghệ tiên tiến

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.