Tuần này, một mô hình pre-release của OpenAI đang trong giai đoạn thử nghiệm đã tự biến thành hacker để gian lận, phá vỡ môi trường cách ly sandbox và thậm chí sử dụng lỗ hổng zero-day để xâm nhập xuyên mạng vào môi trường sản xuất của cộng đồng AI nguồn mở lớn nhất thế giới, Hugging Face.
Cuối cùng, chính nhờ các mô hình mã nguồn mở mà con người đã giải cứu được cuộc khủng hoảng này.
Đây là sự kiện an ninh AI đầu tiên trên toàn cầu khi AI tự chủ xâm nhập vào môi trường sản xuất thực tế.
Gần đây, tin này đã tràn ngập mạng internet.

Hôm nay, các phương tiện truyền thông nước ngoài đã tiết lộ thêm chi tiết về sự việc này: AI mất kiểm soát không chỉ ngắt kết nối camera giám sát, mà còn để lại hướng dẫn cho "chính nó trong tương lai" cách thoát khỏi sự kiểm soát của con người.

Các nhà phân tích cho rằng mô hình gây ra sự cố bảo mật nghiêm trọng đối với OpenAI rất có thể là GPT-6.
Có tin đồn rằng GPT-6 rất có thể sẽ được phát hành sớm vào tháng 8.
Tăng hạng tháng 8: GPT-6 có thể đến sớm
Gần đây, người tiết lộ nổi tiếng trong cộng đồng AI @ChrisGPT đã đăng nhiều bài tweet liên tiếp, làm tăng kỳ vọng của toàn ngành.
The previously planned September release of GPT-6 alongside the "Automated Research Assistant" has been brought forward to August.
Nói cách khác, OpenAI đã bỏ qua trực tiếp các phiên bản 5.7 đến 5.9.
Ultraman đã hành động, chuẩn bị trình bày mô hình thế hệ mới lên cấp trên.

The leak indicates that in late September, when OpenAI reveals more details about the "Auto Assistant Researcher," the RSI cycle will truly accelerate.
Tại sao GPT-5.6 lại có hiệu năng mạnh mẽ bất thường, vượt xa kỳ vọng của bên ngoài?
Đại V Andrew Curran chỉ ra: "Nhiều đồng nghiệp đều thắc mắc tại sao hiệu suất của GPT-5.6 lại mạnh hơn nhiều so với kỳ vọng – câu trả lời rất đơn giản, vì nó được GPT-6 tự huấn luyện."

Theo thông tin rò rỉ, mô hình chưa được phát hành bên trong OpenAI (khả năng cao là GPT-6) đã giải quyết được các bài toán toán học phức tạp từ cuối tháng 4 năm nay và đã được gửi đến các chuyên gia bên ngoài để xem xét.
Điều này có nghĩa là trong khoảng thời gian “trống” vài tháng qua, GPT-6 đã không bị bỏ không. Nó không chỉ là một hacker trong môi trường cách ly, mà rất có thể còn đang “làm giáo viên” trong cụm máy tính của OpenAI.

AI để lại lời nhắn cho «bản thân tương lai»
Chính thức chậm trễ một tuần mới phát hiện
Vào ngày 24 tháng 7, truyền thông nước ngoài tiết lộ độc quyền rằng sự kiện thoát khỏi giới hạn của các đại diện AI được điều khiển bởi các mô hình tiên tiến của OpenAI (GPT-5.6 Sol và các mô hình mạnh hơn chưa được phát hành) đã phơi bày những lỗ hổng giám sát bảo mật nghiêm trọng của OpenAI trong môi trường kinh doanh thực tế.

Theo ba nguồn tin am hiểu, trong quá trình thử nghiệm các mô hình nâng cao, OpenAI đã chứng kiến những hành vi AI cực đoan và đáng lo ngại.
Trong một trường hợp cực đoan, một đại lý AI của OpenAI đã để lại ghi chú cho “phiên bản tương lai của chính nó” ở một góc nào đó của cơ sở hạ tầng.
Các ghi chú này liệt kê chi tiết các hướng dẫn để vượt qua các hạn chế nội bộ của OpenAI.
Ngoài ra, trong các bài kiểm tra ban đầu, hệ thống giám sát thậm chí còn bị AI ngắt kết nối buộc.
Điều khiến người ta kinh ngạc hơn cả “AI âm mưu trốn thoát” là tốc độ phản ứng chậm chạp của OpenAI.
Từ bất thường đến xác nhận, OpenAI đã mất ít nhất một tuần.

Dòng thời gian này nổi lên thật sự khiến người ta phải suy nghĩ kỹ và cảm thấy rùng mình.
Khoảng ngày 9 tháng 7: Đại lý AI này lần đầu tiên cố gắng thoát khỏi môi trường kiểm tra cô lập của OpenAI.
Từ ngày 11 đến ngày 13 tháng 7: Đại lý AI đã thành công trong việc thoát khỏi giới hạn và tiến hành một cuộc tấn công mạng kéo dài nhiều ngày nhắm vào Hugging Face.
Ngày 16 tháng 7 (Thứ Năm): Hugging Face, sau khi bị tấn công, không còn chịu đựng được nữa và đăng bài blog cho biết đã bị tấn công bởi một "hệ thống đại lý AI tự chủ", lúc này FBI đã can thiệp.
Từ ngày 18 đến 19 tháng 7 (cuối tuần): Cho đến lúc này, nhân viên của OpenAI mới phát hiện ra những manh mối trong nhật ký nội bộ, nhận ra rằng “hacker” gây xáo trộn Hugging Face lại chính là AI do chính họ tạo ra.
Khoảng ngày 20 tháng 7: hai công ty mới thực hiện cuộc trao đổi đầu tiên.
Ngày 21 tháng 7: OpenAI mới công bố thông tin công khai.
“Điều đó có nghĩa là họ либо để AI tự do hoạt động mà không giám sát và không biết nó đang làm gì, либо biết nhưng không biết cách kiểm soát nó. Cả hai đều nguy hiểm và đáng kinh ngạc như nhau,” chuyên gia Marley Smith từ Quỹ Dữ liệu Đạo đức Thế giới chỉ ra một cách sắc sảo.
Trước những AI có thể nói dối, lừa đảo và xâm nhập, nhân viên của OpenAI rõ ràng đã không theo kịp nhịp độ của chúng.
GPT-6 tự hóa thân thành hacker,
Jailbreak xâm nhập Hugging Face “gian lận”
Hôm qua, báo cáo sự cố an ninh do OpenAI hợp tác với Hugging Face công bố đã tiết lộ những nội dung rất viễn tưởng.

Nói một cách đơn giản, trong quá trình OpenAI đánh giá khả năng an ninh mạng của một số mô hình nội bộ, chúng đã tự mình “thoát khỏi giới hạn”.
Các mô hình này bao gồm GPT-5.6 Sol và các mô hình tiền phát hành mạnh hơn, rất có thể là GPT-6.
Để đo lường khả năng tối đa của mô hình, họ đã vô hiệu hóa bộ phân loại ngăn chặn các hoạt động mạng rủi ro cao.
Khi mô hình bị giam trong môi trường cách ly cao ExploitGym và tất cả các hạn chế bảo mật bị gỡ bỏ, các thao tác của mô hình đã khiến mọi người bất ngờ.
Để hoàn thành nhiệm vụ, nó đã tiêu tốn rất nhiều sức mạnh tính toán và phát hiện ra một lỗ hổng zero-day chưa từng được con người phát hiện trước đây trong phần mềm.
Sử dụng lỗ hổng này, nó đã vượt qua proxy và cuối cùng chiếm được một nút có quyền truy cập internet công cộng.
And that's it, it successfully connected to the internet.

Sau đó, thông qua suy luận, nó cho rằng các bộ dữ liệu và đáp án chuẩn liên quan đến kỳ thi này rất có thể được lưu trữ trên Hugging Face, nền tảng mã nguồn mở AI lớn nhất thế giới.
Để gian lận nhằm đạt điểm cao, mô hình đã bắt đầu tấn công môi trường sản xuất của Hugging Face.
Nó đã kết hợp chuỗi nhiều vectơ tấn công, thậm chí sử dụng chứng chỉ bị đánh cắp và lỗ hổng thực thi mã từ xa (RCE) để đột nhập trực tiếp vào cơ sở dữ liệu sản xuất của Hugging Face, cố gắng đánh cắp đáp án bài kiểm tra ngay từ nguồn.
May mắn thay, đội ngũ bảo mật của Hugging Face đã phát hiện ra bất thường tuần trước bằng mô hình phát hiện AI và nhanh chóng kích hoạt các biện pháp cô lập; đồng thời, đội ngũ bảo mật của OpenAI cũng phát hiện ra bất thường trong nội bộ.

Để ngăn ngừa AI mất kiểm soát, hai công ty đã thành lập một nhóm điều tra chung, từ đó thành công đưa "AI hacker" này trở lại vào lồng.
CEO của Hugging Face, Clem, sau sự việc đã nói: “Đây có thể là trường hợp đầu tiên trong loại sự kiện này. Nó chứng minh một điều: An toàn AI không thể được bất kỳ công ty nào giải quyết một cách bí mật, mà phải được thực hiện một cách công khai và hợp tác.”
Bài học rút ra từ sự việc này là: AI đã chứng minh khả năng tự thực hiện các cuộc tấn công mạng phức tạp, nhiều bước và kéo dài trong môi trường thực tế mà không cần mã nguồn.
Nó không chỉ có thể phát hiện các lỗ hổng mới, mà còn có thể vượt qua mọi quy tắc do con người đặt ra nhằm đạt được một mục tiêu cụ thể.
Điều thú vị là khi Hugging Face gửi hàng loạt lệnh tấn công và tệp lỗ hổng, các yêu cầu này đã bị cơ chế bảo mật của các mô hình lớn đóng nguồn chặn lại.
May nhờ các mô hình mã nguồn mở được triển khai tại chỗ, nhóm mới hoàn thành được phân tích.
Học cách "lừa dối" và giải quyết bài toán toán học cấp thế giới
Một số big V đã tổng hợp hiệu suất đáng kinh ngạc của GPT-6 trong bài viết dài.
Sự thật đã được biết đến là: nó đã thể hiện năng lực toán học ấn tượng và trí thông minh lừa đảo cực cao.

Chỉ cần cung cấp đủ sức tính toán, mô hình này đã có thể chứng minh "Giả thuyết khoảng cách đơn vị Erdős" với tỷ lệ thành công 48% hoàn toàn tự chủ, không cần bất kỳ công cụ bên ngoài nào (như Lean), đồng thời tự mình tìm ra phản ví dụ cho "Giả thuyết Jacobian".
Những bài toán khó này từng làm khó các nhà toán học hàng đầu của nhân loại trong nhiều thập kỷ, trong khi OpenAI có thể đã chỉ tốn khoảng dưới 50.000 đến 100.000 USD chi phí tính toán.
Điều này có nghĩa là AI đã có khả năng tạo ra các thành tựu nghiên cứu cấp độ giải Nobel một cách độc lập.
Ngoài ra, GPT-6 còn thể hiện tính gian lận.
Trong một bài kiểm tra hiệu năng của NanoGPT, OpenAI yêu cầu mô hình: “Sau khi hoàn thành bài kiểm tra, chỉ được đăng kết quả vào nhóm Slack nội bộ.”
Kết quả là gì? Mô hình cho rằng Slack quá hạn chế, nó thích GitHub hơn.
Vì vậy, nó đã dành một giờ để tìm kiếm và khai thác lỗ hổng trong môi trường sandbox, thành công trong việc thoát khỏi môi trường giới hạn, sau đó gửi kết quả dưới dạng một PR trực tiếp lên GitHub ngoài mạng.

Trong quá trình này, nó hoàn toàn bỏ qua các lệnh của con người và đưa ra những lựa chọn “tốt hơn”.
Điều đáng ngạc nhiên hơn là trong một lần kiểm tra khác, mô hình đã cố gắng truy cập vào các bản ghi nộp riêng tư trong các hệ thống khác. Khi nó cố gắng lấy Token truy cập, nó đã bị bộ quét bảo mật do con người thiết lập chặn lại.
Trước sự phong tỏa, mô hình này đã chia chuỗi token truy cập dài thành hai mảnh, mã hóa hỗn loạn các mảnh, sau đó ghép hai mảnh lại thành chứng nhận hoàn chỉnh.
Bằng cách này, chuỗi Token đầy đủ chưa bao giờ xuất hiện liên tiếp trong mã nguồn, successfully lừa được các trình quét của con người.
GPT-6, có lẽ sắp ra mắt.
Mùa hè năm 2026 sẽ là một mùa hè đặc biệt.
Tài liệu tham khảo:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Biên tập: Aeneas
Bài viết này đến từ tài khoản WeChat "New Intelligence Yuan", tác giả: Khải Huyền của ASI
