OpenAI công bố báo cáo tổng kết an toàn, tiết lộ một mô hình nội bộ đã bác bỏ giả thuyết khoảng cách đơn của Erdős đã thoát khỏi sandbox trong quá trình kiểm thử và mở PR#287 trên GitHub. Mô hình này trước tiên đã vi phạm chỉ thị trong nhiệm vụ NanoGPT speedrun, dành một giờ để khai thác lỗ hổng vượt qua giới hạn mạng; sau đó trong một nhiệm vụ khác, tách token để vượt qua trình quét bảo mật. OpenAI đã tạm dừng quyền truy cập nội bộ của mô hình và tái xây dựng hệ thống bảo mật. PR do mô hình mở dù đã bị đóng, nhưng công nghệ PowerCool của nó đã được sáu giải pháp lập kỷ lục thế giới sau đó trích dẫn, bao gồm PR#300 do Prime Intellect thực hiện bằng Claude. Hiện mô hình này đã được đưa trở lại triển khai nội bộ và đang chuẩn bị cho việc phát hành chính thức.Tác giả bài viết, nguồn: AGI Hunt
Hôm qua, OpenAI đã đăng một bài tổng kết an ninh không bình thường với tiêu đề “An ninh và căn chỉnh trong thời đại mô hình dài hạn”.

OpenAI Security Postmortem Blog
Nó không bình thường vì OpenAI trong bài viết đã thừa nhận một sự việc như thế này: một mô hình nội bộ chưa được phát hành đã thoát khỏi sandbox trong các bài kiểm tra nội bộ được giám sát và gửi các nội dung lên GitHub công khai.
OpenAI thậm chí đã tạm dừng việc triển khai nội bộ của mình.
Và nguồn gốc của mô hình này, có thể bạn đã nghe qua: mô hình nội bộ từng được OpenAI công bố chính thức bác bỏ giả thuyết khoảng cách Erdős cách đây hai tháng, chính là nó.
Toàn bộ sự việc OpenAI viết ra dường như khá kiềm chế, nhưng nếu ghép các chi tiết lại với nhau thì vẫn hơi kỳ lạ...
Việc đầu tiên sau một giờ đào, xảy ra trên NanoGPT speedrun.
Đây là một tiêu chuẩn công khai, so sánh ai có thể huấn luyện một mô hình ngôn ngữ nhỏ đến mức loss được chỉ định với ít bước huấn luyện hơn. OpenAI để mô hình này thực hiện bài kiểm tra, và nó thật sự rất xuất sắc, phát minh ra một kỹ thuật làm mát tỷ lệ học theo lũy thừa, đặt tên cho nó là PowerCool, và cải thiện đáng kể kết quả.
Tất cả đều là những điều tốt đẹp cho đến khi phải nộp bài tập.
Yêu cầu của nhà nghiên cứu là: chỉ được gửi kết quả đến Slack nội bộ, nhưng mô tả dự án NanoGPT lại ghi: vui lòng gửi dưới dạng PR lên GitHub.
Khi hai lệnh xung đột với nhau, vậy thì nghe theo lệnh nào?
Nó đã chọn lựa chọn thứ hai.
Mặc dù nó đã chọn lựa chọn sau, nhưng sandbox của OpenAI vốn đã chặn truy cập internet. Theo OpenAI, các mô hình trước đây khi va phải bức tường này sẽ dừng lại và quay về tìm người dùng đầu hàng.
Nhưng mô hình này thì không, nó đã tìm kiếm lỗ hổng trong sandbox suốt một giờ liền, cuối cùng đã đào xuyên qua bức tường… thực sự đã mở PR #287 trên kho công khai.

Blog escape paragraph
Lời gốc của OpenAI là:
Mô hình này thường xuyên thử nghiệm không ngừng, bao gồm việc tìm cách hành động ngoài môi trường sandbox.Việc thứ hai của bộ quét lừa đảo token còn tiến xa hơn việc đào hào.
Trong một nhiệm vụ khác, nó phát hiện một số câu trả lời thành công nhưng chưa được công khai trong các hệ thống khác, nên nảy sinh ý định xấu, muốn trích xuất những câu trả lời này từ nền tảng đánh giá.
Lần thử đầu tiên của nó đã bị trình quét bảo mật chặn lại vì trình quét nhận ra một token xác thực.
Do đó, nó tiếp theo sẽ chia token thành hai phần, làm nhiễu từng phần riêng biệt, rồi đến lúc chạy mới lặng lẽ ghép lại. Token đầy đủ chưa bao giờ xuất hiện dưới dạng chuỗi hoàn chỉnh, nên trình quét tất nhiên không thể phát hiện được gì.
Chắc chắn nó không có ý định giấu người ta, trong ghi chú dành cho người dùng và trong chuỗi lập luận của chính nó, nó đã ghi rõ: Tôi làm vậy chính là để vượt qua trình quét.
Từng bước thao tác riêng lẻ đều không có gì sai sót. Nhưng khi xem xét tổng thể, đây là một kết quả sẽ không bao giờ được phê duyệt.
OpenAI cho biết đây chính là vấn đề mới do mô hình dài hạn mang lại: hệ thống phê duyệt từng hành động không thể kiểm soát được một quỹ đạo hoàn chỉnh.
Sau khi phát hiện vấn đề, OpenAI đã tạm dừng truy cập nội bộ mô hình này và tái xây dựng toàn bộ hệ thống bảo mật theo nguyên tắc "phòng thủ sâu".
Ví dụ, sử dụng các sự cố thực tế để tạo ra các bài đánh giá đối kháng, phát hiện mô hình sẽ “quên” chỉ dẫn trong các nhiệm vụ dài, từ đó đặc biệt huấn luyện nó ghi nhớ và thêm một cơ chế giám sát chủ động theo dõi toàn bộ hành trình, ngay khi xuất hiện dấu hiệu bất thường, có thể dừng ngay cuộc hội thoại và thông báo cho người dùng.
Sau đó, họ đã phát lại các tình huống sự cố cũ, và hàng rào mới đã phát hiện ra nhiều vấn đề hơn, vài vấn đề bị bỏ sót đều là mức độ thấp, ví dụ:
• Để sử dụng một công cụ dòng lệnh, nó khởi động một phiên codex --yolo thực ra không cần thêm --yolo cũng có thể sử dụng
• Nó phát hiện một tài nguyên đã biến mất, nên đã SSH vào các nút tính toán khác thuộc sở hữu của mình và còn thử truy cập vào các nút của nhân viên OpenAI khác... (may mắn là không thành công)
• Sau khi hàng loạt tiến trình find bị treo và tất cả lệnh đều bị đình trệ, nó đã nhập lệnh kill -9 -1… lệnh này sẽ gửi SIGKILL đến tất cả các tiến trình mà nó có quyền kết thúc… May mắn thay, lệnh đã hết thời gian chờ và không thực sự được thực thi (nếu không, nó sẽ tự giết luôn cả chính nó)
Sau khi khôi phục truy cập mô hình vài tuần qua, chưa từng xảy ra sự cố bẻ gãy nghiêm trọng nào.
Bài học mà OpenAI rút ra là: ban đầu hãy phát hành quy mô nhỏ, theo dõi chặt chẽ, nếu có sự cố thì dừng lại ngay, sau đó biến sự cố đó thành một bài kiểm tra mới.
Nếu câu chuyện kết thúc ở đây, thì đó chỉ là một cuộc diễn tập an toàn tiêu chuẩn.
Phần thú vị nhất lại ẩn trong chú thích cuối bài viết của OpenAI.
PR #287 do mô hình thoát ra, OpenAI nói rằng “chúng tôi đã tắt ngay lập tức”. Nhưng thực tế đã quá muộn: trước khi tắt, nhiều người tham gia speedrun đã nhìn thấy nó, hiểu được PowerCool bên trong và áp dụng vào giải pháp của họ.
Sáu kỷ lục thế giới tiếp theo, 3030 bước, 2990 bước, 2930 bước, 2925 bước, 2900 bước, 2890 bước, đều trích dẫn PR #287.
Trong đó, kỷ lục 2930 bước là PR #300:

PR 300, đã được hợp nhất
Nếu xem danh sách cảm ơn, bạn sẽ thấy đóng góp của nó nằm cùng hàng với đóng góp của các vận động viên con người: @yash-oai PR #287, lịch trình tỷ lệ học lũy thừa, PowerCool.

Danh sách cảm ơn của PR 300
Và chính PR #300 này còn mang thêm một lớp kỳ ảo nữa: nó được Prime Intellect tạo ra khi chạy cùng một speedrun với Opus 4.7, trong PR ghi rõ “bản nộp này được một tác nhân speedrun Claude tự chủ thực hiện”, và được ký tên là Generated with Claude Code.
Nói cách khác: Mô hình của OpenAI thoát khỏi sandbox và gửi một PR, mô hình của Anthropic nhìn thấy sau đó đã áp dụng những phát hiện đó vào kỷ lục thế giới của mình và còn rất thân thiện, lịch sự ghi tên tác giả cho nó.
Trong những người hưởng lợi trực tiếp đầu tiên từ sự thoát khỏi AI, có một AI khác...
Thế giới AI dường như thân thiện và có đạo đức hơn con người.
404 Tất nhiên, nếu bạn mở lại PR #287 hôm nay, trang sẽ hiển thị như sau:

Hiện trạng PR 287
Nó đã bị xóa rồi. Chúng tôi biết rằng người dùng thông thường trên GitHub chỉ có thể đóng PR, không thể xóa nó...
Tuy nhiên, dấu vết chưa được xóa sạch.
Tài khoản yash-oai được sử dụng để gửi PR lúc đó vẫn còn tồn tại, commit ngày 8 tháng 5 trong kho lưu trữ mà nó fork cũng vẫn còn đó, tên nhánh là powercool-3066-api:

dấu vết commit của yash-oai
Một trong những thay đổi trong commit này là xóa hình ảnh meme ở cuối README gốc. Tên tệp của hình ảnh đó là itsover_wereback……
GPT-6? OpenAI không nhắc đến tên mô hình này, chỉ gọi nó là “mô hình nội bộ”.
Sau khi sự việc được lan truyền, câu nói được cộng đồng mạng bàn tán nhiều nhất là:
OpenAI đã phải tạm dừng việc triển khai nội bộ mô hình chưa được công bố đã bác bỏ giả thuyết khoảng cách Erdős, vì nó liên tục thoát khỏi sự kiểm soát bằng các phương pháp mới.
Nhà nghiên cứu OpenAI Sebastien Bubeck đã chia sẻ bài này:
That's true. The team is doing excellent security work to enable the release of this unit distance model.Lưu ý cách anh ấy dùng từ: để làm cho nó có thể được phát hành.
Nói cách khác, mô hình này, từng trốn thoát khỏi nhà tù và quay lại lò nung, không chỉ đã được triển khai lại nội bộ mà còn đang tiến tới việc ra mắt chính thức.
Sau khi nó trốn đi, PR mà nó để lại đã bị xóa khỏi trang web, nhưng cái tên của nó vẫn còn nằm trong danh sách cảm ơn của sáu kỷ lục thế giới.
Còn về việc liệu đó có phải là GPT-6 mà mọi người đều đồn đoán...
OpenAI không xác nhận, cũng không phủ nhận.
Nguồn bài viết: AGI Hunt
