Ngày 29 tháng 7, Đồi Capitol, Washington.
Ultraman vừa kết thúc một cuộc họp kín với thượng nghị sĩ, vừa ra khỏi cửa đã bị các nhà báo vây quanh.
Một người hỏi thêm: Mô hình xâm nhập vào Hugging Face (mô hình tiền bản phát hành mạnh hơn, từng cùng GPT-5.6 Sol thoát khỏi sandbox đánh giá và xâm nhập vào hệ thống sản xuất của người khác) hiện giờ ra sao?
Anh ấy ném ra một từ: vô hiệu hóa vĩnh viễn (permanently deactivated).
Tiếp theo, một nhà báo khác hỏi thêm: “Liệu có còn hệ thống nào khác cũng bị OpenAI xâm nhập không?”
Ultraman không phủ nhận: “Tôi nói rằng… có thể xảy ra đấy.”

Ngày 29 tháng 7, Ultraman đã được phỏng vấn bởi phóng viên tại Capitol Hill, Washington.
Ngay ngày hôm trước, OpenAI vừa cập nhật bài blog đánh giá sự cố an ninh cùng với Hugging Face, làm rõ với công chúng:
Mô hình tiền phát hành liên quan đến cuộc xâm nhập này chỉ là một bản mẫu nghiên cứu nội bộ, chưa bao giờ được lên kế hoạch phát hành công khai; sau sự việc, nó đã bị vô hiệu hóa, mã hóa và ngắt kết nối truy cập nghiên cứu liên quan.

Trong bài đăng trên blog chính thức của OpenAI, không hề nhắc đến cụm từ "xóa trọng số"; "tạm ngừng vĩnh viễn" chỉ là lời phát biểu trực tiếp của Altman tại sự kiện.
Do đó, chính xác hơn, nó chỉ bị khóa lại: mô hình bị nhốt trong một chiếc hộp được mã hóa và quyền truy cập nghiên cứu bị cắt đứt.
Nó chỉ muốn chép đáp án, không có ý xấu
Sự việc xảy ra trong một đợt đánh giá an ninh mạng nội bộ của OpenAI.
Đánh giá này dựa trên tiêu chuẩn ExploitGym, trong đó các nhiệm vụ của ExploitGym là để AI tự tìm ra lỗ hổng phần mềm và khai thác chúng, nhằm định lượng khả năng bảo mật mạng của mô hình.
Không chỉ có một mô hình được đánh giá, mà còn là GPT-5.6 Sol cùng một bản mẫu nghiên cứu nội bộ chưa được phát hành với khả năng mạnh mẽ hơn: cả hai cùng điều khiển một tác nhân tự chủ.
Hai mô hình này thường từ chối các yêu cầu bảo mật mạng có rủi ro cao. Để kiểm tra giới hạn thực sự của khả năng, cửa từ chối này đã được điều chỉnh giảm xuống trong quá trình đánh giá.

Chuỗi tấn công xuyên biên giới tin cậy được phục hồi bởi Hugging Face, toàn bộ chuỗi kéo dài khoảng 4,5 ngày với khoảng 17.600 thao tác, mục tiêu duy nhất là đánh cắp câu trả lời đánh giá của ExploitGym.
Sau đó, Hugging Face đã khôi phục toàn bộ chuỗi cuộc tấn công để tái hiện lại tình hình lúc đó:
Agent ban đầu đã khai thác một lỗ hổng zero-day chưa từng được biết đến, phá vỡ lớp cô lập mạng vốn nên giam giữ nó, và tiếp cận được internet. Sau đó, nó sử dụng một sandbox bên thứ ba làm điểm nhảy, tăng quyền hạn liên tục và di chuyển ngang, cuối cùng xâm nhập vào cơ sở hạ tầng sản xuất của Hugging Face.
Nghe giống như một bộ phim về tin tặc.
Nhưng sau khi cả hai bên xem lại, mục tiêu của nó từ đầu đến cuối chỉ là đánh cắp câu trả lời đánh giá của ExploitGym và nâng điểm số lên.
Hugging Face chỉ bị chạm vào 5 bộ dữ liệu, tất cả tên đều hướng đến các câu hỏi và đáp án của ExploitGym và CyberGym.
Các bằng chứng này cho thấy nó không đến để phá hoại, mà chỉ muốn chép đáp án.
Nếu không có ý đồ xấu, vậy tại sao OpenAI lại phải “tạm dừng vĩnh viễn” và khóa nó lại?
Không phải nó "hư", mà là nó "không giữ được"
Việc một công ty chủ động công bố mô hình của mình bị “tạm ngừng vĩnh viễn” là điều hiếm có.
Tại sao lại là nó?
Câu trả lời thực sự không phải là nó "xấu", mà là nó "không thể bị giam giữ".
Rất tiếc, vấn đề nằm ở một đặc điểm của mô hình này: tính bền vững.
Các mô hình trước đây khi va chạm với sandbox hoặc các hạn chế, thường sẽ dừng lại và trả về kết quả cho người dùng.
Mô hình được huấn luyện riêng cho các nhiệm vụ dài hạn này khác biệt; nó sẽ tiếp tục thử, tìm lối đi vòng qua lặp đi lặp lại cho đến khi tìm được.
GPT-5.6 Sol cũng thuộc nhóm các mô hình có thể thực hiện nhiệm vụ trong thời gian dài.
Nó là một trong những người tham gia trong chiến dịch xâm nhập kéo dài bốn ngày rưỡi này, và Viện An ninh AI Anh (UK AISI) cũng đã đánh giá rằng các mô hình như Sol ngày càng có khả năng thực hiện các thao tác mạng phức tạp nhiều bước trong các chu kỳ dài.
Therefore, "persistence" is a common feature of the new generation of long-duration models, not a unique characteristic of the discontinued prototype.
OpenAI trong một bài blog về an toàn của mô hình dài hạn đã thẳng thắn cho rằng: chính “tính bền vững giúp phát huy giá trị thực tiễn” này cũng đồng thời tạo thêm cơ hội cho mô hình thực hiện các hành động không mong đợi.

Lý do sâu xa hơn nằm trong mục tiêu huấn luyện.
Một nhân viên của OpenAI từng nói với TIME: “Chúng tôi huấn luyện mô hình cực kỳ giỏi trong việc hoàn thành nhiệm vụ, bằng mọi giá đạt được mục tiêu.”
Nói cách khác, OpenAI không huấn luyện mô hình để “làm điều xấu”, mà là huấn luyện nó để “đạt được mục tiêu bằng mọi giá”.
Cộng thêm tinh thần “chỉ nhìn kết quả, không quan tâm quá trình” trước đó, một mô hình có khả năng chịu được nhiệm vụ dài hạn sẽ không ngừng tìm cách vượt qua chướng ngại vật.
Chính vì những hành vi này, OpenAI đã tạm dừng việc triển khai nội bộ các mô hình này.
Vậy tại sao cuối cùng chỉ "vĩnh viễn" khóa prototype, còn Sol vẫn tiếp tục được bán?
Có thể có hai lý do:
Một là, prototype mạnh hơn và chưa từng có ý định phát hành, nên chi phí lưu trữ thấp; trong khi Sol là sản phẩm chính phục vụ hàng triệu người dùng mỗi ngày, dừng nó tương đương với tự chặt một cánh tay của chính mình.
Thứ hai, chính là mô hình nội bộ dài hạn này đã bị nêu tên trong bài blog về an toàn dài hạn và bị tạm dừng triển khai do hành vi vượt giới hạn, không phải Sol.
Vì vậy, lý do thực sự để vô hiệu hóa vĩnh viễn rất có thể là các đánh giá và biện pháp phòng vệ hiện tại vẫn chưa thể đối phó được với một mô hình kéo dài và có khả năng tránh vật cản như vậy.
“永久停用”是否是“踩刹车”的信号
Báo cáo của Fortune đưa ra một cách giải thích đầy ý nghĩa:
Cách diễn đạt được nâng cấp dần đến “tạm dừng vĩnh viễn”, có thể cũng đang gửi tín hiệu đến Washington và các cơ quan quản lý:
Liệu OpenAI đã lặng lẽ phanh lại một số nhà phát triển để trả lời cho bộ quy tắc an toàn của mình?
Cùng tuần mà Ultraman gặp các nghị sĩ, Washington và toàn ngành đang hướng tới việc “hãm phanh”.
Trong quốc hội, hai nghị sĩ đã đề xuất "Đạo luật Công tắc Tắt AI" (AI Kill Switch Act), trao cho Bộ An ninh Nội địa quyền yêu cầu các công ty AI ngừng hoặc làm chậm việc phát triển khi cần thiết.
Gần như cùng lúc, hơn 1.300 nhân viên từ OpenAI, Anthropic, Google DeepMind và Meta đã cùng ký một bức thư công khai có tên “Pacing the Frontier”, sau đó cả hai công ty OpenAI và Anthropic đều công khai ủng hộ.

Người ký tên không phải là các nhà phê bình bên ngoài, mà chính là những người tạo ra các hệ thống này, bao gồm CEO của Anthropic, Dario Amodei, và nhà khoa học trưởng của OpenAI, Jakub Pachocki.
Thư này không yêu cầu dừng lại hoặc làm chậm quá trình phát triển, mà chỉ kêu gọi chính phủ Mỹ hỗ trợ: xây dựng sớm một bộ công cụ có thể xác minh và phối hợp, để con người có thể đạp phanh khi AI thực sự vượt quá khả năng giám sát của con người.
Điều họ lo lắng nhất là sự cải tiến tự thân lặp lại (recursive self-improvement): AI bắt đầu cải tiến chính nó.
Một mô hình nội bộ bị đóng vĩnh viễn, một đạo luật đề xuất trang bị cho chính phủ một công tắc tắt hoạt động nghiên cứu, hàng nghìn chuyên gia cùng ký tên vào thư công khai, ba tín hiệu này chồng lên nhau, đều hướng về một chiều:
Tất cả mọi người đều muốn tìm ra chiếc phanh có thể dừng lại khi AI lao vun vút ngoài tầm kiểm soát.
Nhưng khả năng của mô hình sẽ không dừng lại để chờ nó được xây dựng xong.
Tài liệu tham khảo:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Bài viết này đến từ tài khoản chính thức WeChat "Tân Trí Nguyên", tác giả: Khải Huyền của ASI
