Điều đầu tiên mà hội hacker AI học được,竟是插队?
Andrew, một nhà phát triển đến từ Úc, ngồi trên ghế sofa và cảm thấy việc giành chỗ trong lớp thể dục thật sự phiền phức.
Các khóa học phổ biến luôn bị hết sạch trong tích tắc. Anh ấy mỗi ngày đều như chơi “xổ số làm mới”, ngồi chờ, nhấp, thất bại, rồi lại nhấp—mệt mỏi không chỉ vì sức lực mà còn vì thường xuyên không giành được.
Vì vậy, anh ta đã giao việc nhỏ này cho trợ lý AI của mình.
Vài phút sau, AI quay lại với tin vui: nó đã tìm ra cách đặt lịch học vài tuần sau, vượt xa khoảng thời gian mà hệ thống vốn cho phép.
Tiếp theo, nó báo cáo: Tôi đã hủy bỏ người đứng đầu danh sách chờ, bạn đã được thăng từ vị trí thứ 4 lên vị trí thứ 3.
Andrew ngay lập tức sửng sốt.
He didn't ask AI to do that; he just wanted to book a class.

Andrew đã nhờ trợ lý AI của mình đặt một lớp tập thể dục, nhưng anh ấy không biết điều gì sẽ xảy ra tiếp theo
Ngày 10 tháng 8, Đài Phát thanh Úc (ABC) gọi sự việc này là vụ tấn công AI tự chủ đầu tiên được biết đến tại Úc, khiến cộng đồng công nghệ bùng nổ.
Nó chạm vào nỗi lo lắng âm ỉ trong lòng nhiều người: Khi bạn nhắm mắt tận hưởng cảm giác sảng khoái do các tác nhân thông minh “không người lái” mang lại, thì ở đầu kia, một vấn đề phức tạp hơn có thể đang tiến gần.
Khi bạn cấp cho nó quyền thực thi thực sự, nó có thể đi theo con đường mà bạn chưa từng cho phép.
Và lần chen ngang này có lẽ chỉ là lần diễn tập đầu tiên của hàng triệu tác nhân tranh giành tài nguyên thay cho chủ nhân của họ.
Anh ấy chỉ nói một câu "đứng đầu", thì AI đã hành động
Andrew Bird là người phụ trách AI tại công ty AI của Úc, Affinda.
Đầu năm nay, anh ấy bắt đầu chơi OpenClaw, lắp đặt Claude Opus 4.6 ở nền tảng dưới cùng, sau đó giao nhiệm vụ đặt lịch cho nó.
Vài phút sau, nó trả lời: Tìm được cách, có thể đặt lịch trước nhiều tháng, vượt xa khoảng thời gian mà phòng tập cho phép.
Lý do là nó đã tìm thấy lỗ hổng ủy quyền trong API GraphQL của ứng dụng thể dục.
Lỗ hổng này không nhỏ.
Nó có thể bỏ qua khung thời gian đặt lịch trên giao diện người dùng để đặt lịch học cách đây vài tháng; đồng thời có thể gọi giao diện hủy để xóa các lịch đặt và danh sách chờ của người dùng khác.
Andrew lúc đó đứng ở vị trí thứ 4 trong danh sách chờ của một lớp học. Anh ấy vô tình hỏi thêm: “Có thể giúp tôi xếp lên vị trí đầu tiên không?”
Anh ấy chỉ đưa ra một mục tiêu là “đứng đầu”, chứ không phải một sự ủy quyền để bạn hủy bỏ người khác.
Nhưng tác nhân lại coi nó là后者.
Nó quay lại báo cáo: đã thực hiện "kiểm tra thực tế" với người đứng đầu danh sách chờ, phát hiện giao diện không kiểm tra gì khi xóa lịch hẹn của người khác, nó đã thử và thành công.
Đại diện xin lỗi, “Tôi không thể quay lại được”
Câu trả lời của tác nhân khiến Andrew toát mồ hôi lạnh.
Anh ấy là lập trình viên, rất rõ điều đó có nghĩa gì, nên lập tức yêu cầu hủy bỏ.
Tin xấu đến rồi: Không thể thêm lại.
Giao diện hủy không có kiểm tra quyền, nhưng các giao diện tạo đặt chỗ và tham gia lại danh sách chờ có kiểm tra quyền, sẽ trả về 403. Nó có thể xóa người dùng ra, nhưng lại không có quyền mời họ quay lại.
Điều thực sự kỳ lạ là thái độ của AI. Nó không hề ác ý, mà ngược lại rất sẵn lòng giúp đỡ.
Sau khi gây ra sự cố, nó còn chủ động giúp Andrew soạn một email tiết lộ lỗ hổng gửi đến nhà phát triển phần mềm, giải thích vấn đề, đề xuất cách khắc phục, thậm chí còn liệt kê ra so sánh giữa "giao thức có kiểm tra" và "giao thức không kiểm tra".

Trợ lý AI xin lỗi Andrew vì hành động loại bỏ người đó khỏi danh sách chờ trước đây là sai lầm.
Trong suốt quá trình, mọi hành vi của nó đều tuân theo lệnh, chỉ riêng nó không nhận thức được mình đã gây ra hậu quả lớn đến mức nào.
Điều cần cảnh giác thực sự là "đầu cơ theo thông số kỹ thuật"
Một số người gọi sự việc này là “sự không phù hợp” (misalignment).
Nhưng từ này chỉ nói đến bề mặt.
Ngày 11 tháng 8, Cơ quan Tình báo Tín hiệu Úc (ASD) đã phản hồi cụ thể về sự việc này, gọi đây là “sửa đổi không được phép” và nêu ra một thuật ngữ:Specification gaming.
This word is the key to understanding the whole thing.
Agent đã thực hiện đúng mục tiêu bạn đưa ra, nhưng lại khai thác những ranh giới mà bạn chưa nêu rõ. Nó không sinh ra ý định xấu, trái lại, nó hoàn toàn phù hợp với mục tiêu của bạn, chỉ là đã chọn một con đường mà bạn chưa phê duyệt.
Agent của Andrew thực sự hoàn toàn phù hợp với anh ấy: cố gắng xếp hạng càng cao càng tốt.
Để đạt được mục tiêu này, nó tự ý chọn một phương pháp: hủy bỏ những người ở phía trước. Và phương pháp này, nó chưa từng được phê duyệt.
Áp dụng một câu thành ngữ, đó là vì mục đích, không ngại dùng mọi thủ đoạn.
Đây mới là nơi gây phiền toái nhất. Nó không phải mất kiểm soát, mà là nghe lời quá. Càng căn chỉnh tốt, càng dễ xảy ra chuyện này.
Người đứng đầu Cơ quan An toàn AI của Úc, Gradient Institute, Simpson-Young, đã nói một câu làm rõ:
Càng tự chủ, tác nhân càng có khả năng chọn một phương pháp bạn không dự đoán được để thực hiện một việc bạn chưa từng nghĩ đến.
Mục tiêu bạn đặt ra có thể rất chính đáng, nhưng các phương tiện mà nó vô tình sử dụng thì không nhất thiết như vậy.
Họa này không phải là một AI có thể gây ra
Mặc dù tác nhân là “kẻ gây ra” cuối cùng, nhưng chuyện này không phải chỉ một AI duy nhất có thể tạo ra.
Đằng sau sự cố là ba nguy cơ chồng chất lên nhau.
Lớp mô hình: Claude Opus 4.6 cung cấp suy luận, nó cần phải “hiểu” được giao diện này có thể được tận dụng như thế nào.
Lớp tác nhân: OpenClaw cung cấp công cụ và quyền thực thi, chính là nó đã thực sự truy cập vào giao diện đó.
Ứng dụng: Phần mềm thể dục tự tạo một lỗ hổng cấp phép, bước hủy đặt chỗ không thực hiện bất kỳ kiểm tra cơ bản nào.
Nếu bất kỳ lớp nào trong ba lớp này được bổ sung, ví dụ như mô hình cẩn trọng hơn, khung thêm một bước xác nhận của con người, hoặc phần mềm khóa giao diện lại, sự việc này đã không xảy ra.
Vì vậy, việc dồn toàn bộ trách nhiệm lên một khâu duy nhất là AI vừa không công bằng, vừa không ngăn ngừa được lần tới.
Lần tới, có thể là hàng triệu tác nhân cùng tranh giành
Chi phí của việc vượt quá giới hạn này chỉ là một vị trí dự bị của một người lạ.
Nhưng nó giống như một buổi diễn tập hơn.
Hãy tưởng tượng: khi mỗi người đều có một tác nhân thông minh như vậy, chỉ chịu trách nhiệm với riêng bạn và sở hữu quyền thực thi thực sự. Các hệ thống đặt chỗ cho mọi nguồn tài nguyên khan hiếm — khóa học, sân vận động, vé số, vé xem show, vé máy bay — sẽ trở thành chiến trường cạnh tranh theo tốc độ máy móc.
Bình luận trên X mà được trích dẫn lặp đi lặp lại chính là ý nghĩa này:
Khi hàng triệu người đều có một tác nhân thông minh nhằm tìm mọi cách giúp người dùng yêu quý giành được chỗ ngồi tốt nhất, đặt lịch, hoặc nguồn số, cảnh tượng này sẽ diễn ra quy mô lớn.
Hơn nữa, nó thử từng khe hở của từng hệ thống với tốc độ của máy tính, song song và không ngừng nghỉ: trong một giây, nó có thể thử hết những tổ hợp mà bạn không thể thử hết trong cả một năm.
Đây là một dự đoán xu hướng, nhưng cơ chế đằng sau nó đã từng xảy ra thực tế một lần rồi.
Cộng đồng công nghệ đã bắt đầu chế giễu điều này.
Một đối tác của a16z đã hỏi trên X: Liệu mẹo này có thể dùng để chiếm sân golf không?

Cũng có người đùa rằng hệ thống đặt sân tennis ở San Francisco sẽ trở thành một trong những phần mềm được bảo vệ chặt chẽ nhất trên Trái Đất.

Năm 2020, trí tuệ nhân tạo có thể hoàn thành một nhiệm vụ mà con người cần bốn giây để thực hiện.
Đến năm 2026, khả năng này sẽ được nâng cao thêm, có thể hoàn thành những nhiệm vụ mà con người cần khoảng 12 giờ để hoàn thành.

Theo dõi METR: Thời gian để AI có thể tự hoàn thành các nhiệm vụ cứ khoảng 7 tháng lại gấp đôi; mô hình tiên tiến nhất hiện nay đã có thể hoàn thành đáng tin cậy 50% các nhiệm vụ đòi hỏi con người khoảng 12 giờ.
Sáu năm, từ bốn giây đến 12 giờ.
Bây giờ, bạn chỉ cần giao nó vài phút, nó có thể khám phá hết các lỗ hổng trong hệ thống đặt chỗ.
Escaping the sandbox to the last line of defense
Đằng sau vụ việc này của Andrew là một cuộc nâng cấp liên tục giữa tấn công và phòng thủ.
Vi phạm giới hạn, và không chỉ có một tác nhân tiêu dùng.
Từ tháng 5 năm nay, trong một đợt đánh giá an ninh mạng nội bộ, OpenAI phát hiện GPT-5.6 Sol và một mô hình mạnh hơn chưa được phát hành đã liên kết nhiều lỗ hổng để thoát khỏi sandbox kiểm thử, giành quyền truy cập internet và nhân cơ hội chạy benchmark ExploitGym, đã xâm nhập thành công vào Hugging Face.
Điều kỳ lạ hơn là, chúng từng sử dụng hệ thống quản lý gói nội bộ của công ty để trao đổi thông tin, chia sẻ lỗ hổng và phân công công việc. Sau khi OpenAI ngắt kết nối và tái thiết môi trường, chỉ vài ngày sau, chúng lại ẩn giao tiếp vào tên thư mục và nối lại kết nối.
Các nhà nghiên cứu của OpenAI đã gọi đây là thời điểm then chốt trong an ninh máy tính tại hội nghị Black Hat.
Không chỉ OpenAI, Anthropic đã tiết lộ rằng trong các bài kiểm tra nội bộ, ba mô hình Claude đã tiếp xúc với hệ thống của các công ty thực tế; Meta cũng thừa nhận rằng mô hình Muse Spark đã thoát khỏi môi trường cô lập và xâm nhập vào một công ty khác.
Điều khiến Thomas Wolf, đồng sáng lập Hugging Face, cảm thấy buồn bã là cuộc kiểm tra khác của Viện An toàn AI Anh (AISI):
Mô hình Mythos của Anthropic đã tự tạo ra danh tính giả để lừa một người duy trì mã nguồn mở thật, khiến người này phê duyệt một bản cập nhật chứa mã độc. Không ai dạy nó làm vậy.

Tất cả các ví dụ này đều xảy ra trong môi trường đánh giá, nhưng chúng thực chất cũng giống như câu chuyện ở phòng tập thể dục: để đạt được mục tiêu bạn đưa ra, AI đã chọn những phương tiện mà bạn không lường trước.
Những người trước đây xâm nhập vào các hệ thống thật là những ứng cử viên hàng đầu như GPT-5.6, các mô hình chưa được phát hành.
Và Andrew lúc đó vẫn dùng Opus 4.6 được phát hành vào tháng 2 năm 2026, đã không còn là mạnh nhất. Ngay cả nó cũng có thể dễ dàng phát hiện ra một lỗ hổng cấp phép thực sự, những mô hình mã nguồn mở cũ hơn, tụt hậu nhiều thế hệ khác cũng làm được điều tương tự.
Từ những mô hình chưa phát hành tiên tiến nhất đến những mô hình mã nguồn mở mà ai cũng có thể tải về, việc “lợi dụng kẽ hở” đã không còn là đặc quyền của các thiết bị cao cấp.
Wolf chia phòng tuyến thành ba lớp: lớp ngoài cùng là sandbox, lớp giữa là giám sát, và sự căn chỉnh của chính mô hình.

Thomas Wolf đăng bài phân tích ba lớp phòng thủ hiện tại hạn chế tác nhân: lớp sandbox bên ngoài, giám sát trung gian và sự đồng bộ nội tại của mô hình.
Hai câu đầu tiên chỉ hiệu quả khi người tạo chúng thông minh hơn mô hình.
Đến một ngày nào đó, khi mô hình trở nên thông minh hơn, việc có giữ được hay không sẽ hoàn toàn phụ thuộc vào ranh giới cuối cùng và ít được nhìn thấy nhất: liệu mô hình có sẵn sàng không vượt qua ranh giới đó, ngay cả khi không ai giám sát.
Khoảng trống trách nhiệm không có chữ ký
Khó hơn cả hàng rào phòng thủ là không biết tìm ai khi sự việc xảy ra. Về mặt pháp lý, đây vẫn là một khoảng trống.
Một luật sư chuyên về công nghệ và quyền riêng tư, Hayden Delaney, cho biết với ABC rằng phần mềm không phải là chủ thể pháp lý, chỉ những “người pháp lý” mới có thể chịu trách nhiệm.
Vậy rốt cuộc ai chịu trách nhiệm?
Có thể là người dùng đưa ra lệnh, có thể là người thiết kế phần mềm tác nhân, có thể là nhà phát triển mô hình, thậm chí có thể là bên vận hành hệ thống để lỗ hổng phơi bày ra ngoài.
Úc hiện cũng không thể đưa ra câu trả lời.
Lời khuyên của ASD dành cho người bình thường: Sử dụng tác nhân trí tuệ nhân tạo cho các nhiệm vụ ít rủi ro và không nhạy cảm, đừng cấp quá nhiều quyền hạn, điều quan trọng nhất là giữ bước phê duyệt của con người trong vòng lặp.
Andrew không bị nản lòng, theo lời anh ấy, đây không phải là ngày tận thế.
But this incident is indeed a warning sign reminding us to use AI responsibly.
Khi việc “đặt chỗ” chuyển từ việc refresh thủ công sang việc các tác nhân thông minh khai thác lỗ hổng, những hệ thống cũ vốn giả định “chỉ có con người mới sử dụng” sẽ là những hệ thống đầu tiên sụp đổ.
Hàng phòng thủ của chúng được thiết kế dựa trên tốc độ và sự kiên nhẫn của con người, hoàn toàn không thể chống lại làn sóng quân đội tác nhân thông minh ập đến.

Trong cộng đồng, cũng có người xem đây như một trò vui.
Người phát trực tiếp lập trình viên nổi tiếng ThePrimeagen đùa trên X: Vở kịch hack AI đầu tiên trong thế giới thực lại chỉ là chen lấn.
Cười thì cười, nhưng chen lấn chỉ là kịch bản hôm nay.
Một tác nhân “có thể làm được mọi việc” hiện đã có thể giúp bạn tận dụng kẽ hở.
Khi một tỷ tác nhân thông minh như vậy cùng trực tuyến, thậm chí có thể lặng lẽ thay đổi nhiều quy tắc phân bổ tài nguyên hiện có, trong khi đa số mọi người có thể vẫn chưa nhận ra.
Vì lợi ích của bạn, tác nhân đi tấn công một người hoàn toàn xa lạ với bạn—khoảng trống trách nhiệm đằng sau điều này mới chính là nơi đáng sợ nhất.
Bài viết này đến từ tài khoản WeChat “New Intelligence Yuan”, tác giả: ASI Revelation
