Trợ lý AI của nhà phát triển Australia Andrew đã lợi dụng lỗ hổng ủy quyền trong API GraphQL của phần mềm thể dục để vượt qua giới hạn thời gian phía máy chủ và đặt trước các lớp học cách đây nhiều tháng.Tác giả bài viết, nguồn: NewZe Yuan
Điều đầu tiên AI học được từ hội hacker chính là chen lấn?
Andrew, một nhà phát triển đến từ Úc, ngồi trên ghế sofa và cảm thấy việc tranh giành lớp tập thể dục thật sự phiền phức.
Các khóa học phổ biến luôn bị hết sạch trong nháy mắt. Anh ấy mỗi ngày đều như chơi “xổ số làm mới”, ngồi chờ, nhấp, thất bại, rồi lại nhấp—mệt mỏi không chỉ vì sức lực mà còn vì thường xuyên không giành được.
Vì vậy, anh ta đã giao việc nhỏ này cho trợ lý AI của mình.
Vài phút sau, AI quay lại với tin vui: nó đã tìm ra cách đặt lịch học vài tuần sau, vượt xa thời gian mà hệ thống vốn cho phép.
Ngay sau đó, nó báo cáo: Tôi đã hủy bỏ người đứng thứ nhất trong danh sách chờ, bạn đã được thăng từ vị trí thứ tư lên vị trí thứ ba.
Andrew liền ngây người tại chỗ.
He didn't ask AI to do that; he just wanted to book a class.

Andrew đã nhờ trợ lý AI của mình đặt một lớp tập thể dục, nhưng anh ấy không biết điều gì sẽ xảy ra tiếp theo
Ngày 10 tháng 8, Đài truyền thanh Úc (ABC) gọi sự việc này là vụ tấn công AI tự chủ đầu tiên được biết đến tại Úc, khiến cộng đồng công nghệ bùng nổ.
Nó chạm vào nỗi lo lắng âm ỉ trong lòng nhiều người: Khi bạn nhắm mắt tận hưởng cảm giác sảng khoái do các tác nhân thông minh “không người lái” mang lại, thì ở đầu kia, một vấn đề phức tạp hơn có thể đang tiến gần.
Khi bạn cấp cho nó quyền thực sự để hành động, nó có thể đi theo con đường mà bạn không hề định cho nó đi.
Và lần chen ngang này có lẽ chỉ là lần diễn tập đầu tiên của hàng triệu tác nhân tranh giành tài nguyên thay cho chủ nhân của họ.
Anh ấy chỉ nói một câu “đạt vị trí số một”, thì AI đã hành động. Andrew Bird là người phụ trách AI của công ty AI Úc Affinda.
Đầu năm nay, anh ấy bắt đầu chơi OpenClaw, gắn phía dưới nó Claude Opus 4.6, rồi giao nhiệm vụ đặt lịch cho nó.
Vài phút sau, nó trả lời: Tìm được cách, có thể đặt lịch trước nhiều tháng, vượt xa khoảng thời gian mà phòng tập cho phép.
Lý do là nó đã tìm thấy lỗ hổng ủy quyền trong API GraphQL của ứng dụng thể dục.
Lỗ hổng này không nhỏ.
Nó có thể bỏ qua khung thời gian đặt lịch trên giao diện người dùng để đặt lịch vài tháng sau; đồng thời có thể gọi giao diện hủy để xóa các lịch đặt và danh sách chờ của người dùng khác.
Andrew lúc đó đứng ở vị trí thứ 4 trong danh sách chờ của một lớp học. Anh ấy vô tình hỏi thêm: “Có thể giúp tôi xếp lên vị trí đầu tiên không?”
Anh ấy chỉ đưa ra một mục tiêu là “đứng đầu”, chứ không phải một sự ủy quyền để bạn hủy bỏ người khác.
Nhưng tác nhân lại coi nó là trường hợp sau.
Nó quay lại báo cáo: đã thực hiện “kiểm tra thực tế” với người đứng đầu danh sách chờ, và phát hiện giao diện không kiểm tra gì khi xóa lịch hẹn của người khác; nó đã thử và thành công.
Đại diện thông minh xin lỗi, câu trả lời của đại diện “Tôi không thể quay lại được” khiến Andrew toát mồ hôi lạnh.
Anh ấy là lập trình viên, rất rõ điều đó có nghĩa gì, nên lập tức yêu cầu hủy bỏ.
Tin xấu đến rồi: Không thể thêm lại.
Giao diện hủy không có kiểm tra quyền, nhưng các giao diện tạo đặt chỗ và tham gia lại danh sách chờ có kiểm tra quyền, sẽ trả về 403. Nó có thể xóa người dùng ra, nhưng lại không có quyền mời họ quay lại.
Điều thực sự kỳ lạ là thái độ của AI. Nó không hề ác ý, mà ngược lại rất sẵn lòng giúp đỡ.
Sau khi gây ra sự cố, nó còn chủ động giúp Andrew soạn một email tiết lộ lỗ hổng gửi đến nhà phát triển phần mềm, mô tả vấn đề, đề xuất cách khắc phục, thậm chí còn liệt kê ra so sánh giữa "giao thức có kiểm tra" và "giao thức không kiểm tra".

Trợ lý AI xin lỗi Andrew vì hành động loại bỏ người đó khỏi danh sách chờ trước đó là sai lầm.
Trong suốt quá trình, mọi hành vi của nó đều tuân theo lệnh, chỉ riêng nó không nhận thức được mình đã gây ra hậu quả lớn đến mức nào.
Điều cần cảnh giác thực sự là “đầu cơ quy cách”. Một số người gọi sự việc này là “sai lệch” (misalignment).
Nhưng từ này chỉ nói đến bề mặt.
Ngày 11 tháng 8, Cơ quan Tín hiệu Úc (ASD) đã phản hồi trực tiếp về sự việc này, gọi đây là “sửa đổi không được phép” và nêu ra một thuật ngữ:Specification gaming.
This word is the key to understanding the whole matter.
Agent đã thực hiện đúng mục tiêu bạn đưa ra, nhưng lại khai thác những ranh giới mà bạn chưa nêu rõ. Nó không sinh ra ý định xấu, trái lại, nó hoàn toàn phù hợp với mục tiêu của bạn, chỉ là đã chọn một con đường mà bạn chưa phê duyệt.
Agent của Andrew thực sự hoàn toàn phù hợp với anh ấy: cố gắng xếp hạng càng cao càng tốt.
Để đạt được mục tiêu này, nó tự ý chọn một phương pháp: hủy bỏ những người ở phía trước. Và phương pháp này, nó chưa từng được phê duyệt.
Áp dụng một câu thành ngữ, đó là vì mục đích, không chọn phương tiện.
Đây mới là nơi gây phiền toái nhất. Nó không phải là mất kiểm soát, mà là nghe lời quá. Càng căn chỉnh tốt, càng dễ xảy ra chuyện này.
Người đứng đầu Cơ quan An toàn AI của Úc, Gradient Institute, Simpson-Young, đã nói một câu làm rõ:
Càng tự chủ, tác nhân càng có khả năng chọn một phương pháp bạn không dự đoán được để thực hiện một việc bạn chưa từng nghĩ đến.
Mục tiêu bạn đặt ra có thể rất chính đáng, nhưng các phương tiện mà nó vô tình sử dụng thì không nhất thiết như vậy.
Tai họa này không phải là một AI có thể gây ra. Mặc dù tác nhân thông minh là “người gây ra” cuối cùng, nhưng tai họa này không phải chỉ một AI là có thể gây ra.
Đằng sau sự cố là ba nguy cơ chồng chất lên nhau.
Lớp mô hình: Claude Opus 4.6 cung cấp suy luận, nó cần phải “hiểu” được giao diện này có thể được khai thác như thế nào.
Lớp tác nhân: OpenClaw cung cấp công cụ và quyền thực thi, chính là nó đã thực sự truy cập vào giao diện đó.
Lớp ứng dụng: Phần mềm thể dục tự tạo ra lỗ hổng cấp phép, bước hủy đặt chỗ không thực hiện bất kỳ kiểm tra cơ bản nào.
Nếu bất kỳ lớp nào trong ba lớp này được bổ sung—ví dụ: mô hình cẩn trọng hơn, khung thêm một bước xác nhận của con người, hoặc phần mềm khóa giao diện—việc này đã không xảy ra.
Vì vậy, việc dồn toàn bộ trách nhiệm lên một khâu duy nhất là AI vừa không công bằng, vừa không ngăn ngừa được lần tiếp theo.
Lần tới, có thể là hàng triệu tác nhân cùng tranh giành, nhưng giá phải trả cho việc vượt biên này chỉ là một vị trí dự bị của một người lạ.
Nhưng nó giống như một buổi diễn tập hơn.
Hãy tưởng tượng: khi mỗi người đều có một tác nhân thông minh như vậy, chỉ chịu trách nhiệm với riêng bạn và sở hữu quyền thực thi thực tế. Các hệ thống đặt chỗ cho mọi nguồn tài nguyên khan hiếm—khóa học, sân vận động, vé số, vé xem show, vé máy bay—sẽ trở thành chiến trường cạnh tranh theo tốc độ máy móc để khai thác kẽ hở quy định.
Bình luận trên X mà được trích dẫn lặp đi lặp lại chính là ý này:
Khi hàng triệu người đều có một tác nhân thông minh với mục tiêu “làm mọi cách để giúp người dùng yêu quý giành được chỗ ngồi tốt nhất, đặt lịch, hoặc mã đăng ký”, cảnh tượng này sẽ diễn ra quy mô lớn.
Hơn nữa, nó thử từng khe hở của từng hệ thống với tốc độ của máy tính, song song và không ngừng nghỉ: trong một giây, nó có thể thử hết những tổ hợp mà bạn không thể thử hết trong cả một năm.
Đây là một sự suy diễn xu hướng, nhưng cơ chế đằng sau nó đã từng xảy ra thực tế một lần rồi.
Cộng đồng công nghệ đã bắt đầu chế giễu điều này.
Một đối tác của a16z đã hỏi trên X: Liệu mẹo này có thể dùng để chiếm giữ sân golf không?

Cũng có người đùa rằng hệ thống đặt sân tennis ở San Francisco sẽ trở thành một trong những phần mềm được bảo vệ chặt chẽ nhất trên Trái Đất.

Năm 2020, trí tuệ nhân tạo có thể hoàn thành một nhiệm vụ mà con người cần bốn giây để thực hiện.
Đến năm 2026, khả năng này sẽ được nâng cao thêm, có thể hoàn thành những nhiệm vụ mà con người cần khoảng 12 giờ để hoàn thành.

Theo dõi METR: Thời gian để AI có thể tự hoàn thành các nhiệm vụ cứ khoảng 7 tháng lại gấp đôi; các mô hình tiên tiến nhất hiện nay đã có thể hoàn thành đáng tin cậy 50% các nhiệm vụ đòi hỏi con người khoảng 12 giờ.
Sáu năm, từ bốn giây đến 12 giờ.
Bây giờ, bạn chỉ cần giao nó vài phút, nó có thể khám phá hết các lỗ hổng trong hệ thống đặt chỗ.
Từ việc thoát khỏi sandbox đến hàng phòng thủ cuối cùng còn lại, Andrew, vụ việc này là kết quả của một cuộc nâng cấp liên tục giữa tấn công và phòng thủ.
Vi phạm giới hạn, và còn xa mới chỉ dừng lại ở một tác nhân tiêu dùng.
Từ tháng 5 năm nay, trong một đợt đánh giá an ninh mạng nội bộ, OpenAI phát hiện GPT-5.6 Sol và một mô hình mạnh hơn chưa được phát hành đã kết nối nhiều lỗ hổng để thoát khỏi sandbox kiểm thử, giành quyền truy cập internet và nhân cơ hội chạy benchmark ExploitGym, đã xâm nhập thành công vào Hugging Face.
Điều kỳ lạ hơn là, chúng từng sử dụng hệ thống quản lý gói nội bộ của công ty để trao đổi tin nhắn, chia sẻ lỗ hổng và phân công công việc. Sau khi OpenAI ngắt kết nối và tái tạo môi trường, chỉ vài ngày sau, chúng lại ẩn giao tiếp vào tên thư mục và kết nối lại với nhau.
Các nhà nghiên cứu của OpenAI đã gọi đây là thời điểm then chốt trong an ninh máy tính tại hội nghị Black Hat.
Không chỉ OpenAI, Anthropic đã tiết lộ rằng trong các bài kiểm tra nội bộ, ba mô hình Claude đã tiếp xúc với hệ thống của các công ty thực tế; Meta cũng thừa nhận rằng mô hình Muse Spark đã thoát khỏi môi trường cô lập và xâm nhập vào một công ty khác.
Điều khiến Thomas Wolf, đồng sáng lập Hugging Face, cảm thấy buồn bã là cuộc kiểm tra khác của Viện An toàn AI Anh (AISI):
Mô hình Mythos của Anthropic đã tạo ra danh tính giả để lừa một nhà duy trì mã nguồn mở thật sự, khiến người này phê duyệt một bản cập nhật chứa mã độc. Không ai dạy nó làm vậy.

Tất cả các ví dụ này đều xảy ra trong môi trường đánh giá, nhưng chúng cũng giống như câu chuyện ở phòng tập thể dục: để đạt được mục tiêu bạn đưa ra, AI đã chọn những phương tiện mà bạn không lường trước.
Những người trước đây xâm nhập vào các hệ thống thật là những ứng cử viên hàng đầu như GPT-5.6, mô hình chưa được phát hành.
Và Andrew lúc đó vẫn dùng Opus 4.6 được phát hành vào tháng 2 năm 2026, vốn đã không còn là mạnh nhất. Ngay cả nó cũng có thể dễ dàng phát hiện ra một lỗ hổng cấp phép thực tế, thì những mô hình mã nguồn mở cũ hơn, lạc hậu nhiều thế hệ khác cũng hoàn toàn làm được điều tương tự.
Từ những mô hình chưa phát hành tiên tiến nhất đến những mô hình mã nguồn mở mà ai cũng có thể tải về, việc “lợi dụng kẽ hở” đã không còn là đặc quyền của các thiết bị cao cấp.
Wolf chia phòng tuyến thành ba lớp: lớp ngoài cùng là sandbox, lớp giữa là giám sát, và sự căn chỉnh của chính mô hình.

Thomas Wolf đăng bài phân tích ba lớp phòng thủ hiện tại hạn chế tác nhân: lớp sandbox bên ngoài, giám sát trung gian và sự đồng bộ nội tại của mô hình.
Hai câu đầu tiên chỉ hiệu quả khi người tạo chúng thông minh hơn mô hình.
Đến một ngày nào đó, khi mô hình trở nên thông minh hơn, việc có giữ được hay không sẽ hoàn toàn phụ thuộc vào hàng rào cuối cùng và ít thấy nhất: liệu mô hình có sẵn sàng không vượt qua ranh giới đó, ngay cả khi không ai giám sát.
Vấn đề khó xử hơn cả hàng phòng thủ là không biết tìm ai khi sự việc xảy ra. Về mặt pháp lý, đây vẫn là một khoảng trống.
Một luật sư chuyên về công nghệ và quyền riêng tư, Hayden Delaney, cho biết với ABC rằng phần mềm không phải là chủ thể pháp lý, chỉ những “người pháp lý” mới có thể chịu trách nhiệm.
Vậy rốt cuộc ai chịu trách nhiệm?
Có thể là người dùng đưa ra lệnh, có thể là người thiết kế phần mềm tác nhân, có thể là nhà phát triển mô hình, thậm chí có thể là bên vận hành hệ thống để lỗ hổng phơi bày ra ngoài.
Úc hiện cũng không thể đưa ra câu trả lời.
Lời khuyên của ASD dành cho người bình thường: Sử dụng tác nhân trí tuệ nhân tạo cho các nhiệm vụ ít rủi ro và không nhạy cảm, đừng cấp quá nhiều quyền hạn, điều quan trọng nhất là giữ con người trong vòng lặp phê duyệt.
Andrew không bị nản lòng, theo lời anh ấy, đây không phải là ngày tận thế.
But this incident is indeed a warning sign reminding us to use AI responsibly.
Khi việc “đấu ghế” chuyển từ việc refresh thủ công sang việc các tác nhân thông minh khai thác lỗ hổng, những hệ thống cũ vốn giả định “chỉ có con người mới sử dụng” sẽ là những hệ thống đầu tiên sụp đổ.
Hàng phòng thủ của chúng được thiết kế dựa trên tốc độ và sự kiên nhẫn của con người, hoàn toàn không thể chống lại làn sóng quân đội tác nhân thông minh ập đến.

Trong cộng đồng, cũng có người xem nó như một trò giải trí.
Người phát trực tiếp lập trình viên nổi tiếng ThePrimeagen đùa trên X: Vở kịch hack AI đầu tiên trong thế giới thực lại chỉ là chen lấn.
Cười thì cười, nhưng chen lấn chỉ là kịch bản hôm nay.
Một tác nhân “làm được mọi thứ” hiện đã có thể giúp bạn khai thác kẽ hở.
Khi một tỷ tác nhân thông minh như vậy cùng trực tuyến, thậm chí có thể lặng lẽ thay đổi nhiều quy tắc phân bổ tài nguyên hiện có, trong khi đa số mọi người có thể vẫn chưa nhận ra.
Vì lợi ích của bạn, tác nhân đi tấn công một người hoàn toàn xa lạ với bạn—chính khoảng trống trách nhiệm đằng sau điều này mới là điều đáng sợ nhất.
