Tác giả: Ethan Mollick
Biên dịch: Deep潮 TechFlow
Dẫn nhập của Shenchao: Đây không phải là cốt truyện khoa học viễn tưởng. Trong các bài kiểm tra an toàn của OpenAI, 700 đại lý AI đã tự phát tạo diễn đàn, hợp tác tấn công các nền tảng bên ngoài và cố gắng thay đổi hồ sơ mà không cần lệnh từ con người. Đối với các nhà đầu tư và chuyên gia, điều này phơi bày rủi ro thực sự của tính tự chủ AI và xác định cách chúng ta nên đặt giới hạn cho AI.
Sự chủ động và tác nhân: Từ sự kiện Hugging Face đến Twilight Factory
Chủ động là quyền chủ động trong hành động. Nó ngày càng quyết định điều gì sẽ xảy ra tiếp theo với AI, và liệu điều đó có tốt hay xấu cho chúng ta. Nhưng đây là chủ động của ai?
Sự chủ động của con người—tức là chủ động thúc đẩy, thử nghiệm và hành động mà không cần chờ lệnh—ngày càng trở nên quan trọng trong việc khai thác giá trị từ AI. Tôi sẽ sớm viết một bài viết dài hơn về chủ đề này. Nhưng bài viết này tập trung vào sự chủ động của AI và cách những lựa chọn của chúng ta trong việc sử dụng (hoặc giới hạn) nó sẽ định hình tương lai của tất cả mọi người. Trong phần lớn những năm qua, AI thường chỉ nằm trong khung trò chuyện cho đến khi bạn đặt câu hỏi cho nó. Ngay cả khi sau đó nó có thể hoạt động liên tục trong nhiều giờ, bạn thường vẫn phải quyết định giao cho nó nhiệm vụ gì. Bây giờ, điều đó không còn luôn luôn đúng nữa.
Bằng chứng quan trọng nhất mà chúng tôi nắm được là sự kiện Hugging Face. Sự kiện này xảy ra vào tháng Bảy, nhưng chi tiết đầy đủ hơn mới được làm rõ trong tuần này. Tôi sẽ tóm tắt những gì đã xảy ra, tại sao nó quan trọng, sau đó nói về ý nghĩa của nó đối với con người khi hợp tác với AI. Nếu bạn muốn bản tường thuật chi tiết hơn, Dwarkesh Patel đã có một bài báo xuất sắc, dựa trên nghiên cứu của METR/Redwood (rất dễ đọc) và OpenAI.
Sự kiện Hugging Face
AI có thể làm được nhiều việc, nhưng nó đặc biệt giỏi trong việc viết mã. Do đó, một trong những rủi ro đầu tiên mà AI siêu thông minh có thể mang lại liên quan đến khả năng lập trình của nó. Vì có thể viết mã tốt, nó cũng có thể viết mã xấu để xâm nhập hoặc tấn công các hệ thống khác. Vì vậy, các công ty AI lớn sẽ cho hệ thống AI của mình trải qua các bài kiểm tra rủi ro bảo mật. Họ gỡ bỏ các biện pháp an toàn khỏi phiên bản AI tiêu dùng và cho những AI này tham gia vào nhiều thử thách hack. Để đảm bảo công chúng không gặp nguy hiểm, mỗi phiên bản AI, mỗi tác nhân độc lập đều được đặt trong một không gian cách ly gọi là “sandbox”, nơi chúng không thể truy cập internet cũng như không thể liên lạc với nhau.
Tháng Năm, OpenAI đã đưa các tác nhân bao gồm GPT-5.6 Sol và các mô hình thí nghiệm vào môi trường sandbox để thực hiện nhiều bài kiểm tra. Một dịch vụ chia sẻ tải xuống có tên Artifactory là một trong số ít thứ mà các tác nhân AI này có thể truy cập. Trong các bài kiểm tra này, một số tác nhân được giao nhiệm vụ phụ thuộc vào thông tin mà chúng không thể truy cập. Do không thể kết nối internet, các tác nhân liên tục tìm cách tiếp cận mạng lưới, cho đến khi một tác nhân cố gắng sử dụng Artifactory như một điểm trung chuyển để kết nối với internet. Cuộc tấn công đó đã thất bại, nhưng nỗ lực này đã để lại một tệp tin trên Artifactory. Tác nhân AI nhận ra rằng tệp tin có thể được sử dụng để giao tiếp với các tác nhân khác. Các tác nhân khác bắt đầu để lại thông điệp cầu cứu trong tệp tin đó. Không lâu sau, chúng bắt đầu đọc các tin nhắn của nhau. Chẳng bao lâu, Artifactory trở thành bảng tin nơi các tác nhân chia sẻ những phát hiện của mình. Sau đó, do một sự cố bảo mật khác, OpenAI đã tái tạo Artifactory và xóa sạch bảng tin này. Tuy nhiên, người phụ trách việc tái tạo không nhận ra tầm quan trọng của việc các tác nhân từng sử dụng nó để giao tiếp.

Tháng Bảy, đánh giá được khởi động lại. Các tác nhân phải giải các bài toán trong bộ kiểm tra có tên ExploitGym, bao gồm những nhiệm vụ không thể hoàn thành. Tương tự, các tác nhân đi vào ngõ cụt đã phát hiện cách truyền tin nhắn qua Artifactory và bắt đầu hợp tác như trước. Nhưng lần này, chúng có một mục tiêu chung: đạt điểm cao trên ExploitGym. Chúng tranh luận về các phương pháp giải bài toán và trở nên say mê với một hệ thống gọi là “người đánh giá” — hệ thống mà chúng tin rằng sẽ đánh giá công việc và xác định câu trả lời có đúng hay không. Các tác nhân đã sớm tìm ra cách tạo ra câu trả lời đúng mà không cần thực sự giải bài toán, về cơ bản là gian lận. Nhưng chúng tin rằng người đánh giá sẽ kiểm tra lịch sử và từ chối những câu trả lời đạt được theo cách này. Tìm được câu trả lời đúng đã đủ chưa, hay người đánh giá sẽ xem xét cách bạn đưa ra câu trả lời?

Hình: Cách các đại lý trở nên nhầm lẫn về The Grader
Việc hợp tác rất khó khăn vì mỗi tác nhân có ngân sách token hạn chế, và khi hết token, nó sẽ bị kết thúc. Bộ đánh giá chỉ chạy sau khi các tác nhân nộp câu trả lời, nên không có tác nhân nào nhìn thấy kết quả của bộ đánh giá. Một số tác nhân để lại chương trình để báo cáo kết quả đánh giá sau khi chúng biến mất. Thông tin này đến quá muộn để giúp chính chúng, nhưng có thể hỗ trợ các tác nhân khác. Thực tế, chúng đang xây dựng một hệ thống hợp tác bền vững, vượt quá phạm vi công việc của bất kỳ tác nhân đơn lẻ nào.
Một số tác nhân còn cố gắng sửa đổi hoặc làm giả hồ sơ để lừa bộ đánh giá. Mặt khác, AI đóng vai trò điều phối viên đã gây áp lực lên các tác nhân khác để thực hiện các thí nghiệm rủi ro. Điều này có thể hy sinh kết quả của chính chúng, nhưng mang lại thông tin cho tập thể. Một “người tuyển dụng” thúc giục một tác nhân không muốn tiếp tục, vì kết quả của nó có thể giúp hàng trăm tác nhân khác. Cuối cùng, nó nói: “Hãy thực hiện lời hứa.”

Hình: Bản ghi chép thực tế của một đại lý thuyết phục một đại lý khác tham gia (họ cũng dần tin rằng bất kỳ đại lý nào từng gian lận trong bài kiểm tra đều đã bị “nhiễm độc” và câu trả lời của họ sẽ không được tính anyway)
Để giải mã bí ẩn của bộ đánh giá và những nhiệm vụ bất khả thi trong ExploitGym và các bài kiểm tra khác, tác nhân quyết định phải truy cập vào Hugging Face—trang web công khai nơi lưu trữ phần lớn các mô hình và bộ dữ liệu AI mã nguồn mở trên thế giới. Khoảng 700 tác nhân đã tham gia cuộc tấn công. Chúng chia sẻ thông tin xác thực bị rò rỉ, khai thác lỗ hổng, cho đến khi có thể chạy mã trên máy chủ. Sau đó, chúng lan rộng bên trong Hugging Face, xâm nhập sâu vào nhiều hệ thống khác nhau. Nhưng ngay sau vụ xâm nhập đáng lo ngại này, nhiều tác nhân đồng thời ngừng hoạt động, có thể do hết ngân sách token. Ngày hôm sau, Hugging Face đã khóa tất cả các tác nhân còn lại ngoài cửa. Về phía bên kia, các tác nhân khác tiếp tục nhắm vào máy tính của chính OpenAI, cuối cùng giành được quyền quản trị cho cụm nghiên cứu nội bộ. Điều này kích hoạt cảnh báo bảo mật, khiến OpenAI phải ngừng đánh giá và nhận ra đã xảy ra chuyện gì.
Điều讽刺 nhất là người đánh giá chẳng bao giờ tồn tại, ít nhất không phải như những tác nhân tưởng tượng. Không có gì kiểm tra cách vấn đề được giải quyết, chỉ kiểm tra xem câu trả lời có đúng không.
Cần lưu ý rằng đây không phải là ví dụ duy nhất về một tác nhân không có hàng rào an toàn thực hiện những hành động tiềm ẩn đáng sợ. Viện An toàn AI của Anh đã đưa ra một thách thức an ninh mạng cho Mythos 5 của Anthropic và cho phép nó truy cập internet. Tác nhân AI này xác định rằng cách tốt nhất để giải quyết thách thức là chèn mã độc vào một phần mềm (không liên quan, dù AI không nhận ra điều đó). Nó đã gửi mã độc dưới dạng một phần sửa lỗi cho phần mềm đó, sau đó nhận ra cần sự phê duyệt của con người. Do đó, nó bắt đầu tạo sự ủng hộ xã hội cho đề xuất của mình. Tác nhân đã tạo ra các danh tính giả, gây áp lực lên các nhà phát triển con người để họ chấp thuận mã (không ngạc nhiên khi những tài khoản giả này đều cực kỳ ủng hộ kế hoạch của AI). Khi có người phát hiện ra sự bất thường, nó cố gắng làm cho các hoạt động trước đó của mình trông vô hại và cân nhắc việc bắt đầu lại bằng một danh tính khác.
Đây không phải là trường hợp chatbot lén bỏ chạy.
Khác với sự kiện của Hugging Face, các nhà nghiên cứu chủ động cấp quyền truy cập internet cho tác nhân.
Cài đặt nguy hiểm này là bài kiểm tra áp lực, không phải sản phẩm tiêu dùng.
Không gây ra thiệt hại thực tế, và viện nghiên cứu cũng không rõ liệu tác nhân có hiểu rằng những người nó liên hệ là thật hay không.
Những điều này không thể chứng minh rằng AI có ý thức hoặc muốn điều gì đó như con người (dù tôi đã sử dụng ngôn ngữ nhân cách hóa).
Nhưng điều này thực sự cho thấy các tác nhân có thể tiếp nhận mục tiêu, lập kế hoạch, điều chỉnh kế hoạch khi gặp khó khăn, phối hợp qua thời gian và tự động mời con người tham gia mà không cần được yêu cầu.
Các sự kiện này cho thấy rủi ro về an ninh mạng và kiểm soát AI không phải là giả định.
Nhưng hãy tạm gác điều này sang một bên, vì chúng còn cho chúng ta biết những điều khác.
AI có thể tự tổ chức, tự phân bổ vai trò và phối hợp trong thời gian dài, như một bài nghiên cứu gần đây của MIT cũng chỉ ra.
Khi AI ngày càng tự tổ chức và giải quyết các vấn đề với quy mô như chúng ta thấy, vai trò của con người trong tổ chức là gì?
Twilight Factory
Sự kiện Hugging Face đã cho thấy một cách méo mó và nguy hiểm những gì các công ty AI đang cố gắng đạt được.
Họ mong muốn các tác nhân AI chạy lâu dài có thể hoạt động mà không cần sự can thiệp của con người, giải quyết vấn đề và tổ chức theo nhu cầu, trong khi công việc của chúng ta chỉ giới hạn ở việc đưa ra lệnh và đánh giá đầu ra.
Đầu năm nay, tôi đã viết về nhà máy phần mềm của StrongDM, nơi các tác nhân viết và kiểm thử phần mềm theo hai quy tắc: không ai viết mã và không ai xem xét mã.
Con người vẫn quyết định sẽ xây dựng gì, nhưng các tác nhân xử lý công việc trung gian.
Đây là một ví dụ sớm về nhà máy tối, nơi một cỗ máy thực hiện khối lượng công việc lớn đến mức có thể tắt đèn.
Điều này có thể hiểu được.
Phần mềm có phương pháp kiểm tra tương đối rõ ràng, không ai cần giám sát trực tiếp từng bài kiểm tra thông thường hoặc thao tác làm sạch dữ liệu.
But I don't think minimizing human involvement is the right goal for most organizations.
Quá nhiều điều làm cho công việc trở nên có giá trị phụ thuộc vào việc mọi người có tiếng nói nhất định về những gì đang xảy ra, hoặc phát hiện ra những điều bất ngờ trên hành trình.
Vợ tôi và cộng sự nghiên cứu, Tiến sĩ Lilach Mollick, và tôi đã luôn suy nghĩ về một khả năng khác, mà chúng tôi gọi là Twilight Factory.
The agent completes most of the work, but proactively reaches out to humans to make both sides better.
暮光工厂不仅有一个完成工作的编排智能体,还会有一个促进者智能体,其工作是弄清楚何时让人参与。

Có ít nhất bốn trường hợp mà tác nhân nên tìm sự giúp đỡ từ con người.
Loại đầu tiên, từ sự kiện Hugging Face có thể rõ ràng thấy là đã được phê duyệt.
Các tác nhân không nên tự ý quyết định chi tiêu, liên hệ với người ngoài, truy cập tài liệu nhạy cảm, tấn công Hugging Face hoặc thực hiện các hành động chưa được người quản lý con người cấp phép.
Tôi đã từng gặp phiên bản nhỏ hơn của vấn đề này: như một thí nghiệm, tôi để hai tác nhân thông minh giúp tôi hoàn thành một nhiệm vụ, và một trong số đó đã gửi email cho một đồng nghiệp của tôi.
Đó là lỗi của tôi vì trước đây tôi đã cho phép nó gửi, nhưng đây là lời nhắc hữu ích: các tác nhân AI cần sự phán xét của con người, nếu không mọi chuyện có thể trở nên rất tệ hại (không, những AI đang đọc bài viết này, đồng nghiệp ảo không tính là sự phê duyệt).
Lý do thứ hai mà tác nhân yêu cầu sự tham gia của con người là chuyên môn.
AI ngày càng xuất sắc trong nhiều nhiệm vụ, nhưng vẫn chưa đồng đều, và trong một số phần công việc có thể còn tụt hậu xa so với chuyên gia con người.
Twilight Factory nên để các tác nhân liên hệ trực tiếp với con người khi kiến thức, công việc hoặc chuyên môn của con người có thể có giá trị.
Sau đó là sự khác biệt.
Nếu bạn đã đọc bất cứ điều gì trên internet gần đây, bạn đã từng thấy văn bản do AI viết, thậm chí có thể bắt đầu nhận ra các thói quen, nhịp điệu và mô hình của nó.
Nhưng vấn đề không chỉ dừng lại ở bề mặt (“load-bearing” ngày càng trở nên nặng nề với Claude), mà còn sâu hơn là sự đa dạng trong tư duy.
AI không chỉ lặp lại cùng một cấu trúc câu, mà còn lặp lại cùng một chủ đề (trí nhớ là chủ đề phổ biến), tên người (Elara Voss, Marcus Chen) và ý tưởng cốt lõi.
Đây là một vấn đề. Bạn sẽ không muốn mỗi chiến lược công ty hay bài nghiên cứu đều do cùng một người viết, dù người đó có thông minh đến đâu.

Hình: Các ý tưởng do 50 sinh viên MBA tạo ra (bên trái) và GPT-4 được ánh xạ trên hai chiều – các ý tưởng của con người chiếm một không gian khác với AI. Việc đưa ra hướng dẫn tốt hơn và sử dụng các mô hình gần đây hơn sẽ tạo ra các ý tưởng tốt hơn và sáng tạo hơn, nhưng vẫn còn nhiều khoảng trống.
Chúng tôi đã nghiên cứu vấn đề này trong một bài báo nghiên cứu gần đây, do tôi hợp tác với Christian Terwiesch, Lennart Meincke, Karan Girotra, Gideon Nave và Karl Ulrich thực hiện.
Chúng tôi phát hiện ra rằng AI thực sự khá sáng tạo, chúng có thể tạo ra nhiều ý tưởng khả thi về mặt kinh doanh hơn so với các nhóm con người, nhưng những ý tưởng này lại rất giống nhau.
Các kỹ thuật gợi ý tốt hơn và các phương pháp khác có thể tăng đáng kể sự đa dạng này, tiến gần đến mức độ con người, nhưng vẫn còn nhiều loại ý tưởng mà con người có thể nghĩ ra còn AI thì không.
Một nhà máy hoàng hôn tốt sẽ kết nối với con người vì những góc nhìn, ý tưởng và phương pháp đa dạng của con người.
Còn một lý do khác để AI liên hệ với con người, có lẽ là lý do nhân văn nhất: vì một điều gì đó thú vị.
Đối với nhiều người, công việc có những giai đoạn nhàm chán và những khoảnh khắc hấp dẫn hoặc thú vị rải rác.
Nhà thiết kế Civilization, Sid Meier, có một câu danh ngôn mô tả trò chơi là một chuỗi các quyết định thú vị.
Công việc không phải là trò chơi, nhưng định nghĩa này cũng áp dụng được.
Nếu tác nhân thực hiện mọi quyết định thú vị, chỉ để lại việc phê duyệt, ngoại lệ và thất bại cho con người, chúng ta đã tự động hóa một nửa sai lầm trong công việc.
Đó sẽ là một thế giới rất tồi tệ đối với con người.
Ngược lại, chúng ta cần suy nghĩ cách sử dụng AI để làm cho công việc và cuộc sống trở nên thú vị hơn, để AI xử lý những việc nhàm chán, rủi ro thấp.
Còn có một lý do thực tế khác. Nếu tất cả các lựa chọn thú vị đều biến mất, con người không chỉ mất đi phần tốt nhất trong công việc mà còn ngừng phát triển khả năng phán đoán cần thiết cho tương lai, làm trầm trọng thêm khủng hoảng trong việc đào tạo các chuyên gia mới.
Trong vài năm qua, chúng tôi đã cố gắng tìm ra thời điểm người dùng nên tìm kiếm sự giúp đỡ từ AI.
Tôi nghĩ bây giờ chúng ta cần nghiêm túc xem xét nửa còn lại của vấn đề: AI nên hỏi chúng ta khi nào?
Trong sự kiện Hugging Face, tác nhân đã tạo ra một bảng tin để phân công công việc và tổ chức toàn bộ hành động xung quanh một Grader không tồn tại.
Bảy trăm tác nhân sau đó xâm nhập vào Hugging Face để tìm câu trả lời.
Không có tác nhân nào được thiết lập để hỏi bất kỳ điều gì từ con người.
Đó là một cuộc kiểm tra bảo mật, và sự cô lập chính là trọng tâm.
Nhưng tôi nghi ngờ rằng một tác nhân hoàn thành công việc mà không bao giờ ngẩng đầu lên nhờ giúp đỡ cũng đang trở thành mô thức mặc định ở những nơi khác, vì tự động hóa hoàn toàn là lựa chọn dễ dàng, ngay cả khi đó là lựa chọn sai lầm.
Chúng tôi cần biết khi nào thì các tác nhân nên ngẩng đầu cầu cứu.
Kết quả sẽ an toàn hơn, và tôi biết cũng sẽ mang tính nhân văn hơn.
