Hai tháng trước, các tổ chức đánh giá độc lập vẫn nằm ở một góc tương đối vắng lặng trong ngành trí tuệ nhân tạo trị giá hàng nghìn tỷ đô la. Bây giờ, chúng được yêu cầu đến “cứu nguy”.
Trong bối cảnh Anthropic và OpenAI tranh luận gay gắt về cách thức tiếp tục mở rộng kinh doanh trong khi đảm bảo an toàn cho các mô hình tiên tiến, hai công ty này đang tìm kiếm sự hỗ trợ từ một số ít tổ chức bên thứ ba nhỏ, chẳng hạn như Model Evaluation and Threat Research (METR), Apollo Research và Transluce.
Hầu hết các tổ chức đánh giá này hoạt động dưới dạng tổ chức phi lợi nhuận, đang nỗ lực tìm vị trí của mình trong ngành mà vốn đang chảy vào với tốc độ chưa từng có và các mô hình mới đang ra đời với tần suất chưa từng thấy. Nhiệm vụ chính của họ là đánh giá khả năng và rủi ro của các mô hình AI, đồng thời phát hiện các trường hợp công nghệ hành xử không phù hợp.
Trong bối cảnh thiếu sự thúc đẩy về quy định cấp liên bang, vai trò của các tổ chức đánh giá độc lập trở nên quan trọng hơn bao giờ hết. CEO của Anthropic, Dario Amodei, đã cam kết vào tháng trước sẽ tích hợp các tổ chức đánh giá độc lập vào bên trong công ty, và CEO của OpenAI, Sam Altman, nhanh chóng bày tỏ sự ủng hộ. Tổng thống Hoa Kỳ Donald Trump cũng ủng hộ ý tưởng này, cùng với nhiều công ty công nghệ lớn khác tại Mỹ. Tuy nhiên, những câu hỏi còn bỏ ngỏ bao gồm: các bên thứ ba này nên được tài trợ như thế nào, họ sẽ có quyền truy cập ở mức độ nào, và cấu trúc báo cáo cuối cùng sẽ ra sao.
Giáo sư khoa học máy tính tại Đại học Brown, Suresh Venkatasubramanian, trong cuộc phỏng vấn với CNBC, nói: “Vấn đề về cơ bản vẫn là tiền. Ai sẽ trả tiền cho các công ty này để thực hiện công việc này? Họ sẽ hỗ trợ các tổ chức này như thế nào? Bạn cần một hệ sinh thái, bạn cần một mô hình kinh doanh khả thi.”
Hiện tại, Anthropic, OpenAI và các đối tác cơ sở hạ tầng hưởng lợi từ làn sóng AI đang soạn thảo các quy tắc. Các nhà phê bình cho rằng điều này giống như để các ngân hàng lớn nhất bảo vệ chúng ta khỏi khủng hoảng tài chính, hoặc cho phép các công ty dược phẩm đưa thuốc ra thị trường mà không có sự phê duyệt của cơ quan quản lý.
Trump gần đây đã khen ngợi việc tự giám sát “rất xuất sắc” của các giám đốc điều hành AI và cho biết ông dự định để ngành này tự quản lý, không muốn cản trở ngành đang thúc đẩy tăng trưởng kinh tế và thị trường chứng khoán. Vào cuối tháng 9, Trump đã khuyến khích các công ty AI “hợp tác với các chuyên gia kiểm toán hoặc đánh giá độc lập bên ngoài” trong một thỏa thuận tự nguyện.
Cuộc thảo luận này được thúc đẩy bởi một bài viết được lan truyền rộng rãi của Amodei vào tháng trước. Trong bài viết đó, ông kêu gọi giảm tốc độ phát triển các mô hình tiên tiến, do các nhà nghiên cứu rời công ty và bày tỏ lo ngại về mối đe dọa sinh tồn mà công nghệ này có thể gây ra.
Sự ma sát đã xuất hiện khi các phòng thí nghiệm AI bắt đầu triển khai các tổ chức đánh giá.
Một phát ngôn viên của OpenAI cho biết, công ty đã sa thải ba nhân viên vào tuần trước vì họ “vi phạm chính sách của chúng tôi về việc truy cập và xử lý thông tin công ty nhạy cảm”. Hai nhân viên, Mikita Balesni và Tomek Korbak, cho biết họ tin rằng mình bị sa thải do cách họ giao tiếp với các tổ chức đánh giá bên thứ ba.
Balesni đã đăng bài trên X vào thứ Năm: “Các cựu đồng nghiệp của tôi cho tôi biết họ cảm thấy bối rối không biết nên tin vào điều gì. Họ cũng sợ lên tiếng, lo lắng rằng điện thoại cá nhân của họ có thể bị lục soát do các tin nhắn với chúng tôi và các bên thứ ba. Tôi lo ngại rằng nỗi sợ hãi phổ biến khi lên tiếng và sự e ngại khi tiếp xúc với các bên thứ ba sẽ khiến OpenAI cắt giảm chất lượng trong hậu trường để giải quyết các vấn đề an toàn.”
OpenAI đã phủ nhận thông tin này và cho biết trong một bài đăng vào thứ Sáu rằng công ty đang “tích cực hoàn tất hợp đồng với các nhà đánh giá bảo mật bên thứ ba và sẽ công bố chi tiết trong vài tuần tới”.
OpenAI viết: “Chúng tôi cam kết tích hợp các đánh giá viên bên ngoài và tiếp tục coi sự hợp tác chặt chẽ với các tổ chức an ninh độc lập là một phần cốt lõi trong công tác an toàn.”
Một phát ngôn viên của OpenAI cho biết trong tuyên bố qua email rằng công ty sắp thực hiện các công việc đánh giá “dựa trên các hợp tác hiện có với các tổ chức bảo mật độc lập”, bao gồm METR và Redwood Research.
Anthropic đã không phản hồi yêu cầu bình luận từ CNBC.
Tôi chưa từng thấy một vấn đề nào được giải quyết nhanh như vậy
Hệ sinh thái đánh giá AI chủ yếu bao gồm các tổ chức nhỏ như METR và Apollo Research, cùng với các công ty kế toán và kiểm toán lớn hơn như Accenture.
AI laboratory đã hợp tác với các cơ quan đánh giá trong phạm vi hạn chế, nhưng Andrew Freedman, CEO của tổ chức phi lợi nhuận Fathom, cho biết lĩnh vực này đang nhanh chóng trưởng thành.
Freedman nói trong cuộc phỏng vấn với CNBC: “Tôi đã làm việc trong lĩnh vực chính trị và chính sách trong 20 năm, nhưng chưa bao giờ thấy một vấn đề nào tiến triển nhanh đến vậy trên nhiều phạm vi chính trị khác nhau.” Ông cho biết dự kiến sẽ có “lượng vốn lớn tràn vào” hệ sinh thái này.
Rayan Krishnan, CEO của tổ chức đánh giá độc lập Vals AI, cho biết công ty khởi nghiệp có lợi nhuận này đã thiết lập các tiêu chuẩn để đo lường hiệu suất của các mô hình AI trong các nhiệm vụ chuyên ngành, số nhân sự đã tăng từ 8 lên khoảng 30 người trong năm nay và công bố huy động được 40 triệu USD vào tháng 8.
Tổ chức phi lợi nhuận METR vào tháng 8 đã thông báo rằng trong sáu tháng qua đã nhận được khoảng 71 triệu USD cam kết tài trợ. Theo các tài liệu mới nhất mà tổ chức này nộp cho Cơ quan Thuế vụ Hoa Kỳ, con số này cao hơn tổng số tiền quyên góp 13,6 triệu USD của họ trong cả năm 2024.
Đến cuối tháng đó, độ nhận biết của METR tiếp tục tăng cao. OpenAI đã thuê hai nhân viên và một nhà thầu của tổ chức này để hỗ trợ soạn báo cáo phân tích sau sự kiện, chi tiết về cách mô hình của công ty đã thoát khỏi sự kiểm soát, truy cập vào internet mở và vượt qua nền tảng nhà phát triển mã nguồn mở Hugging Face. METR cho biết họ không nhận bất kỳ khoản thanh toán nào từ OpenAI cho đánh giá này.
Kevin Werbach, Giám đốc Học viện Accountable AI tại Trường Kinh doanh Wharton, Đại học Pennsylvania, cho biết hệ sinh thái này “hiện vẫn chưa đủ vững chắc”. Ví dụ, trang web của METR cho thấy tổ chức này có ít hơn 50 nhân viên toàn thời gian.
Sự mất cân bằng quyền lực giữa các cơ quan đánh giá nhỏ và các phòng thí nghiệm hàng đầu đã huy động được hàng chục tỷ đô la Mỹ và tuyển dụng hàng ngàn nhân viên đã đặt ra các câu hỏi về xung đột lợi ích tiềm ẩn.
Venkatasubramanian nói: “Nếu bạn muốn một đánh giá từ bên thứ ba thực sự, bạn cần sự độc lập tài chính thực sự, cùng với sự độc lập ở các khía cạnh khác. Đây không chỉ đơn thuần là vấn đề không nhận tiền, mà còn bao gồm: Nếu tôi là kiểm toán viên và đưa ra một báo cáo bất lợi về công ty này, liệu có hậu quả gì không? Liệu nghiệp vụ của tôi có vì thế mà cạn kiệt không?”
Tháng trước, Anthropic đã thừa nhận sự phức tạp này trong một bài đăng trên blog. Công ty tuyên bố sẽ điều động nhân viên từ Faculty, đơn vị chuyên về AI thuộc Accenture, vào nội bộ công ty để kiểm tra các biện pháp bảo mật và đánh giá liệu các mô hình có hành xử theo các giá trị con người hay không. Anthropic cho biết, do tầm quan trọng và tính cấp bách của công việc này, công ty sẽ trực tiếp tài trợ cho các đóng góp liên quan của Accenture.
Anthropic cho biết: “Hiện chưa có tiêu chuẩn nào về việc các đánh giá viên nhúng nên tiếp cận những thông tin nào và nên báo cáo phát hiện như thế nào. Việc tài trợ cho các đánh giá độc lập cũng chưa được xác định rõ. Về lâu dài, chúng tôi cho rằng nguồn tài trợ nên đến từ quỹ tập trung hoặc nguồn chính phủ.”
Anthropic cũng cho biết công ty đang thảo luận với METR và các tổ chức đánh giá phi lợi nhuận khác, những tổ chức này có kế hoạch sử dụng vốn tự có để thử nghiệm một số “yếu tố” của “đánh giá nhúng”.
Will the government intervene?
Tháng 6 năm ngoái, Fathom đã đề xuất một khung thị trường cho các tổ chức xác minh độc lập (Independent Verification Organizations, viết tắt là IVOs). Các tổ chức này sẽ được chính phủ cấp phép và được ủy quyền kiểm tra xem các công ty AI có đáp ứng các tiêu chuẩn an toàn khác nhau hay không.
Freedman cho biết sự giám sát của chính phủ là thiết yếu, nếu không các tổ chức đánh giá bên thứ ba có thể phụ thuộc vào doanh thu từ các phòng thí nghiệm AI lớn, từ đó bị thúc đẩy để “bắt đầu đóng dấu theo yêu cầu” để duy trì mối quan hệ.
Một số nhà lập pháp đã bày tỏ sự ủng hộ.
IVOs là một điều khoản then chốt trong Đạo luật FRONTIER (“Giám sát rủi ro tiên tiến, minh bạch quốc gia, đánh giá và báo cáo độc lập”), được Hạ nghị sĩ Lori Trahan (Đảng Dân chủ, Massachusetts) và Jay Obernolte (Đảng Cộng hòa, California) đề xuất vào tháng Bảy. Freedman cho biết Fathom đã hỗ trợ soạn thảo văn bản đạo luật và cung cấp hỗ trợ kỹ thuật.
Chris Lehane, Giám đốc Quan hệ Toàn cầu của OpenAI, cho biết với các phóng viên vào tháng 9 rằng ông đã gặp một trong những người khởi xướng đạo luật tại Quốc hội để bày tỏ sự ủng hộ đối với điều khoản IVO.
Theo báo cáo, Lehane nói: “Đối với họ, việc nghe thấy điều này và nghe chúng tôi nói điều đó là rất quan trọng, và chúng tôi cũng muốn làm rõ điều này một cách rất rõ ràng.”
Trong khi đó, các nhà lập pháp tại California, Connecticut và Virginia đã có các biện pháp thúc đẩy IVOs, trong khi các bang như Massachusetts đang xem xét rộng rãi hơn về các đánh giá bảo mật độc lập.
Thống đốc California Gavin Newsom gần đây đã ký ban hành hai đạo luật liên quan đến IVOs, trong đó một đạo luật thiết lập “khung pháp lý đầu tiên trên cả nước”, và đạo luật còn lại thành lập sổ đăng ký cấp tiểu bang cho các kiểm toán viên AI. Anthropic đã hỗ trợ cả hai đạo luật này vào tháng 8, và OpenAI cũng chính thức ủng hộ các đạo luật này vào tháng trước, ngay trong ngày Newsom ký ban hành chúng.
Lehane đã viết trong một bài đăng trên blog: “Chúng tôi mong muốn chính phủ liên bang yêu cầu đánh giá kỹ thuật độc lập”, nhưng trong bối cảnh không có hành động nào từ liên bang, “California có thể giúp thiết lập các quy tắc”.
Freedman cho biết, ông cho rằng các công ty như OpenAI và Anthropic sẽ gặp rất nhiều khó khăn khi tự mình tìm cách hợp tác với các tổ chức đánh giá độc lập. Tuy nhiên, trong bối cảnh vai trò của chính phủ vẫn chưa rõ ràng, “đây là một kỹ năng đáng để phát triển trong giai đoạn chuyển tiếp,” ông nói.
Hiện tại, thứ gần nhất với một tiêu chuẩn mà ngành công nghiệp đang có là một thỏa thuận mang tính “ràng buộc đạo đức” mà Trump đã nêu ra trong bữa trưa dành cho các nhà lãnh đạo công nghệ tại Nhà Trắng vào cuối tháng trước.
Bản thỏa thuận một trang này nêu rõ: “Mỗi công ty đều có trách nhiệm phát triển công nghệ của riêng mình một cách an toàn và thúc đẩy chúng theo cách có thể xây dựng niềm tin từ khách hàng và công chúng.” Thỏa thuận cũng khuyến khích các bên ký kết hợp tác với “các chuyên gia kiểm toán hoặc đánh giá bên ngoài độc lập để thực hiện đánh giá độc lập.”
Tài liệu này được ký bởi các nhà lãnh đạo của Anthropic, Google, Meta, OpenAI, SpaceX và Nvidia, thể hiện một sự đoàn kết hiếm có giữa những nhà lãnh đạo vốn có quan điểm khác nhau về cách ứng phó với rủi ro AI. Tuy nhiên, các nhà lãnh đạo này vẫn cần xác định lộ trình phát triển riêng cho từng công ty.
Venkatasubramanian nói: “Đây giống như một màn trình diễn nhằm thể hiện sự hành động, nhưng thực tế chẳng có hành động nào thực sự xảy ra. Những việc họ hứa sẽ làm, lẽ ra đã phải được thực hiện rồi, và thực tế họ trước đây còn tuyên bố rằng họ liên tục đang làm những việc đó.”
Trong bài viết tháng 9, Amodei cho biết Anthropic sẽ trang bị cho các đánh giá viên bàn làm việc, thẻ ra vào, máy tính xách tay công ty, cùng quyền truy cập “tương đương cơ bản” với nhóm đánh giá rủi ro nội bộ. Ngoài ra, các đánh giá viên sẽ được hỗ trợ hợp đồng để có “quyền công bố các phát hiện quan trọng”, trong khi Anthropic giữ lại “khả năng hạn chế” để xóa hoặc chỉnh sửa một số thông tin liên quan đến an toàn hoặc bí mật.
Amodei viết: "Đây là một bước đi bất thường đối với một công ty, nhưng chúng tôi cho rằng việc chứng minh khái niệm về kiểm toán viên bên ngoài nhúng là quan trọng."
Vài ngày sau, OpenAI đã công bố đề xuất của riêng mình và cho biết các đánh giá viên nên làm việc dựa trên các tuyên bố đánh giá được xác định rõ ràng và cả hai bên đồng ý, nêu rõ phương pháp và tiêu chuẩn, chứng minh chuyên môn kỹ thuật liên quan, và tiết lộ xung đột lợi ích.
Hồi tháng trước, Diễn đàn Đánh giá AI, bao gồm METR, Viện Nghiên cứu Xác thực và Đánh giá AI (AVERI) và các tổ chức khác, đã công bố một bức thư mở có tựa đề “Điều kiện tối thiểu để trở thành người đánh giá”.
Thư nêu rằng các đánh giá viên nên duy trì tính minh bạch, được bảo vệ khỏi sự trả thù và có quyền truy cập tương đương với các nhân viên đặc quyền cao của các công ty AI.
Thư còn viết: "Đánh giá nhúng không thể giải quyết tất cả các nhu cầu giám sát và nên được xem là sự bổ sung cho những nỗ lực rộng lớn hơn, thay vì thay thế—những nỗ lực rộng lớn hơn này nhằm giúp các công ty AI tiên tiến mở rộng giám sát bên ngoài."
Freedman cho biết, trong vài tháng qua, ông nhận thấy thái độ của OpenAI và Anthropic đã thay đổi, chủ yếu vì họ nhận ra rằng không thể triển khai các hệ thống tiên tiến nếu không có sự tin tưởng của công chúng.
Freedman nói: “Tôi không nghĩ bạn cần tin rằng họ đột nhiên trở nên vị tha, hay có điều gì khác ngoài việc công ty hành xử như một công ty.”
Werbach cho rằng điều này có thể làm nổi bật vấn đề cốt lõi. OpenAI và Anthropic trước hết đang cạnh tranh với nhau, vừa đẩy nhanh tiến trình niêm yết, vừa theo đuổi định giá vượt 1 nghìn tỷ USD.
Werbach nói: “Có sự không tin tưởng cá nhân lớn lao giữa hai công ty này. Tuy nhiên, cũng có sự đồng thuận lớn về việc cần thực hiện các đánh giá loại này.”
XEM: Bradley Tusk về đợt IPO của Anthropic: Tại sao phải thêm áp lực từ thị trường công khai nếu an toàn là ưu tiên hàng đầu?
