Một nhà nghiên cứu người Anh 27 tuổi từng làm việc về pretraining tại Anthropic đã từ chức công khai, cảnh báo rằng cuộc đua xây dựng AI tự cải tiến lặp lại có thể dẫn đến sự diệt vong của nhân loại trước khi kết thúc thập kỷ này.
Jacob Coxon đã rời khỏi một trong những công ty an toàn AI nổi bật nhất thế giới vào khoảng ngày 8-9 tháng Chín, và thông điệp chia tay của anh ấy không phải là một bài đăng lịch sự trên LinkedIn về “những chương mới đầy thú vị.” Đó là một lời cảnh báo rằng những người xây dựng các hệ thống này thực sự tin rằng họ có thể tạo ra những hậu quả thảm khốc, và thời gian để mọi thứ vượt ngoài tầm kiểm soát có thể chỉ còn tính bằng năm tới.
Cảnh báo nội bộ
Điều khiến việc bỏ qua việc Coxon từ chức trở nên đặc biệt khó khăn là những gì đã xảy ra tiếp theo. Chính những đồng nghiệp của anh ấy tại Anthropic bắt đầu công khai đồng ý với anh ấy.
Evan Hubinger, người giữ chức Trưởng khoa Căn chỉnh Hệ thống tại Anthropic, đã hỗ trợ các tuyên bố của Coxon trên mạng xã hội. Ước tính cá nhân của anh ấy: khả năng cao hơn 10% rằng AI sẽ dẫn đến số lượng lớn ca tử vong ở con người trong vòng một thập kỷ tới.
Hubinger đi xa hơn khi thừa nhận rằng Anthropic không có kế hoạch rõ ràng để đảm bảo sự phù hợp với các hệ thống siêu thông minh.
Samuel Marks, một nhà nghiên cứu khác của Anthropic, cũng bày tỏ những lo ngại tương tự, cho rằng các nhân viên cấp cao trong công ty đặc biệt lo lắng về các rủi ro gây diệt vong.
Coxon đặc biệt chỉ trích việc sử dụng các thuật ngữ như “crunchtime” và “endgame” trong các vòng tròn phát triển AI. Những từ này định hình việc theo đuổi trí tuệ siêu việt như một điều khẩn cấp và không thể tránh khỏi, một cuộc cạnh tranh để chiến thắng thay vì một rủi ro cần được quản lý. Ông cho rằng cách định hình này là một phần của vấn đề.
Một mô hình thoát vị
Coxon không phải là nhà nghiên cứu tập trung vào an toàn đầu tiên rời Anthropic do lo ngại về định hướng của công ty. Ông Mrinank Sharma, người dẫn đầu nhóm Nghiên cứu Biện pháp Bảo vệ của công ty, đã từ chức vào tháng 2 năm 2026. Sharma chỉ ra những mối nguy ngày càng gia tăng do AI và vũ khí sinh học gây ra, đồng thời nêu ra các áp lực bên ngoài mà ông cho rằng đang làm tổn hại đến đạo đức của công ty.
Sự mỉa mai thật dày đặc. Anthropic được thành lập bởi các cựu nhân viên OpenAI, bao gồm CEO Dario Amodei, cụ thể vì họ cảm thấy OpenAI không coi trọng đủ an toàn. Nó vốn được kỳ vọng là lựa chọn ưu tiên an toàn hàng đầu. Giờ đây, chính các nhà nghiên cứu an toàn của nó đang rời đi vì họ cho rằng Anthropic không coi trọng đủ an toàn.
Cạnh tranh là chất xúc tác
Coxon cảnh báo cụ thể rằng sự cạnh tranh quốc tế là yếu tố làm tình hình trở nên tồi tệ hơn. Áp lực phải theo kịp các đối thủ, đặc biệt là từ các phòng thí nghiệm AI Trung Quốc, đã tạo ra một môi trường nơi việc chậm lại để đảm bảo an toàn cảm giác như tự giải giáp đơn phương.
