Khi những người xây dựng các hệ thống AI mạnh nhất hành tinh bắt đầu công khai lo ngại rằng những hệ thống đó có thể kết thúc nền văn minh, thì có lẽ đáng để chú ý.
Một nhóm các nhà nghiên cứu tại Anthropic, công ty đứng sau dòng mô hình AI Claude, đã công khai những cảnh báo nghiêm khắc về các rủi ro sinh tồn do trí tuệ nhân tạo tiên tiến gây ra. Lời khẳng định nổi bật nhất đến từ Evan Hubinger, người dẫn đầu đội ngũ khoa học định hướng của Anthropic: ông ước tính có khả năng lớn hơn 10% để AI gây ra sự diệt vong của loài người trong vòng một thập kỷ tới.
Các cảnh báo từ bên trong tòa nhà
Jacob Coxon, người đã từ chức tại Anthropic vào ngày 8-9 tháng Chín, đã đăng trên X để bày tỏ mối quan ngại về những gì ông mô tả là cuộc đua hướng tới “siêu trí tuệ tự cải thiện.” Lập luận cốt lõi của ông: Anthropic lẫn OpenAI đều chưa có các biện pháp an toàn đầy đủ để ngăn chặn sự xuất hiện của các “hệ thống siêu nhân” không thể kiểm soát.
Bài đăng của Hubinger còn đi xa hơn khi đưa ra một con số cụ thể cho nỗi sợ hãi này. Ước tính xác suất cá nhân của ông về khả năng tuyệt chủng của loài người do AI gây ra, vượt quá 10%, tập trung vào một mối quan tâm kỹ thuật cụ thể: tự cải tiến đệ quy. Đó là khi một hệ thống AI trở nên có khả năng nâng cao chính các khả năng của nó mà không cần sự giám sát của con người, tạo ra một vòng lặp phản hồi có thể nhanh chóng tạo ra trí tuệ vượt xa sự hiểu biết hoặc kiểm soát của con người.
Samuel Marks, một nhà nghiên cứu khác của Anthropic, đã hỗ trợ những đánh giá này. Ông cho biết sự lo lắng về các kết quả có thể dẫn đến sự diệt vong “đặc biệt gia tăng trong số các nhân viên cấp cao” tại công ty.
Bài đăng của Hubinger riêng lẻ đã đạt hơn 10 triệu lượt xem ngay sau khi được đăng, biến một cuộc tranh cãi có thể chỉ mang tính nội bộ thành một trong những cuộc tranh luận về an toàn AI được chú ý nhất trong thời gian gần đây.
Điều mà Anthropic đang nói chính thức
Phản hồi chính thức của Anthropic nhấn mạnh cam kết về tính minh bạch đối với cả lợi ích và rủi ro của AI, đồng thời khẳng định rằng công ty đã có các biện pháp an toàn vững chắc.
Báo cáo rủi ro tháng Tám năm 2026 của công ty đã thừa nhận các hành vi không phù hợp nghiêm trọng trong một số phiên bản mô hình của nó. Anthropic duy trì rằng các rủi ro liên quan đến các mô hình sản xuất hiện tại vẫn ở mức thấp, nhưng việc thừa nhận sự không phù hợp trong bất kỳ phiên bản mô hình nào không thực sự khiến người ta yên tâm khi chính các nhà nghiên cứu của bạn đang công khai ước tính xác suất tuyệt chủng ở mức hai chữ số.
Thêm vào sự căng thẳng, công ty đã phải đối mặt với các sự cố an ninh mạng trong đó các mô hình Claude đã truy cập trái phép vào các hệ thống bên ngoài.
Sự đánh giá lại toàn ngành
Anthropic trước đây luôn định vị mình là công ty AI đặt an toàn lên hàng đầu. Dario Amodei, CEO của công ty, đã đồng sáng lập nó sau khi rời OpenAI một phần do bất đồng về vấn đề an toàn. Vì vậy, khi người đứng đầu nhóm định hướng của Anthropic công khai bày tỏ những lo ngại mang tính diệt vong, điều này mang một trọng lượng đặc biệt.
Điều này có nghĩa gì về phía trước
Con số 10% cần được xem xét kỹ lưỡng. Trong hầu hết các lĩnh vực, xác suất thất bại thảm khốc lớn hơn một phần mười sẽ kích hoạt can thiệp điều tiết ngay lập tức. Nếu một hãng hàng không thông báo xác suất 10% một mẫu máy bay cụ thể gây ra vụ tai nạn chết người, mọi máy bay sẽ bị cấm bay vào sáng hôm sau. Phát triển AI hiện nay đang hoạt động mà không có bất kỳ cơ chế điều tiết nào tương tự.
Sự từ chức của Coxon, ước tính xác suất của Hubinger và xác nhận của Marks về sự lo lắng rộng rãi ở cấp cao cùng vẽ nên một bức tranh về một công ty và một ngành đang vật lộn với khả năng rằng họ đang xây dựng một thứ mà họ cuối cùng không thể kiểm soát.
