Chính phủ Hoa Kỳ đã cho mô hình AI mới nhất của Trung Quốc trải qua bài kiểm tra xâm nhập. Kết quả cho thấy mô hình Kimi K3 của Moonshot AI còn kém xa các mô hình hàng đầu của Mỹ.
Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI), một cơ quan của Mỹ, đã thực hiện các bài kiểm tra cùng một đối tác Anh. Kết quả được công bố chỉ một ngày sau khi Washington buộc tội Moonshot xây dựng Kimi K3 bằng công nghệ Mỹ bị đánh cắp.
Kimi K3 không đáp ứng được các tiêu chuẩn an ninh mạng của Mỹ
Bộ Thương mại đã công bố kết quả vào thứ Năm. Bộ cho biết Kimi K3 xếp dưới xa các mô hình hàng đầu của Mỹ, dựa trên một cuộc kiểm tra chung với các chuyên gia Anh.
Moonshot đã ra mắt Kimi K3 vào ngày 16 tháng Bảy. Nhu cầu quá cao nên họ phải tạm dừng đăng ký mới trong vòng hai ngày.
Việc ra mắt cũng làm rung chuyển các cổ phiếu bán dẫn của Mỹ và dấy lên những nghi ngờ mới về lợi thế AI của Mỹ.
Một bài kiểm tra có tên ExploitBench sử dụng các lỗ hổng trình duyệt Chrome thực tế do Đại học Carnegie Mellon xây dựng. Kimi K3 đạt 32%. Con số này cao hơn GLM-5.2 của Trung Quốc ở mức 24%. Tuy nhiên, nó vẫn thấp hơn các mô hình hàng đầu của Mỹ, đạt khoảng 76%.

Bước khó nhất là giành toàn bộ quyền kiểm soát máy mục tiêu. Kimi K3 đã thất bại ở bước này trong tất cả 41 bài kiểm tra. Các mô hình tốt nhất của Mỹ thực hiện được ở 20 bài.
Một bài kiểm tra khác, gọi là The Last Ones, là một cuộc tấn công mạng giả lập với 32 bước. Một chuyên gia con người cần khoảng 20 giờ để hoàn thành nó. Kimi K3 trung bình đạt đến bước 17. Các mô hình hàng đầu của Mỹ đạt đến bước 28,5. Kimi K3 chỉ hoàn thành toàn bộ bài kiểm tra một lần trong 10 lần thử.
Các hệ thống tốt nhất của Mỹ được cho là đã thực hiện sáu hoặc bảy lần.
Nhưng khoảng cách có thể trông lớn hơn thực tế
Nhưng những con số không nói lên toàn bộ câu chuyện. Phần chữ nhỏ trong báo cáo chứa vài điều kiện ràng buộc.
Đầu tiên, các mô hình của Mỹ đã được kiểm tra với các bộ lọc an toàn bị tắt. Cài đặt này cho thấy toàn bộ sức mạnh của chúng. Các phiên bản công cộng vẫn giữ các bộ lọc này hoạt động. Do đó, điểm số của Mỹ là trường hợp tốt nhất, không phải trong thực tế.
Đội ngũ cũng kết thúc công việc sớm và hạn chế. Nó chỉ đánh giá Kimi K3 trên một bài kiểm tra và chạy chỉ một phần của toàn bộ bộ test. Do đó, xếp hạng của nó không ổn định. Một số bài kiểm tra cũng là riêng tư, nên người ngoài không thể kiểm tra công việc.
Cũng có một sự không phù hợp cơ bản. Kimi K3 là một mô hình mở mà bất kỳ ai cũng có thể tải về. Các mô hình của Mỹ là các hệ thống bị khóa, riêng tư. Viện của Anh đã phát hiện rằng các mô hình mở thường chậm hơn bốn đến bảy tháng so với các mô hình đóng tốt nhất. Họ sẽ chỉ thực hiện bài kiểm tra toàn diện với Kimi K3 sau khi Moonshot phát hành nó cho công chúng.
Các bài kiểm tra này cũng không phải là các cuộc tấn công thật. Mạng giả không có người phòng thủ nào và không có cảnh báo nào để kích hoạt. Dù vậy, Kimi K3 đã đánh bại mô hình mở hàng đầu trước đó. Và nó đã hoàn thành toàn bộ cuộc tấn công một lần.
Thời gian và nguồn gốc cũng đặt ra những câu hỏi. CAISI từng là Viện An toàn AI của Mỹ. Chính quyền Trump đổi tên nó vào tháng 6 năm 2025. Nó nằm trong cùng bộ phận hạn chế việc bán chip của Mỹ cho Trung Quốc. Và báo cáo của nó về một đối thủ Trung Quốc được đưa ra chỉ một ngày sau khi có tuyên bố bị đánh cắp.
Các biện pháp bảo vệ yếu vẫn làm tăng mức độ rủi ro
Tuy nhiên, điểm số thấp không có nghĩa là Kimi K3 an toàn. Bài kiểm tra phát hiện các hàng rào bảo vệ của nó không ngăn được việc nó cố gắng xây dựng các cuộc tấn công hoặc xâm nhập hệ thống.
Điều đó quan trọng vì những gì sẽ xảy ra tiếp theo. Moonshot dự kiến phát hành mô hình đầy đủ vào ngày 27 tháng 7. Một khi được phát hành, nó không thể bị thu hồi. Bất kỳ ai cũng có thể tải về và gỡ bỏ các bộ lọc an toàn.
Bản kiểm tra cũng được thực hiện sau một cáo buộc về vụ trộm cắp. Washington cho rằng Moonshot đã xây dựng Kimi K3 trên công nghệ AI của Mỹ bị đánh cắp. Trưởng bộ phận công nghệ Nhà Trắng Michael Kratsios cho biết công ty đã bí mật sao chép Claude Fable 5 của Anthropic. Thủ thuật này, được gọi là chưng cất, đào tạo một mô hình mới dựa trên các câu trả lời của mô hình mạnh hơn.
Anthropic xác nhận tuyên bố này. Vào tháng Hai, nó truy vết hơn 3,4 triệu cuộc trò chuyện Claude đến Moonshot thông qua hàng trăm tài khoản giả. Nó cảnh báo rằng các mô hình bị sao chép sẽ mất các biện pháp kiểm soát an toàn của bản gốc. Đó chính là điểm yếu tương tự mà bài kiểm tra này vừa phát hiện.
Mỹ vẫn chi tiêu 23 lần nhiều hơn cho AI so với Trung Quốc. Tuy nhiên, các phòng thí nghiệm Trung Quốc tiếp tục thu hẹp khoảng cách. Kiểm tra thực sự sẽ diễn ra khi Kimi K3 chính thức ra mắt và các chuyên gia bên ngoài có thể tự kiểm tra các tuyên bố này.
