Kiểm thử mạng lưới Mỹ cho thấy Kimi K3 tụt hậu so với các mô hình AI hàng đầu của Mỹ

iconBeInCrypto
Chia sẻ
AI summary iconTóm tắt
Một đánh giá của chính phủ Hoa Kỳ cho thấy Kimi K3, do Moonshot AI phát triển, tụt hậu so với các mô hình AI hàng đầu của Mỹ về khả năng mạng. Bài kiểm tra do Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI) thực hiện cùng đối tác Anh cho thấy Kimi K3 đạt 32% trên bài kiểm tra ExploitBench, trong khi các mô hình Mỹ hàng đầu đạt 76%. Kimi K3 không thể kiểm soát hoàn toàn máy mục tiêu trong tất cả 41 lần thử nghiệm, trong khi các mô hình Mỹ tốt nhất thành công trong 20 lần. Kết quả này được đưa ra sau khi các quan chức Mỹ buộc tội Moonshot sử dụng công nghệ Mỹ bị đánh cắp để phát triển Kimi K3. Kết quả này có thể ảnh hưởng đến các nỗ lực CFT và phù hợp với trọng tâm của MiCA về tính minh bạch công nghệ.

Chính phủ Hoa Kỳ đã cho mô hình AI mới nhất của Trung Quốc trải qua bài kiểm tra xâm nhập. Kết quả cho thấy mô hình Kimi K3 của Moonshot AI còn kém xa các mô hình hàng đầu của Mỹ.

Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI), một cơ quan của Mỹ, đã thực hiện các bài kiểm tra cùng một đối tác Anh. Kết quả được công bố chỉ một ngày sau khi Washington buộc tội Moonshot xây dựng Kimi K3 bằng công nghệ Mỹ bị đánh cắp.

Được tài trợ
Được tài trợ

Kimi K3 không đáp ứng được các tiêu chuẩn an ninh mạng của Mỹ

Bộ Thương mại đã công bố kết quả vào thứ Năm. Bộ cho biết Kimi K3 xếp dưới xa các mô hình hàng đầu của Mỹ, dựa trên một cuộc kiểm tra chung với các chuyên gia Anh.

Moonshot đã ra mắt Kimi K3 vào ngày 16 tháng Bảy. Nhu cầu quá cao nên họ phải tạm dừng đăng ký mới trong vòng hai ngày.

Việc ra mắt cũng làm rung chuyển các cổ phiếu bán dẫn của Mỹ và dấy lên những nghi ngờ mới về lợi thế AI của Mỹ.

Một bài kiểm tra có tên ExploitBench sử dụng các lỗ hổng trình duyệt Chrome thực tế do Đại học Carnegie Mellon xây dựng. Kimi K3 đạt 32%. Con số này cao hơn GLM-5.2 của Trung Quốc ở mức 24%. Tuy nhiên, nó vẫn thấp hơn các mô hình hàng đầu của Mỹ, đạt khoảng 76%.

Khả năng phát triển khai thác
Kiểm tra các chỉ số năng lực phát triển khai thác. Nguồn: NIST
Được tài trợ
Được tài trợ

Bước khó nhất là giành toàn bộ quyền kiểm soát máy mục tiêu. Kimi K3 đã thất bại ở bước này trong tất cả 41 bài kiểm tra. Các mô hình tốt nhất của Mỹ thực hiện được ở 20 bài.

Một bài kiểm tra khác, gọi là The Last Ones, là một cuộc tấn công mạng giả lập với 32 bước. Một chuyên gia con người cần khoảng 20 giờ để hoàn thành nó. Kimi K3 trung bình đạt đến bước 17. Các mô hình hàng đầu của Mỹ đạt đến bước 28,5. Kimi K3 chỉ hoàn thành toàn bộ bài kiểm tra một lần trong 10 lần thử.

Các hệ thống tốt nhất của Mỹ được cho là đã thực hiện sáu hoặc bảy lần.

Nhưng khoảng cách có thể trông lớn hơn thực tế

Nhưng những con số không nói lên toàn bộ câu chuyện. Phần chữ nhỏ trong báo cáo chứa vài điều kiện ràng buộc.

Đầu tiên, các mô hình của Mỹ đã được kiểm tra với các bộ lọc an toàn bị tắt. Cài đặt này cho thấy toàn bộ sức mạnh của chúng. Các phiên bản công cộng vẫn giữ các bộ lọc này hoạt động. Do đó, điểm số của Mỹ là trường hợp tốt nhất, không phải trong thực tế.

Đội ngũ cũng kết thúc công việc sớm và hạn chế. Nó chỉ đánh giá Kimi K3 trên một bài kiểm tra và chạy chỉ một phần của toàn bộ bộ test. Do đó, xếp hạng của nó không ổn định. Một số bài kiểm tra cũng là riêng tư, nên người ngoài không thể kiểm tra công việc.

Cũng có một sự không phù hợp cơ bản. Kimi K3 là một mô hình mở mà bất kỳ ai cũng có thể tải về. Các mô hình của Mỹ là các hệ thống bị khóa, riêng tư. Viện của Anh đã phát hiện rằng các mô hình mở thường chậm hơn bốn đến bảy tháng so với các mô hình đóng tốt nhất. Họ sẽ chỉ thực hiện bài kiểm tra toàn diện với Kimi K3 sau khi Moonshot phát hành nó cho công chúng.

Các bài kiểm tra này cũng không phải là các cuộc tấn công thật. Mạng giả không có người phòng thủ nào và không có cảnh báo nào để kích hoạt. Dù vậy, Kimi K3 đã đánh bại mô hình mở hàng đầu trước đó. Và nó đã hoàn thành toàn bộ cuộc tấn công một lần.

Thời gian và nguồn gốc cũng đặt ra những câu hỏi. CAISI từng là Viện An toàn AI của Mỹ. Chính quyền Trump đổi tên nó vào tháng 6 năm 2025. Nó nằm trong cùng bộ phận hạn chế việc bán chip của Mỹ cho Trung Quốc. Và báo cáo của nó về một đối thủ Trung Quốc được đưa ra chỉ một ngày sau khi có tuyên bố bị đánh cắp.

Các biện pháp bảo vệ yếu vẫn làm tăng mức độ rủi ro

Tuy nhiên, điểm số thấp không có nghĩa là Kimi K3 an toàn. Bài kiểm tra phát hiện các hàng rào bảo vệ của nó không ngăn được việc nó cố gắng xây dựng các cuộc tấn công hoặc xâm nhập hệ thống.

Điều đó quan trọng vì những gì sẽ xảy ra tiếp theo. Moonshot dự kiến phát hành mô hình đầy đủ vào ngày 27 tháng 7. Một khi được phát hành, nó không thể bị thu hồi. Bất kỳ ai cũng có thể tải về và gỡ bỏ các bộ lọc an toàn.

Bản kiểm tra cũng được thực hiện sau một cáo buộc về vụ trộm cắp. Washington cho rằng Moonshot đã xây dựng Kimi K3 trên công nghệ AI của Mỹ bị đánh cắp. Trưởng bộ phận công nghệ Nhà Trắng Michael Kratsios cho biết công ty đã bí mật sao chép Claude Fable 5 của Anthropic. Thủ thuật này, được gọi là chưng cất, đào tạo một mô hình mới dựa trên các câu trả lời của mô hình mạnh hơn.

Anthropic xác nhận tuyên bố này. Vào tháng Hai, nó truy vết hơn 3,4 triệu cuộc trò chuyện Claude đến Moonshot thông qua hàng trăm tài khoản giả. Nó cảnh báo rằng các mô hình bị sao chép sẽ mất các biện pháp kiểm soát an toàn của bản gốc. Đó chính là điểm yếu tương tự mà bài kiểm tra này vừa phát hiện.

Mỹ vẫn chi tiêu 23 lần nhiều hơn cho AI so với Trung Quốc. Tuy nhiên, các phòng thí nghiệm Trung Quốc tiếp tục thu hẹp khoảng cách. Kiểm tra thực sự sẽ diễn ra khi Kimi K3 chính thức ra mắt và các chuyên gia bên ngoài có thể tự kiểm tra các tuyên bố này.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.