Một mô hình chỉ với 2 tỷ tham số đã chiếm vị trí số một trong số các mô hình mở dưới 4 tỷ tham số trên Chỉ số Trí tuệ Artificial Analysis v4.2, đạt 15 điểm. MiniCPM5-2B của OpenBMB, được xây dựng phối hợp với phòng NLP của Đại học Thanh Hoa và ModelBest, được thiết kế để chạy trên điện thoại, máy tính xách tay và các thiết bị khác nơi tài nguyên tính toán là điều quý giá, không phải điều hiển nhiên.
Thực tế thì chỉ số chuẩn này đo lường gì
Artificial Analysis đã phát hành phiên bản 4.2 của Chỉ số Trí tuệ vào ngày 4 tháng 9 năm 2026, chỉ ba ngày trước khi MiniCPM5-2B ra mắt. Chỉ số được cập nhật đã giới thiệu những thay đổi đáng kể trong cách đánh giá các mô hình AI.
Các bộ kiểm tra riêng hiện chiếm 40% trọng số tổng thể, tăng so với các phiên bản trước. Điều này quan trọng vì các bài kiểm tra riêng khó bị thao túng hơn. Khi các nhà phát triển mô hình không thể xem trước các câu hỏi kiểm tra, điểm số trở thành tín hiệu đáng tin cậy hơn về năng lực thực sự.
Bản cập nhật v4.2 cũng thêm hai thành phần đánh giá mới: đánh giá agentic AA-Briefcase và bài kiểm tra dài Surge’s GDP.pdf. Những bổ sung này phản ánh sự quan tâm ngày càng tăng của ngành đối với các mô hình có thể hành động tự chủ và xử lý các tài liệu rất dài, chứ không chỉ trả lời tốt các câu hỏi trivia.
Ở vị trí đầu bảng xếp hạng tổng thể, các mô hình sở hữu vẫn chiếm ưu thế. Claude Fable 5.1 của Anthropic dẫn đầu. Nhưng trong danh mục dưới 4 tỷ tham số, nơi hiệu quả và khả năng tiếp cận quan trọng hơn sức mạnh thuần túy, MiniCPM5-2B đứng đầu bảng xếp hạng mở trọng số.
Mô hình nhỏ, tham vọng lớn
MiniCPM5-2B là một mô hình transformer dày đặc, nghĩa là mọi tham số đều được kích hoạt trong quá trình suy luận thay vì được định tuyến thông qua kiến trúc mixture-of-experts. Các mô hình dày đặc thường có mức tiêu thụ tài nguyên dễ dự đoán hơn, điều này chính xác là những gì bạn muốn khi triển khai AI lên các thiết bị biên.
Mô hình hỗ trợ cửa sổ ngữ cảnh từ 131K đến 512K token tùy theo cấu hình. Để tham khảo, 512K token tương đương khoảng xử lý một cuốn sách 1.000 trang trong một lần duy nhất.
OpenBMB đã tối ưu hóa MiniCPM5-2B cho các chip từ AMD, Intel, MediaTek và Qualcomm.
Về mặt khả năng, đội ngũ tuyên bố đạt hiệu suất tiên tiến nhất trong phạm vi tham số của nó across coding, mathematics, long-context understanding, tool utilization, và agentic workflows.
Việc huấn luyện mô hình đã kết hợp sự điều chỉnh học tăng cường và những quỹ đạo chất lượng cao mà OpenBMB mô tả, các kỹ thuật được thiết kế để cải thiện cách mô hình xử lý các quyết định phức tạp, tuần tự.
Dòng họ MiniCPM
MiniCPM5-2B xây dựng trên nền tảng đã có. Người tiền nhiệm của nó, MiniCPM5-1B, trước đây đạt 17.9 trên phiên bản trước của Chỉ số Phân tích Nhân tạo, đứng đầu trong số các mô hình có dưới 2 tỷ tham số.
Sự khác biệt điểm số giữa hai mô hình, 17,9 cho phiên bản 1B và 15 cho phiên bản 2B, phản ánh những thay đổi trong phương pháp tính chỉ số chứ không phải là sự thụt lùi. Việc phiên bản 4.2 phụ thuộc nhiều hơn vào các bộ kiểm tra riêng và các danh mục đánh giá mới có nghĩa là điểm số giữa các phiên bản không thể so sánh trực tiếp.
Điều này có nghĩa gì đối với AI trên thiết bị
Bối cảnh cạnh tranh cho các mô hình nhỏ ngày càng trở nên đông đúc. Các mô hình Llama của Meta, các mô hình Phi của Microsoft và các biến thể Gemma của Google đều cạnh tranh trong các phạm vi tham số tương tự. Việc MiniCPM5-2B dẫn đầu trong các bài kiểm tra ở danh mục dưới 4B là đáng chú ý, nhưng sự thống trị trong bài kiểm tra và tính hữu dụng thực tế không luôn đi cùng nhau.
Việc xác minh độc lập về hiệu suất mà mô hình tuyên bố chưa được tài liệu hóa công khai. Trong đánh giá hiệu năng AI, việc bên thứ ba tái tạo lại kết quả là sự khác biệt giữa một thông cáo báo chí và một khả năng đã được chứng minh.
