僅有 20 億個參數的模型在 Artificial Analysis Intelligence Index v4.2 中,於參數少於 40 億的開放模型中奪得第一名,得分為 15 分。由 OpenBMB 與清華大學 NLP 實驗室及 ModelBest 合作開發的 MiniCPM5-2B,專為在手機、筆記型電腦及其他計算資源稀缺的裝置上運行而設計。
實際上衡量的基準是什麼
Artificial Analysis 於 2026 年 9 月 4 日發布了其 Intelligence Index 4.2 版本,僅在 MiniCPM5-2B 發布前三天。更新後的指數對 AI 模型的評估方式引入了重要變更。
私人測試集現佔總權重的 40%,較以往版本有所提升。這至關重要,因為私人測試較難操縱。當模型開發者無法提前看到考試題目時,分數便能更可信地反映真實能力。
v4.2 更新還新增了兩個評估組件:AA-Briefcase 代理評估和 Surge 的 GDP.pdf 長上下文測試。這些新增內容反映了業界對能夠自主行動並處理極長文檔的模型日益增長的興趣,而不僅僅是擅長回答冷知識問題。
在整體排行榜頂端,專有模型仍佔主導地位。Anthropic 的 Claude Fable 5.1 領先群雄。但在參數小於 4B 的類別中,效率和可及性比純粹算力更重要,MiniCPM5-2B 在開放權重排名中位居榜首。
小型模型,宏大願景
MiniCPM5-2B 是一個密集型變壓器,意味著在推論過程中每個參數都會被激活,而不是通過專家混合架構進行路由。密集型模型在資源消耗方面通常更可預測,這正是在邊緣設備上部署 AI 時所希望的。
該模型支援的上下文窗口為 131K 至 512K 個標記,具體取決於配置。作為參考,512K 個標記大約相當於一次性處理一本 1,000 頁的書籍。
OpenBMB 已為 AMD、Intel、MediaTek 和 Qualcomm 的晶片優化了 MiniCPM5-2B。
在能力方面,團隊聲稱在編程、數學、長上下文理解、工具使用和代理工作流程等參數範圍內實現了業界領先的表現。
該模型的訓練結合了強化學習對齊以及 OpenBMB 所描述的高品質軌跡,這些技術旨在提升模型處理複雜序列決策的能力。
MiniCPM 系列
MiniCPM5-2B 基於過往的表現。其前身 MiniCPM5-1B 曾在早期版本的人工分析指數中取得 17.9 分,在參數小於 20 億的模型中排名第一。
兩個模型的得分差異——1B 版本為 17.9,2B 版本為 15——反映的是指數方法論的變化,而非倒退。Version 4.2 更依賴私有測試集和新的評估類別,因此各版本的得分無法直接比較。
這對裝置端人工智慧意味著什麼
小型模型的競爭格局日趨擁擠。Meta的 Llama 系列、Microsoft的 Phi 模型以及Google的 Gemma 變體均在相似的參數範圍內競爭。MiniCPM5-2B 在 sub-4B 類別中的基準測試領先表現值得注意,但基準測試的主導地位與實際應用效能並不總是一致。
該模型聲稱的表現尚未有獨立驗證的公開記錄。在 AI 基準測試中,第三方重現結果是新聞稿與經證實能力之間的差異。
