20億パラメータのみのモデルが、Artificial Analysis Intelligence Index v4.2において、40億パラメータ未満のオープンモデルでトップの座を獲得し、15点を記録しました。清華大学NLP研究室とModelBestと協力して開発されたOpenBMBのMiniCPM5-2Bは、計算リソースが贅沢ではなく、限られた環境であるスマートフォンやラップトップその他のデバイスで動作することを目的としています。
ベンチマークが実際に測定するもの
Artificial Analysisは2026年9月4日に、MiniCPM5-2Bのリリースからちょうど3日前に、Intelligence Indexのバージョン4.2をリリースしました。更新されたインデックスは、AIモデルの評価方法に意味のある変更を導入しました。
プライベートテストの重みが以前のバージョンから40%に増加しました。これは、プライベートテストが操作しづらいため重要です。モデル開発者が試験問題を事前に見ることができない場合、スコアは真の能力をより信頼できる指標として示します。
v4.2アップデートには、新しい評価コンポーネントとして、AA-Briefcaseエージェント評価とSurgeのGDP.pdf長文コンテキストテストが追加されました。これらの追加は、単にトリビア質問に優れた回答ができるだけでなく、自律的に行動し、非常に長い文書を処理できるモデルに対する業界の関心の高まりを反映しています。
全体のリーダーボードの上位には、独自モデルが依然として支配的です。AnthropicのClaude Fable 5.1が首位を走っています。しかし、計算能力よりも効率性とアクセスのしやすさが重要な40億パラメータ未満のカテゴリでは、MiniCPM5-2Bがオープンウェイトランキングのトップに位置しています。
小型のモデル、広範な野心
MiniCPM5-2Bはディンストランスフォーマーであり、推論中にすべてのパラメータが活性化されます。これはモイチャー・オブ・エキスパートアーキテクチャを通じてルーティングされるのとは異なります。ディンスモデルはリソース消費がより予測可能である傾向があり、エッジデバイスにAIをデプロイする際にまさに求められる特性です。
モデルは設定に応じて、131Kから512Kトークンまでのコンテキストウィンドウをサポートしています。参考までに、512Kトークンは約1,000ページの本を一度に処理するのに相当します。
OpenBMBは、AMD、Intel、MediaTek、およびQualcommのチップ向けにMiniCPM5-2Bを最適化しました。
能力面において、チームはコーディング、数学、長文理解、ツール利用、エージェントワークフローにおいて、そのパラメータ範囲内で最先端のパフォーマンスを達成していると主張しています。
モデルの学習には、強化学習のアライメントと、OpenBMBが高品質なトレジャクトリーと説明する手法が取り入れられ、複雑な逐次的意思決定をモデルが処理する能力を向上させるために設計されています。
MiniCPMの系統
MiniCPM5-2Bは実績を踏襲しています。その前世代であるMiniCPM5-1Bは、以前のバージョンのArtificial Analysis Indexで17.9のスコアを記録し、20億パラメータ未満のモデルの中で最上位の位置を獲得しました。
2つのモデルのスコア差、1Bバージョンが17.9、2Bバージョンが15であることは、後退を示すものではなく、インデックスの方法論の変更を反映しています。バージョン4.2はプライベートテストセットへの依存度が高まり、新しい評価カテゴリが追加されたため、バージョン間のスコアは直接比較できません。
これはデバイス内AIにどのような意味を持つのか
小規模モデルの競争環境は混雑してきています。MetaのLlamaシリーズ、MicrosoftのPhiモデル、GoogleのGemmaバリエーションはすべて類似のパラメータ範囲で競争しています。MiniCPM5-2Bが4B未満カテゴリでベンチマークリーダーであることは注目すべきですが、ベンチマークでの優位性と実際の利用価値は常に一致するとは限りません。
モデルの主張するパフォーマンスの独立した検証は、まだ公に文書化されていません。AIベンチマーキングにおいて、結果の第三者による再現性は、プレスリリースと実証された能力との差です。
