Un modèle n'ayant que 2 milliards de paramètres a obtenu la première place parmi les modèles ouverts de moins de 4 milliards de paramètres sur l'Artificial Analysis Intelligence Index v4.2, avec un score de 15 points. MiniCPM5-2B d'OpenBMB, développé en collaboration avec le laboratoire NLP de l'Université Tsinghua et ModelBest, est conçu pour fonctionner sur des téléphones, des ordinateurs portables et d'autres appareils où les ressources informatiques sont un luxe, et non une évidence.
Ce que le benchmark mesure réellement
Artificial Analysis a publié la version 4.2 de son indice d'intelligence le 4 septembre 2026, juste trois jours avant le lancement de MiniCPM5-2B. L'indice mis à jour a introduit des changements significatifs dans la manière d'évaluer les modèles d'IA.
Les jeux de test privés représentent désormais 40 % du poids total, contre une proportion précédente plus faible. Cela est important car les tests privés sont plus difficiles à tricher. Lorsque les développeurs de modèles ne peuvent pas voir les questions de l'examen à l'avance, les scores deviennent des indicateurs plus crédibles de capacité réelle.
La mise à jour v4.2 a également ajouté deux nouveaux composants d'évaluation : l'évaluation agente AA-Briefcase et le test à long contexte GDP.pdf de Surge. Ces ajouts reflètent l'intérêt croissant de l'industrie pour les modèles capables d'agir de manière autonome et de traiter des documents très longs, et non seulement de bien répondre à des questions triviales.
En tête du classement général, les modèles propriétaires dominent toujours. Claude Fable 5.1 d'Anthropic mène la danse. Mais dans la catégorie sous 4 milliards de paramètres, où l'efficacité et l'accessibilité comptent plus que la puissance brute, MiniCPM5-2B occupe la première place du classement des modèles à poids ouverts.
Petit modèle, grandes ambitions
MiniCPM5-2B est un modèle transformer dense, ce qui signifie que chaque paramètre est actif lors de l'inférence, au lieu d'être acheminé via une architecture de mélange d'experts. Les modèles denses ont tendance à consommer des ressources de manière plus prévisible, ce qui est exactement ce que vous souhaitez lors du déploiement de l'IA sur des appareils périphériques.
Le modèle prend en charge des fenêtres de contexte allant de 131K à 512K jetons selon la configuration. À titre de référence, 512K jetons équivaut environ au traitement d'un livre de 1 000 pages en une seule passe.
OpenBMB a optimisé MiniCPM5-2B pour les puces de AMD, Intel, MediaTek et Qualcomm.
Du côté des capacités, l'équipe affirme des performances de pointe dans sa gamme de paramètres pour la programmation, les mathématiques, la compréhension de contextes longs, l'utilisation d'outils et les flux de travail agentic.
L'entraînement du modèle a intégré l'alignement par apprentissage par renforcement et ce que OpenBMB décrit comme des trajectoires de haute qualité, des techniques conçues pour améliorer la manière dont le modèle gère la prise de décision séquentielle complexe.
La lignée MiniCPM
MiniCPM5-2B s'appuie sur un historique. Son prédécesseur, MiniCPM5-1B, avait précédemment obtenu 17,9 sur une version antérieure de l'Indice d'analyse artificielle, occupant la première place parmi les modèles de moins de 2 milliards de paramètres.
La différence de score entre les deux modèles, 17,9 pour la version 1B et 15 pour la version 2B, reflète des modifications dans la méthodologie de l'indice et non un recul. La plus grande dépendance de la version 4.2 aux ensembles de tests privés et aux nouvelles catégories d'évaluation signifie que les scores entre les versions ne sont pas directement comparables.
Ce que cela signifie pour l'IA sur appareil
Le paysage concurrentiel des petits modèles devient de plus en plus saturé. Les séries Llama de Meta, les modèles Phi de Microsoft et les variantes Gemma de Google se disputent tous des plages de paramètres similaires. La suprématie de MiniCPM5-2B dans les benchmarks de la catégorie sous 4B est notable, mais la domination dans les benchmarks et l'utilité réelle ne progressent pas toujours de concert.
La validation indépendante des performances revendiquées par le modèle n'a pas encore été documentée publiquement. Dans l'évaluation de l'IA, la reproductibilité des résultats par un tiers fait la différence entre un communiqué de presse et une capacité avérée.
