Um modelo com apenas 2 bilhões de parâmetros conquistou o primeiro lugar entre os modelos abertos com menos de 4 bilhões de parâmetros no Artificial Analysis Intelligence Index v4.2, com pontuação de 15 pontos. O MiniCPM5-2B da OpenBMB, desenvolvido em colaboração com o laboratório de NLP da Universidade Tsinghua e a ModelBest, foi projetado para funcionar em telefones, laptops e outros dispositivos onde os recursos computacionais são um luxo, e não uma certeza.
O que o benchmark realmente mede
A Artificial Analysis lançou a versão 4.2 do seu Índice de Inteligência em 4 de setembro de 2026, apenas três dias antes do lançamento do MiniCPM5-2B. O índice atualizado introduziu mudanças significativas na forma como os modelos de IA são avaliados.
Os conjuntos de teste privados agora representam 40% do peso total, em comparação com versões anteriores. Isso é importante porque os testes privados são mais difíceis de manipular. Quando os desenvolvedores de modelos não conseguem ver as questões da prova antecipadamente, as pontuações se tornam sinais mais críveis de capacidade genuína.
A atualização v4.2 também adicionou dois novos componentes de avaliação: a avaliação agente AA-Briefcase e o teste de contexto longo GDP.pdf da Surge. Essas adições refletem o crescente interesse da indústria por modelos que possam agir de forma autônoma e processar documentos muito longos, e não apenas responder bem a perguntas de trivia.
No topo do ranking geral, modelos proprietários ainda dominam. O Claude Fable 5.1 da Anthropic lidera. Mas na categoria abaixo de 4B de parâmetros, onde eficiência e acessibilidade são mais importantes do que poder bruto, o MiniCPM5-2B ocupa o topo dos rankings de pesos abertos.
Pequeno modelo, ambições amplas
MiniCPM5-2B é um transformer denso, o que significa que todos os parâmetros estão ativos durante a inferência, em vez de serem roteados por uma arquitetura de mistura de especialistas. Modelos densos tendem a ser mais previsíveis em seu consumo de recursos, o que é exatamente o que você deseja ao implantar IA em dispositivos de borda.
O modelo suporta janelas de contexto que variam de 131K a 512K tokens, dependendo da configuração. Para referência, 512K tokens é aproximadamente equivalente a processar um livro de 1.000 páginas em uma única passagem.
OpenBMB otimizou o MiniCPM5-2B para chips da AMD, Intel, MediaTek e Qualcomm.
No que diz respeito à capacidade, a equipe afirma desempenho de ponta dentro de sua faixa de parâmetros em programação, matemática, compreensão de contextos longos, utilização de ferramentas e fluxos de trabalho agentes.
O treinamento do modelo incorporou alinhamento por aprendizado por reforço e o que o OpenBMB descreve como trajetórias de alta qualidade, técnicas projetadas para melhorar como o modelo lida com tomada de decisões complexas e sequenciais.
A linhagem MiniCPM
MiniCPM5-2B se baseia em um histórico. Seu antecessor, MiniCPM5-1B, anteriormente obteve 17.9 em uma versão anterior do Índice de Análise Artificial, ocupando a primeira posição entre os modelos com menos de 2 bilhões de parâmetros.
A diferença de pontuação entre os dois modelos, 17,9 para a versão de 1B e 15 para a versão de 2B, reflete alterações na metodologia do índice, e não um retrocesso. A maior dependência da versão 4.2 em conjuntos de teste privados e novas categorias de avaliação significa que as pontuações entre as versões não são diretamente comparáveis.
O que isso significa para a IA no dispositivo
O cenário competitivo para modelos pequenos está ficando mais movimentado. Os modelos Llama da Meta, os modelos Phi da Microsoft e as variantes Gemma da Google competem em faixas de parâmetros semelhantes. A liderança do MiniCPM5-2B nos benchmarks da categoria abaixo de 4B é notável, mas o domínio nos benchmarks e a utilidade no mundo real nem sempre andam de mãos dadas.
A validação independente do desempenho afirmado pelo modelo ainda não foi documentada publicamente. Na avaliação de IA, a reprodução dos resultados por terceiros é a diferença entre um comunicado de imprensa e uma capacidade comprovada.
