Por um breve e belo momento em janeiro de 2025, os modelos de IA de peso aberto alcançaram seus rivais de código fechado. A diferença de classificação Elo no ranking colaborativo da Arena chegou a zero. Paridade.
Aquele momento acabou. A partir de setembro de 2026, a diferença entre os melhores modelos fronteiriços fechados e seus principais concorrentes de peso aberto aumentou para 29 pontos Elo, segundo os dados de avaliação da Arena AI. O Claude Opus 5 Max está com uma pontuação de 1505, enquanto o Kimi K3 Max da Moonshot AI, o concorrente de peso aberto mais forte, fica quase 30 pontos atrás. Peter Gostev, Líder de Capacidade de IA da Arena, tem estado no centro do rastreamento e visualização dessa divergência.
O que os números realmente significam
A trajetória conta uma história mais interessante do que qualquer snapshot único. De zero em janeiro de 2025 para 29 pontos em setembro de 2026, a linha de tendência está se movendo na direção errada para os defensores de pesos abertos. A análise da Epoch AI reforça essa imagem sob um ângulo diferente: os modelos de pesos abertos agora estão atrasados em cerca de quatro meses em relação aos seus equivalentes fechados no desempenho nas tarefas mais desafiadoras. Isso representa um aumento em relação ao atraso de três meses observado até o final de 2025.
A Arena processa mais de 10 milhões de avaliações mensalmente, baseando-se em um grande conjunto de interações reais de usuários, e não em benchmarks sintéticos. Quando milhões de usuários anônimos consistentemente preferem as saídas de um modelo em relação a outro, esse sinal é mais difícil de ignorar.
O negócio de medir IA
A própria Arena tornou-se uma história de negócios fascinante. O que começou como um projeto de pesquisa da UC Berkeley em 2023 transformou-se em uma empresa que gera US$ 100 milhões em receita anualizada. Alcançou esse ritmo de receita em apenas oito meses após o lançamento dos serviços de avaliação pagos.
A contribuição específica de Gostev concentrou-se em tornar as fraquezas dos modelos visíveis. Seu trabalho destaca a tensão entre o desempenho dos modelos quando avaliados por especialistas do domínio em comparação com usuários gerais, uma distinção que é extremamente importante para implantações empresariais.
A geopolítica dos modelos abertos
O desenvolvimento mais ativo de modelos de peso aberto deslocou-se fortemente em direção aos laboratórios chineses. A série Kimi da Moonshot AI, o GLM da Zhipu, o DeepSeek e o Qwen da Alibaba representam a fronteira do que está publicamente disponível. No entanto, a lacuna persiste. Anthropic, OpenAI e Google DeepMind continuam a impulsionar seus modelos fechados ainda mais longe e mais rápido.
