Pour un bref et beau moment en janvier 2025, les modèles d’IA à poids ouvert ont rattrapé leurs concurrents à source fermée. L’écart de notation Elo sur le classement collaboratif d’Arena est tombé à zéro. Parité.
Ce moment est révolu. À partir de septembre 2026, l’écart entre les meilleurs modèles fermés et leurs principaux concurrents à poids ouvert a atteint 29 points Elo, selon les données d’évaluation d’Arena AI. Claude Opus 5 Max affiche une cote de 1505, tandis que Kimi K3 Max de Moonshot AI, le principal concurrent à poids ouvert, se trouve à près de 30 points de retard. Peter Gostev, responsable des capacités IA chez Arena, a été au cœur du suivi et de la visualisation de cette divergence.
Ce que signifient réellement ces chiffres
La trajectoire raconte une histoire plus intéressante que n’importe quelle capture unique. Passant de zéro en janvier 2025 à 29 points en septembre 2026, la ligne de tendance évolue dans la mauvaise direction pour les défenseurs des modèles à poids ouverts. L’analyse d’Epoch AI renforce cette image sous un angle différent : les modèles à poids ouverts sont désormais en retard d’environ quatre mois par rapport à leurs homologues fermés en termes de performance sur les tâches les plus complexes. Ce retard était de trois mois à la fin de 2025.
Arena effectue plus de 10 millions d'évaluations mensuelles, en s'appuyant sur un vaste ensemble d'interactions réelles d'utilisateurs plutôt que sur des benchmarks synthétiques. Lorsque des millions d'utilisateurs anonymes préfèrent de manière cohérente les résultats d'un modèle à ceux d'un autre, ce signal est plus difficile à ignorer.
Le métier de mesurer l'IA
Arena lui-même est devenu une histoire commerciale fascinante. Ce qui a commencé comme un projet de recherche de l'UC Berkeley en 2023 s'est transformé en une entreprise générant 100 millions de dollars de revenus annuels. Elle a atteint ce rythme de chiffre d'affaires en seulement huit mois après le lancement de ses services d'évaluation payants.
La contribution spécifique de Gostev s'est concentrée sur la rendue visible des faiblesses des modèles. Son travail met en lumière la tension entre les performances des modèles évaluées par des experts du domaine et celles évaluées par des utilisateurs généraux, une distinction cruciale pour les déploiements professionnels.
La géopolitique des modèles ouverts
Le développement des modèles à poids ouverts le plus actif s'est fortement déplacé vers les laboratoires chinois. La série Kimi de Moonshot AI, GLM de Zhipu, DeepSeek et Qwen d'Alibaba représentent la frontière de ce qui est publiquement disponible. Toutefois, le fossé persiste. Anthropic, OpenAI et Google DeepMind continuent de pousser leurs modèles fermés encore plus loin et plus vite.
