В краткий, прекрасный момент в январе 2025 года модели ИИ с открытым исходным кодом догнали своих закрытых конкурентов. Разница в рейтинге Elo на народном рейтинге Arena достигла нуля. Паритет.
Этот момент прошел. По состоянию на сентябрь 2026 года разрыв между лучшими закрытыми фронтальными моделями и их главными конкурентами с открытым весом увеличился до 29 пунктов Эло, согласно данным оценки Arena AI. Claude Opus 5 Max имеет рейтинг 1505, в то время как Kimi K3 Max от Moonshot AI, сильнейший конкурент с открытым весом, отстает почти на 30 пунктов. Пётр Гостев, руководитель по возможностям ИИ в Arena, находится в центре отслеживания и визуализации этого расхождения.
Что на самом деле означают эти числа
Траектория рассказывает более интересную историю, чем любой отдельный снимок. С нуля в январе 2025 года до 29 пунктов в сентябре 2026 года линия тренда движется в неправильном направлении для сторонников открытых моделей. Анализ Epoch AI подтверждает эту картинку с другой стороны: открытые модели сейчас отстают от закрытых примерно на четыре месяца по производительности на самых сложных задачах. Это увеличение с трехмесячного отставания, зафиксированного в конце 2025 года.
Arena обрабатывает более 10 миллионов оценок в месяц, опираясь на огромный массив реальных взаимодействий пользователей, а не синтетических тестов. Когда миллионы анонимных пользователей последовательно предпочитают выводы одной модели другим, этот сигнал трудно игнорировать.
Бизнес измерения ИИ
Arena сама по себе стала увлекательной бизнес-историей. То, что началось как исследовательский проект UC Berkeley в 2023 году, превратилось в предприятие с годовым доходом в 100 миллионов долларов. Этот уровень дохода был достигнут всего за восемь месяцев после запуска платных услуг оценки.
Специфический вклад Гостева сосредоточен на том, чтобы сделать слабости моделей видимыми. Его работа подчеркивает напряженность между тем, как модели демонстрируют результаты при оценке экспертами в области и обычными пользователями — различие, имеющее огромное значение для корпоративных внедрений.
Геополитика открытых моделей
Наиболее активная разработка моделей с открытым весом сместилась в сторону китайских лабораторий. Серия Kimi от Moonshot AI, GLM от Zhipu, DeepSeek и Qwen от Alibaba представляют собой передовые достижения в области публично доступных моделей. Однако разрыв сохраняется. Anthropic, OpenAI и Google DeepMind продолжают быстрее и дальше продвигать свои закрытые модели.
