На короткий, прекрасний момент у січні 2025 року моделі ШІ з відкритим вагом наздогнали своїх закритих конкурентів. Різниця в оцінці Elo на зборіcrowdsourced лідерах Arena досягла нуля. Паритет.
Цей момент минув. За даними оцінки Arena AI, станом на вересень 2026 року розрив між найкращими закритими фронтальними моделями та їхніми найсильнішими конкурентами з відкритою вагою збільшився до 29 ело-балів. Claude Opus 5 Max має рейтинг 1505, тоді як Kimi K3 Max від Moonshot AI, найсильніша модель з відкритою вагою, відстає майже на 30 балів. Пітер Гостєв, керівник з можливостей ШІ в Arena, був у центрі спостереження та візуалізації цієї розбіжності.
Що означають ці числа
Траєкторія розповідає більш цікаву історію, ніж будь-який окремий знімок. Від нуля у січні 2025 року до 29 балів у вересні 2026 року лінія тренду рухається в неправильному напрямку для прихильників відкритих моделей. Аналіз Epoch AI підтверджує цю картину з іншого боку: відкриті моделі зараз відстають від закритих приблизно на чотири місяці за продуктивністю на найскладніших завданнях. Це збільшення з три-місячного відставання, яке спостерігалося до кінця 2025 року.
Arena обробляє понад 10 мільйонів оцінок щомісяця, опираючись на величезний масив реальних взаємодій користувачів, а не синтетичних тестів. Коли мільйони анонімних користувачів постійно віддають перевагу виводам однієї моделі над іншою, цей сигнал важко ігнорувати.
Бізнес вимірювання ШІ
Arena сама перетворилася на захопливу бізнес-історію. Те, що почалося як дослідницький проект UC Berkeley у 2023 році, перетворилося на підприємство, яке отримує $100 мільйонів річного доходу. Цього рівня досягнуто лише через вісім місяців після запуску платних оціночних послуг.
Спеціальний внесок Гостєва полягав у тому, щоб зробити слабкі місця моделей наочними. Його робота підкреслює напруженість між тим, як моделі виявляються при оцінці експертами у галузі та звичайними користувачами — різниця, яка має надзвичайне значення для підприємницьких впроваджень.
Геополітика відкритих моделей
Найбільш активна розробка моделей з відкритим ваговим розміром значно змістилася до китайських лабораторій. Серія Kimi від Moonshot AI, GLM від Zhipu, DeepSeek та Qwen від Alibaba представляють передовий рівень того, що доступно публічно. Проте розрив залишається. Anthropic, OpenAI та Google DeepMind продовжують швидше й далі розвивати свої закриті моделі.
