Срок годности «самой мощной модели» сокращается.Автор статьи, источник: Диньяо
За один месяц было одновременно выпущено девять флагманских моделей, что нечасто встречается в индустрии крупных моделей.
С начала месяца, с выпуском и открытием исходного кода Tencent Hunyuan Hy3, до конца месяца, когда Anthropic выпустила Claude Opus 5, поочередно появились модели Kimi K3, Qwen3.8-Max (предварительная версия), Grok 4.5 и другие. Июль стал редким пиком выпусков за последний год.

Разные компании выбирают разные временные точки. Некоторые производители выходят на рынок после обновления конкурентов, другие — в период проведения Всемирного конгресса по искусственному интеллекту, а третьи реагируют на конкуренцию на рынке с помощью корректировки цен.
Но в июле важно не только количество выпущенных моделей, но и два изменения, которые они отражают.
Во-первых, разрыв в возможностях между моделями сокращается. Последний комплексный индекс искусственного анализа показывает, что разница между ведущими моделями значительно сократилась. Благодаря быстрой итерации версий позиция «самой мощной модели» становится все труднее удерживать долгосрочно, и компании начинают искать преимущества в различных задачах, а не стремиться к абсолютному лидерству по одному измерению.
Во-вторых, открытые модели теперь входят в первый эшелон. Среди новых моделей, выпущенных в июле, Tencent Hunyuan Hy3, Kimi K3 и другие выбрали открытые веса (открытые параметры модели, позволяющие разработчикам самостоятельно загружать и развертывать их). При этом Kimi K3 занимает первое место в рейтинге фронтенд-программирования Code Arena, обогнав GPT-5.6 Sol и Claude Fable 5. В течение последних двух лет открытые модели воспринимались в основном как последователи закрытых моделей, но в этой волне конкуренции стало очевидно, что открытые модели уже напрямую конкурируют с закрытыми моделями в некоторых сценариях разработки.
Так что же именно изменилось и что это значит после этого месяца интенсивных выпусков?
01. Больше не только о том, кто умнее
В последние несколько лет в индустрии крупных моделей основное внимание уделялось универсальным способностям: чей объем знаний шире и чьи ответы точнее. Но теперь измерения конкуренции изменились.
На этом этапе навыки программирования стали наиболее очевидным направлением борьбы.
OpenAI продолжает укреплять возможности программирования и сложных рассуждений, а также расширяет экосистему Codex, стремясь привязать программистов с помощью инструментов. Anthropic делает ставку на понимание кода и аудит безопасности, помогая разработчикам решать сложные инженерные задачи в крупных проектах. Grok 4.5 акцентирует внимание на скорости и низкой стоимости, интегрируясь с инструментом AI-программирования Cursor для охвата повседневных сценариев разработки.
Исследователь крупных моделей Яо Юйхан сказал «Диньцзяо One», что все компании активно инвестируют в программные способности, и разрыв быстро сокращается — например, способность Kimi K3 к кодированию значительно улучшилась и приближается к уровню ведущих закрытых моделей.

Источник изображения / pexels
Агенты — это еще одно направление, за которое борются различные компании. GPT-5.6 Sol в сочетании с Codex исследует автоматизированное программирование, Opus 5 акцентирует внимание на выполнении долгосрочных задач, Kimi K3 демонстрирует способность к непрерывной работе и выполнению сложных задач, а Tencent Hunyuan Hy3 пытается объединить экосистему WeChat для исследования применения агентов.
Однако агенты в реальной работе всё ещё несовершенны. Независимый разработчик Бэйчэн отметил, что текущие слабые стороны некоторых продуктов-агентов заключаются не в способности вызывать инструменты, а в способности планировать задачи. Например, режим Ultra Codex запускает множество подагентов, которые повторно читают один и тот же файл и выполняют схожий анализ, в результате чего увеличивается потребление токенов, но реальный полезный труд не возрастает. По его мнению, повышение возможностей агентов не может основываться только на увеличении количества подагентов; ключевым является способность определять, какие задачи стоит анализировать, а какие шаги можно опустить.
Мнение Яо Юйханя схоже. Он считает, что агенты — это сейчас самое перспективное направление, однако до настоящей зрелости им еще далеко. По его мнению, в вертикальных областях, таких как здравоохранение и финансы, у агентов остается большой потенциал; ключевым фактором, определяющим разрыв между участниками на следующем этапе, будет не только способность модели, но и то, насколько удобны агенты в конкретных сценариях и готовы ли клиенты за них платить.
Китайские модели ищут прорывы за счет улучшения различных навыков. Kimi K3 сосредоточился на усилении способностей к работе с длинным контекстом, фронтенд-программированию и дизайну продуктов, заняв ведущие позиции в нескольких тестах по программированию и приблизившись по возможностям к зарубежным закрытым флагманским моделям.
Конкуренция между масштабом параметров и эффективностью вывода также стала еще одной основной линией.
В июле было выпущено несколько моделей с параметрами в триллионы и даже десятки триллионов, однако размер параметров уже нельзя просто сопоставлять с уровнем производительности. С развитием архитектуры MoE модели могут обладать большей параметрической емкостью, одновременно активируя лишь небольшую часть для выполнения вывода, что снижает фактические вычислительные затраты.
Отрасль сформировала два направления: первое — дальнейшее масштабирование с использованием больших параметров для достижения более высокой производительности; второе — акцент на эффективности с использованием меньшего количества активируемых параметров для достижения результатов, близких к флагманским моделям.
Цена также стала самым прямым фактором в конкурсе моделей в июле.
Зарубежные производители чаще применяют стратегию дифференцированного ценообразования. OpenAI выбрала дальнейшее сегментирование рынка, разделив GPT-5.6 на различные версии, чтобы пользователи могли выбирать модель в зависимости от сложности задачи; Anthropic продолжает придерживаться стратегии высокопроизводительных флагманских моделей, охватывая высокоценные разработки и корпоративные сценарии с помощью серии Opus; Grok 4.5, напротив, применяет стратегию низких цен, предлагая стоимость вывода всего в четверть от серии Opus и привлекая разработчиков за счет интеграции с Cursor.
Отечественные производители больше акцентируют внимание на преимуществах по стоимости. За последние полгода несколько отечественных производителей моделей неоднократно снижали цены на API, стремясь снизить барьеры для входа за счет низкой стоимости и расширить базу разработчиков и корпоративных пользователей.
В июле конкуренция среди крупных моделей расширилась с единичных показателей на несколько измерений: код, агенты, эффективность параметров и цена.
02. Кто превзошел ожидания, а кто вызвал противоречивые отзывы?
С учетом изменений по сравнению с предыдущей версией, результатов в рейтингах и отзывов разработчиков, уровни моделей, выпущенных в июле, можно условно разделить на три категории.
Сначала рассмотрим категории, превзойдшие ожидания: Kimi K3, Grok 4.5, Hunyuan Hy3.
Наибольшее внимание привлекла модель Kimi K3. Эта модель использует архитектуру MoE и имеет общий объем параметров на уровне триллионов, с особым упором на улучшение способностей к работе с длинными контекстами, фронтенд-программированием и дизайном продуктов. В день выпуска Kimi K3 заняла первое место в рейтинге фронтенд-программирования Code Arena с результатом 1679 баллов, поднявшись на 17 позиций по сравнению с 18-м местом предыдущей версии Kimi K2.6. Через неделю Kimi K3 впервые вошла в топ-10 мирового рейтинга Arena.
Однако у Kimi K3 также есть явные границы возможностей. В тесте на надежность знаний Artificial Analysis уровень галлюцинаций вырос с 39% у Kimi K2.6 до 51%, а скорость вывода составляет около 33 токенов/с, что значительно ниже, чем у аналогичных моделей.
Практический опыт разработчиков также подтверждает эту «специализацию». Бэйчэн считает, что Kimi K3 действительно значительно улучшился по сравнению с предыдущей версией, причем преимущества сосредоточены в основном на фронтенд-разработке, дизайне интерфейса и продуктовой подаче. Например, при оптимизации веб-интерфейса или проектировании интерфейса приложения Kimi K3 способен создавать более качественные продукты, однако при выполнении сложных инженерных задач его производительность нестабильна.

Источник изображения / pexels
Также внимания заслуживает Grok 4.5. После выпуска 9 июля он вошел в число лидеров интеллектуального индекса Artificial Analysis и показал отличные результаты в тестах вызова инструментов, став для многих разработчиков выгодным выбором.
Северный город ощущает то же самое и считает, что главное преимущество Grok 4.5 — это скорость: на выполнение одной и той же задачи может потребоваться всего три-пять минут, тогда как GPT-5.6 иногда требует двадцать минут или даже полчаса. Кроме того, из-за более низкой цены Grok 4.5 идеально подходит для ситуаций, требующих быстрой разработки. Яо Юйхан считает, что возможности Grok 4.5 в программировании были специально оптимизированы, и совместное использование с Cursor обеспечивает отличный общий опыт. В качестве фона: ранее SpaceX объявила о приобретении материнской компании Cursor — Anysphere; сделка ожидается завершением в третьем квартале; сотрудничество xAI с Cursor в области данных также считается способствовавшим улучшению программного опыта Grok 4.5.
Hunyuan Hy3 представляет собой прорыв в направлении эффективности. Общее количество параметров этой модели составляет 295 млрд, при этом активируемых параметров всего 21 млрд. При размере, менее чем в пять раз меньшем, чем у флагманской модели, она показывает результаты, близкие к более крупным конкурентным моделям на нескольких открытых тестах. Однако в SWE-Bench Pro результат Hunyuan Hy3 — 57,9 балла — значительно уступает результату Claude Opus — 69,2 балла, что указывает на необходимость дальнейшего совершенствования способности к сложному исправлению кода.
Яо Юйхан считает, что Хуньюань Hy3 демонстрирует прогресс по сравнению с предыдущими моделями Tencent, а благодаря открытому исходному коду и компактному дизайну является неплохим выбором среди моделей среднего размера.
Теперь рассмотрим класс, который стабильно находится в первом эшелоне, но не предлагает особых сюрпризов: GPT-5.6 Sol и Claude Opus 5.
GPT-5.6 Sol и Claude Opus 5 остаются на уровне первого эшелона, но не принесли существенных изменений. GPT-5.6 Sol улучшил способности к сложным рассуждениям и программированию агентов, показав результат 88,8% в тесте Terminal-Bench 2.1 (бенчмарк, оценивающий способность модели выполнять реальные задачи в командной строке), а в режиме Ultra этот показатель повысился до 91,9%. Claude Opus 5 сохраняет свои преимущества в сложных задачах, уделяя больше внимания надежности модели в сценариях, связанных со сложной инженерией, пониманием кода и анализом безопасности. Преимущество Opus 5 заключается в том, что его производительность близка к Fable 5, при этом цена составляет лишь половину от стоимости последнего.
Обе модели остаются в первом эшелоне, но не принесли значительных прорывов.
Северный город отметил, что GPT-5.6 уже способен покрыть большинство его повседневных задач разработки, но при столкновении с особенно сложными проблемами он использует Opus 5. Однако более высокая мощность означает и более высокую стоимость. Для него Opus 5 выполняет роль «эксперта», которого вызывают для решения ключевых задач.
Наконец, категория с разноречивыми отзывами и требующая дальнейшей проверки: Gemini 3.6 Flash и предварительная версия Qwen3.8-Max.
Самым типичным примером является Gemini 3.6 Flash. Он набрал 50 баллов в рейтинге Artificial Analysis, что соответствует предыдущей версии 3.5 Flash. Сообщество разработчиков в целом отмечает, что эта версия не показывает явного улучшения по сравнению с предыдущей и уступает конкурентам того же периода. Однако некоторые считают, что как легковесная модель Gemini 3.6 Flash обеспечивает достаточное качество вывода.
По мнению независимого разработчика Капдима, Gemini 3.6 Flash обеспечивает отличный опыт повседневного использования, хотя его программные способности и не выдающиеся, многомодальное понимание остается весьма сильным. Он поддерживает ввод файлов любого формата, а стиль и опыт повседневного общения превосходят многие аналоги.
После выхода предварительной версии Qwen3.8-Max в июле качество модели было нестабильным, и отзывы рынка разошлись. Главное впечатление Северного города заключалось в том, что предварительная версия Qwen3.8-Max обладает высокой глубиной мышления, но иногда впадает в длительные рассуждения — «как будто запутывается сама в себе» — и в итоге не предлагает эффективного решения. Капдим считает, что предварительная версия Qwen3.8-Max не оправдала ожиданий: при тестировании с использованием своего набора данных для оценки фронтенд-эстетики он обнаружил явное расхождение между реальными возможностями и заявленными. Как продукт, находящийся в стадии доработки, окончательная эффективность будет подтверждена только после выхода официальной версии.
В июле не появилось ни одной модели, лидирующей по всем измерениям, и различные модели начали специализироваться по конкретным сценариям.
Возьмем северный город в качестве примера: он выбирает инструменты в зависимости от задачи — GPT-5.6 для повседневной разработки, Grok 4.5 для быстрого выполнения требований, Kimi K3 для продуктовых и фронтенд-сценариев, Claude Opus 5 для решения сложных проблем. Подход Капдима отличается: он использует модели Fable 5 или Opus 5 от Claude для планирования, а затем выполняет задачи с помощью GPT-5.6 Sol.
03. Выпуски становятся все более частыми, конфликт между открытым и закрытым исходным кодом усиливается
За этой серией интенсивных выпусков стоят несколько вопросов, заслуживающих анализа: почему итерации моделей становятся все быстрее, почему они сосредоточены именно в июле, и почему открытый исходный код оказывает влияние на существующие бизнес-модели.
Сначала меняется подход к итерациям моделей. Раньше повышение возможностей крупных моделей в основном зависело от переобучения моделей большего масштаба, что требовало длительных циклов и высоких затрат. Однако с развитием таких технологий, как усиленное обучение и пост-обучение (оптимизация производительности модели после завершения базового обучения с помощью тонкой настройки, усиленного обучения и других методов), обновление моделей все чаще становится зависимым от оптимизации после обучения.
Яо Юйхан сообщил «Диньцзяо One», что за последние два года скорость выпуска моделей значительно увеличилась, и одной из ключевых причин стало освоение более зрелых методов пост-обучения. Сейчас многие улучшения моделей не требуют полного переобучения — вместо этого они основаны на оптимизации существующих базовых моделей с использованием таких методов, как обучение с подкреплением и самоитерация.
Это означает, что цикл конкуренции между моделями сокращается. Раньше ведущая модель могла сохранять преимущество в течение нескольких месяцев; сейчас преимущество, полученное благодаря обновлению версии, может длиться всего несколько недель. Если темп выпуска не успевает, модель быстро будет заменена новой версией. Для производителей выпуск модели — это не просто демонстрация технологий; само время выпуска становится частью конкуренции.

Источник изображения / pexels
Во-вторых, июль — это период, когда совпадают несколько ключевых событий. Для китайских производителей Всемирный конгресс по искусственному интеллекту (WAIC) проходит в июле, и компании сосредоточенно выпускают модели и демонстрируют достижения в технологиях в этот период. Для зарубежных производителей многие ведущие компании также выбирают этот этап для обновления моделей, стремясь занять активную позицию в экосистеме разработчиков и в коммерческой конкуренции.
Кроме того, правила конкуренции в отрасли меняются. Способность модели больше не является единственной целью — конкуренция распространилась на то, как модель используется и как она превращается в доход.
Вот почему спор между открытым и закрытым исходным кодом в июле снова обострился. Долгое время между открытыми и закрытыми моделями существовала разница в возможностях. Но с появлением некоторых открытых моделей в первом эшелоне возник более реальный вопрос: когда высокопроизводительные модели можно получить бесплатно, не произойдет ли отток доходов от API-вызовов и подписок компаний, разрабатывающих модели?
Сторонники открытого исходного кода считают, что открытые веса снижают технологические барьеры и позволяют большему количеству компаний и разработчиков участвовать в инновациях в области ИИ. Открытый исходный код означает, что поставщики технологий добровольно отказываются от части своих интересов, способствуя развитию экосистемы; в то время как приверженцы закрытых решений опасаются, что их пользователи будут отвлечены моделями с открытым исходным кодом. Компании, такие как Anthropic, считают, что с повышением возможностей моделей открытые веса могут создавать риски безопасности и требуют более строгого регулирования.
За этим спором стоят интересы различных компаний. Для инфраструктурных компаний, таких как NVIDIA, открытие моделей означает больше потребностей в развертывании и более крупный рынок вычислительных ресурсов. Для компаний-разработчиков моделей, таких как OpenAI и Anthropic, закрытая модель позволяет поддерживать доходы от вызовов API и подписок. Однако следует учитывать и другую сторону: открытость действительно увеличивает потребность в развертывании, но с повышением эффективности параметров расход вычислительных ресурсов на единицу задачи может быть снижен, и прирост рынка вычислительных ресурсов не обязательно будет синхронизирован с уровнем открытости модели. Для отечественных производителей открытость весов — это не просто выбор технической стратегии, но и попытка завоевать экосистему разработчиков, облачные сервисы и точки входа для последующей коммерциализации.
После июля конкуренция среди крупных моделей продолжится. Сообщество разработчиков ожидает, что новые модели, такие как DeepSeek V4, Fable 5.1 и GPT-6, будут выпущены в августе.
Разрыв в возможностях моделей сокращается, и одного лишь выпуска более мощной модели уже недостаточно для создания долгосрочного преимущества. Далее стоит обратить внимание на несколько конкретных показателей: до какого уровня DeepSeek V4 в официальной версии поднимет потолок возможностей открытых моделей, продолжит ли цена API снижаться, появятся ли устойчивые платные сценарии для агентов и смогут ли открытые модели быть внедрены в частные развертывания большего числа предприятий. Ответы на эти вопросы скажут о том, что действительно изменилось в этой борьбе, гораздо яснее, чем позиции в рейтингах.
*Изображение обложки взято с Pexels.
