Несмотря на то, что объем запросов к китайским крупным ИИ-моделям опережает американские на девять недель, фактическая стоимость в условиях интенсивного программирования значительно превышает пакет GPT Codex. ZhiPu понесла убытки более 3 млрд юаней в 2025 году, а пакеты таких моделей, как Kimi, ограничены по объему и испытывают ограничения в часы пик. Основная причина — недостаточная инфраструктура вычислительных ресурсов в Китае (449 центров обработки данных против 5427 в США), что не позволяет запустить высокопроизводительные и выгодные пакеты, подобные Codex. В настоящее время разработчики вынуждены балансировать между производительностью, ценой и стабильностью: китайские модели лишь в некоторых показателях производительности приближаются к международным топовым моделям, в целом же сталкиваются с проблемой популярности без коммерческого успеха.Автор статьи, источник: FunTalk
За последний месяц кремниевая долина выпустила сразу несколько крупных новинок в области ИИ: GPT-5.6, fable5 и Grok-4.5.
В один момент отечественные разработчики и программисты пришли в волнение, и разговоры, обзоры и оценки передовых моделей, таких как GPT-5.6, не прекращались.
Несмотря на то, что в этом месяце появились новые отечественные модели, такие как Kimi-K3, в целом отечественные крупные модели по-прежнему находятся в состоянии «пользуются одобрением, но не пользуются спросом» среди ведущих разработчиков.

Согласно последним данным, по объему использования: с 22 по 28 июня данные OpenRouter показывают, что недельный объем запросов к китайским моделям составил 2,039 триллиона токенов, а к американским — 425 миллиардов, причем китайские модели лидируют уже девять недель подряд.
Однако в плане выручки шесть ведущих китайских ИИ-стартапов показали не очень хорошие результаты: согласно опубликованным финансовым отчетам, выручка Zhipu в 2025 году составила 724 миллиона юаней, однако убытки достигли более 3 миллиардов юаней; MiniMax — 79 миллионов долларов США (около 570 миллионов юаней); остальные четыре компании, включая Moonshot, еще не раскрыли полную годовую выручку.
Даже ведущие компании остаются на уровне дохода в несколько сотен миллионов юаней.
Напротив, Anthropic, ведущая компания в области ИИ, достигла годового рекуррентного дохода (ARR) примерно в 60–70 миллиардов долларов США, главным образом за счет B2B API и сценариев AI-кодирования.
Это неизбежно ставит острый вопрос:
Почему китайские модели, рекламируемые как «дешевые» и «с высоким объемом использования», до сих пор пользуются популярностью, но не получают широкого распространения и по-прежнему не могут напрямую конкурировать с ведущими зарубежными моделями в высокоценных сценариях, таких как AI Coding?
В последнее время, после глубокого обсуждения этого вопроса с несколькими ведущими разработчиками, я обнаружил весьма неинтуитивный факт:
Китайские крупные модели, в определенной степени, на самом деле очень «дорогие».
Именно из-за такой «высокой» цены некоторые отечественные модели, достигшие прорыва в производительности, не могут полностью продемонстрировать свои сильные стороны.
01 Иллюзия «низкой цены»
Когда речь заходит о китайских крупных моделях, многие вспоминают такие представители, как DeepSeek и Kimi, и одним из самых тесно связанных с ними ярлыков является низкая цена, доступность;
Если рассматривать только цену за токен, то отечественные модели действительно имеют значительное преимущество по сравнению с передовыми моделями, такими как GPT-5.6 и Fable5. Например, GLM-5.2 стоит 1,4/4,4 доллара за миллион токенов на ввод/вывод, а DeepSeek-V4-Pro — 0,435/0,87 доллара; GPT-5.6 Sol — 5/30 долларов, Claude Fable 5 — 10/50 долларов.
На самом деле, это впечатление «низкой цены» — длительное заблуждение внешних наблюдателей.
В особенности в условиях интенсивного программирования, цена отечественных крупных моделей не только не имеет преимущества, но и в несколько раз превышает стоимость GPT и Claude с пакетными тарифами.
Ли Гуан (псевдоним) — исследователь в области ИИ, который из-за требований работы ежедневно расходует десятки миллиардов токенов в сценариях AI Coding. При таком уровне потребления использование китайских крупных моделей, например GLM-5.2, приводит к чрезвычайно высоким затратам.

Выписка по токенам, опубликованная Ли Гуаном
В день разговора количество токенов, использованных Ли Гуаном, приблизилось к 4 миллиардам. Приблизительные затраты, если он использовал GLM-5.2, составляют: (86,39 млн обычных входов × 1,4 доллара США + 3,38 млрд кэшированных входов × 0,26 доллара США + 19,06 млн выходов и выводов × 4,4 доллара США) — около 1084 долларов США. При курсе 1 доллар США = 7,2 юаня это составляет примерно 7800 юаней.
А причиной, по которой Ли Гуан так свободно тратит токены, является то, что он подписался на пакет CodeX от GPT,
Здесь просто объясним, что представляет собой пакет CodeX: проще говоря, это пакет, разработанный для сценариев программирования; строго говоря, он не является безлимитным, а включает Codex в подписку ChatGPT: Plus — 20 долларов в месяц, Pro — от 100 долларов в месяц, объем примерно в 5 или 20 раз больше, чем у Plus; после исчерпания лимита можно продолжить использование, покупая Credits.
Аналогично, Claude Code от Anthropic предлагает аналогичные тарифы: Claude Pro — 20 долларов в месяц, Max 5x и Max 20x — по 100 и 200 долларов в месяц соответственно; веб-версия Claude и Claude Code делят лимиты по 5 часов и в неделю, после исчерпания можно продолжить использование по ценам API.
Под таким пакетом огромные расходы на токены оказываются сглаженными.
Для разработчиков в Китае ежедневное потребление десятков или сотен миллиардов токенов в условиях интенсивного AI-кодирования — это обычное явление.
Сяо Лю также является активным разработчиком в области AI-кодирования; его реальные расходы на Codex составляют 300 юаней в неделю, и это даже без возмещения расходов компанией.
Но даже такая стоимость значительно дешевле по сравнению с отечественными моделями, поскольку за те же 300 юаней невозможно приобрести столько же токенов, сколько предлагает GLM 5.2.

Счет на токены Сяо Лю
Для отечественных разработчиков пакет GPT Codex — это самый дешевый токен, который можно купить сегодня, он дешевле в несколько раз, чем модели от Zhipu и Kimi. Это может показаться контринтуитивным, но на практике китайские модели совершенно не могут конкурировать с ним по соотношению цены и производительности в интенсивных сценариях программирования.
Следует отметить, что Codex не является безлимитным тарифом в истинном смысле этого слова: при максимальной стоимости в 200 долларов США недельный лимит составляет примерно 2 миллиарда.
Однако, поскольку некоторые разработчики используют модели через «промежуточные узлы» и другие методы, фактическая стоимость некоторых моделей значительно ниже, чем через официальные каналы, что приводит к тому, что иногда можно купить больше токенов по более низкой цене, поэтому возникает ситуация, когда 300 юаней позволяют приобрести 12 миллиардов токенов.
На самом деле, китайские модели не предлагали аналогичные пакеты, но если внимательно рассмотреть, такие пакеты имеют значительные ограничения по лимитам по сравнению с Codex.
02 Боль от отечественного ценообразования
Ситуация с ценообразованием китайских крупных моделей можно описать одной фразой:
Вы думали, что попали на шведский стол, но в итоге выяснилось, что торговец всё ещё взимает плату за килограмм.
Например, в планах подписки: Kimi Code в Китае доступен в четырех тарифах — 49, 99, 199 и 699 юаней, лимиты обновляются еженедельно; в GLM Coding Plan Lite, Pro и Max — примерно 80, 400 и 1600 запросов каждые 5 часов, или около 400, 2000 и 8000 запросов в неделю, причем в пиковые часы GLM-5.2 списывает в три раза больше.
На примере Qoder от Alibaba, по словам друга автора, занимающегося поддержкой корпоративных клиентов, Ами (псевдоним): «Qoder когда-то был лучшим AI IDE в Китае, но его собственная новая система ценообразования уничтожила это преимущество».
По тарифным планам: Qoder CN Personal Pro и Pro+ стоят 59 и 169 юаней в месяц и включают 2000 и 6000 кредитов соответственно; версии Teams и VPC стоят 99 и 199 юаней за место в месяц, обе включают 3000 кредитов, причем версия VPC доступна от 50 мест.
После того, как они объединили Lingma и настроили ценообразование, по моим сведениям, как минимум двадцать-тридцать компаний отказались продлевать подписку, — позже объяснил Ами.
Согласно тестам Ami, пакет Qoder Enterprise Edition 199 расходуется за три дня при его использовании; при интенсивном использовании разработчиком, вероятно, он закончится за один день.
Также в отношении пакетов пользователи в стране испытывают противоречивые чувства по поводу GLM-5.2.
По словам разработчика Сяо Вэй: «Пакеты GLM-5.2 примерно равны отсутствию пакетов: даже если они есть, в часы пик все равно действует ограничение трафика, и наблюдаются случаи предательства пользователей».
Согласно сообщению 36kr: пакеты GLM-5.2 раньше было сложнее купить, чем билеты на концерт — они обновлялись каждый день в 10:00, и успех покупки зависел только от скорости реакции.
В январе 2026 года Zhipu объявила, что из-за нехватки вычислительных мощностей сократила ежедневный объем продаж до 20% от прежнего уровня: каждый день в 10:00 выпускается небольшой объем, который распродается за несколько минут.
В конечном счете, скупость отечественных моделей в отношении пакетов и цен по сути является следствием нехватки вычислительных мощностей.
Согласно данным Китайского института информационных и коммуникационных технологий и Министерства промышленности и информатизации Китая за 2025 год, в Китае насчитывается 449 действующих центров обработки данных, а в США — 5427. В отношении общей вычислительной мощности Китай составляет 1053 EFLOPS, а США — 2400.
Но ключевой момент здесь в том, что в этих 2400 EFLOPS в США доля высокопроизводительных GPU крайне высока; в китайских вычислительных мощностях значительная часть приходится на китайские чипы, такие как Huawei Ascend и Cambricon, производительность которых отдельно все еще уступает H100.
В ответ на растущий спрос на вычислительные мощности, начиная с марта 2026 года, Zhipu, Alibaba Cloud, Tencent Cloud и Baidu совместно повысили цены на токены, причем рост составил от 5% до 460%.
Проще говоря, «низкая цена» и «цена» отечественных моделей давно остались в прошлом.
Не то чтобы отечественные модели не хотят делать buffet, а потому что посчитали: при текущих затратах на вычислительные мощности и убыточном состоянии, предложение подписки означает фиксированную ежемесячную плату, которую приходится ставить на то, что пользователи не перегрузят систему. Учитывая, как разработчики и программисты в Китае тратят десятки или даже сотни миллиардов токенов в день, такая бизнес-модель очень быстро превысит порог рентабельности.
А программные пакеты OpenAI и Anthropic продаются корпоративным клиентам с высоким уровнем дохода — такие крупные клиенты, как Cursor и GitHub Copilot, могут принести Anthropic доход в размере 1,4 млрд долларов в год.
При поддержке высокой вычислительной мощности эта бизнес-модель по сути обменивает «фиксированную ежемесячную плату» на «долгосрочную удержание клиентов»: клиенты высокого качества, ARPU также относительно высок, что позволяет эффективно распределить затраты.
В то время как внутри страны есть такие гиганты облачных вычислений, как Alibaba, проблема заключается в том, что скорректированная EBITA-маржа Alibaba Cloud за FY2026 составляет всего 7,5%. Несмотря на быстрый рост доходов группы облачных вычислений и искусственного интеллекта, прибыль не слишком высока.
Кроме того, традиционные облачные провайдеры могут предлагать «облако с неограниченным объемом», потому что пользователи не используют серверы на полную мощность круглосуточно. Реальная загрузка CPU одного ECS может составлять всего 10%, поэтому облачный провайдер может продавать одну физическую машину десяти пользователям.
Но вывод больших моделей отличается: каждый токен требует реального расходования вычислительных ресурсов GPU. Если пользователь будет непрерывно генерировать контент 24 часа в сутки, расходы облачного провайдера на HBM-память, ядра GPU и электроэнергию будут жесткими — никакой возможности перепродажи нет.
03 Золотой треугольник модели
Помимо факторов цены, для отечественных разработчиков выбор Codex и Claude Code обусловлен их мощными программными возможностями.
Однако с точки зрения производительности китайские модели не таковы, как некоторые стереотипы предполагают.
После общения с несколькими разработчиками автор обнаружил распространённое мнение: отечественные крупные модели, особенно такие последние, как GLM-5.2, уже могут выполнять вспомогательные и второстепенные задачи, например, тестирование и исправление ошибок.
Однако в более сложных и длительных асинхронных задачах китайские модели пока значительно уступают таким ведущим моделям, как GPT и Claude.
Разработчик Сяо Чжан в марте этого года использовал китайскую языковую модель для программирования, сравнивая GLM, Qwen и GPT на одной и той же задаче; только GPT успешно завершил задачу и соответствовал требованиям страницы — это был проект по сравнению многоуровневого, многоколоночного содержимого и генерации результатов.
Другой разработчик Сяо Вэй отметила, что, по её опыту, производительность Kimi 2.7 и Doudou 2.1 Pro также приемлема, но в целом они на уровень ниже (второй эшелон), однако всё же превосходят Claude Sonnet 4.6.
На данный момент в сообществе разработчиков общепринято мнение, что GLM-5.2 — это первая отечественная модель, достигшая уровня Opus.
Он доступен и занимает свое место при выполнении реальных, сложных и длительных асинхронных задач.
Несмотря на то, что по многим аспектам, например, мировым знаниям, он все еще значительно уступает настоящей модели Opus, это не мешает ему стать новым уровнем для отечественных моделей.
Но реальность такова: это только начинает раскрываться, и лишь немногие «отличники» были сдерживаемы другими факторами, не связанными с производительностью.
В частности, такие факторы, как низкая эффективность кэширования и сохраняющееся ограничение скорости в пиковые часы, значительно ухудшают реальный опыт разработчиков.
Это вводит еще один аспект сравнения моделей сегодня: стабильность.
В опыте разработчиков и программистов на передовой выбор модели уже не просто сравнение производительности, а —
Золотой треугольник: производительность — цена — стабильность.
В этих трех измерениях отечественные модели едва смогли занять часть показателей первого измерения.
В последнее время в Китае была выпущена новейшая флагманская модель Kimi — K3: это открытая модель с весами, обладающая 2,8 триллиона параметров, нативной мультимодальностью и контекстом из 1 миллиона токенов, ориентированная на длинные задачи программирования, работу с знаниями и глубокие рассуждения.

Во многих оценках его интеллектуальный индекс на Artificial Analysis составляет 57 баллов и занимает третье место в мире; он возглавляет рейтинг передней части программирования Arena с 1679 баллами, и даже ходят слухи, что его производительность уже сопоставима с Claude Fable 5.
Однако за яркими оценками и рейтингами разработчики больше всего беспокоятся об одном слове: соотношение цены и качества.
После выпуска K3 многие разработчики отметили, что Kimi по-прежнему дорогой, не обладает соотношением цены и качества по сравнению с Codex, и его лимиты недостаточны. Только по цене API K3 нельзя назвать «дешевым»: стоимость за миллион токенов для кэширования/ввода/вывода составляет 2/20/100 юаней; GPT-5.6 Sol — 0,5/5/30 долларов США; K3 хотя и ниже Sol, но явно выше GPT-5.6 Luna с ценой 0,1/1/6 долларов США.
В процессе использования K3 разработчики сообщили о разрывах API, включая перерыв на целое утро.
На данный момент китайские разработчики не отказываются платить за отечественные модели — просто из-за нехватки вычислительных ресурсов и высокой стоимости они не могут позволить себе пакеты вроде Codex с хорошим соотношением цены и качества, и вынуждены выбирать «пакеты с ограничениями», которые выглядят как шведский стол, но на самом деле имеют лимиты (например, Coding Plan от Zhipu).
Неустойчивый опыт использования пакетов и неясная соотношение цены и качества приводят к тому, что пользователи с трудом остаются после пробного использования. По сути, это рациональный выбор пользователей при высокой стоимости базовой мощности вычислений в текущих условиях.
Все вышесказанное не означает, что мы хотим придавать значение чужим достижениям и умалять свои, а лишь хотим обратить внимание на один из рисков.
В настоящее время отечественные модели, стремясь догнать GPT и Claude, сильно акцентируют внимание на производительности, но путь от разработки до применения отечественных крупных моделей включает в себя гораздо больше препятствий, чем просто преодоление одной этой горы.
Нам нужно просто подождать, пока отечественная база вычислительных мощностей будет масштабно запущена в производство и сформирует синергию в плане технологий, цены и стабильности — тогда наш продукт сможет оправдать ожидания пользователей.
