Zhipu выпустила новую модель GLM-5.3-Flash, которая ранее была бесплатно доступна на тестовой платформе под анонимным именем Ox Alpha и за 5 дней обработала более 50 триллионов токенов. Для выполнения инференса модель использует более 100 000 китайских чипов, при этом эффективность аппаратного обеспечения и стоимость на один токен достигли уровня GPU NVIDIA. По производительности модель набрала 57 баллов по общему индексу интеллекта AA, что соответствует уровню Claude Opus 4.8. Ценообразование: 0,8 юаня за миллион входных токенов и 2,8 юаня за миллион выходных токенов — значительно ниже, чем у конкурентов. Архитектура модели использует гибридный дизайн разреженного и линейного внимания и является первой нативной мультимодальной моделью в серии GLM-5. На фоне общего повышения цен на китайские ИИ-модели Zhipu занимает рынок с помощью стратегии низких цен.Автор и источник статьи: LatePost
26 августа Zhipu официально подтвердила: ранее вызвавшая широкий отклик в сообществе разработчиков анонимная модель Ox Alpha (в китайском сообществе известная как «Ньулай»), является их новейшей моделью GLM-5.3-Flash. Кодовое название вдохновлено недавно вышедшим в прокат китайским фильмом «Ньулай».
До официального запуска модель была бесплатно доступна для тестирования в анонимном режиме на OpenRouter и OpenCode, за 5 дней накопленный трафик превысил 50 триллионов токенов, побив рекорды роста трафика на обеих платформах, а текущий объем использования уже превышает в два раза показатели DeepSeek. Однако настоящий интерес рынка вызвало последующее раскрытие Zhipu одного детального факта: весь этот трафик обрабатывался исключительно на китайских чипах.
ZhiPu заявила в официальной технической документации, что для обслуживания инференса этой модели используется кластер более чем из 100 000 отечественных чипов: «Эффективность оборудования и стоимость на один токен достигли уровня, сопоставимого с ведущими GPU NVIDIA».
Исследовательская организация в области полупроводников SemiAnalysis сразу же опубликовала комментарий на платформе X: «Весь трафик обрабатывается отечественными чипами; эффективность аппаратного обеспечения и стоимость на один токен теперь сопоставимы с GPU от NVIDIA. После объявления вчера о Jalapeño (собственном чипе для вывода OpenAI), защитный ров CUDA снова подвергается испытанию.»

100 000 китайских чипов: от тестирования до производства — Zhipu описала детали развертывания этой китайской чиповой кластерной системы в технической документации.
Основным узким местом одиночного чипа является объем и пропускная способность памяти, особенно сложно поддерживать контекстную длину до 1 миллиона токенов. Для этого Zhipu построило специализированный движок вывода на основе SGLang, используя квантование W8A8, гибридное квантование кэша INT8/FP8/BF16, тензорное параллелизм внутри узла и внедрило производственную архитектуру Encode–Prefill–Decode (EPD) с разделением: многомодальное кодирование, предзаполнение промпта и декодирование по токену были разделены на отдельные рабочие пулы, которые могут планироваться независимо.
ZhiPu сообщает, что производительность конечного сервиса увеличилась в три раза по сравнению с начальной базовой линией на том же аппаратном обеспечении.
По информации LatePost, поставщиками этих чипов могут быть Huawei, Moore Threads и Hygon. Официальный представитель Zhipu не прокомментировал это, а в технической документации конкретные модели чипов не указаны.
SemiAnalysis в комментариях особо отметила, что ранее существовала точка зрения, согласно которой только ведущие передовые лаборатории обладают вычислительной мощностью в размере 100 триллионов токенов в день, «а здесь бесплатный трафик в размере 100 триллионов токенов в день полностью работает на китайских чипах».

Сама модель: аналог DeepSeek, цена составляет 1/40 от цены Claude Opus 4.8. Общий объем параметров GLM-5.3-Flash составляет 320 млрд, активированных параметров — 18 млрд, что составляет примерно 40% от объема параметров предыдущей флагманской модели GLM-5.3 и практически совпадает с DeepSeek V4 Flash.
В плане производительности официальная оценка Zhipu показывает, что GLM-5.3-Flash набрал 57 баллов по Artificial Analysis Intelligence Index (AA-индекс интеллекта), превзойдя предыдущую флагманскую версию GLM-5.2, сравнявшись с Claude Opus 4.8 от Anthropic и опередив официальную версию флагманской модели DeepSeek V4 Pro с результатом 53 балла.

Стоимость: за ввод 1 миллиона токенов GLM-5.3-Flash — 0,8 юаня, за вывод — 2,8 юаня, стоимость попадания в кэш — 0,23 юаня, что составляет одну десятую стоимости GLM-5.3. В течение первых двух недель после запуска действует половина цены.
ZhiPu заявила, что цена GLM-5.3-Flash составляет 1/10 от цены GLM-5.3, а при ограниченной скидке — 1/20 от цены GLM-5.3 и 1/40 от цены Claude Opus 4.8.
По сравнению с DeepSeek V4 Flash после корректировки цен (вход 1,5 юаня, выход 4,5 юаня в ночные часы), GLM-5.3-Flash дешевле в большинстве обычных сценариев использования.

Инновационная архитектура: количество активируемых параметров и слоев почти сокращено вдвое. GLM-5.3-Flash использует архитектуру, полностью отличную от GLM-5.3, что является ключевой причиной его способности достигать более высокой производительности при более низкой стоимости.
По сравнению с GLM-4.5, общее количество параметров GLM-5.3-Flash сопоставимо (355 млрд против 320 млрд), но количество активируемых параметров снизилось с 32 млрд до 18 млрд, а количество слоев уменьшилось с 92 до 45 — почти вдвое.
ZhiPu сообщает, что GLM-5.3-Flash — это первая открытая передовая модель, использующая гибридную архитектуру разреженного и линейного внимания. По сравнению с GLM-5.3, объем вычислений внимания и размер KV-кэша снижены в 3,01 и 4,44 раза соответственно.
Кроме того, эта модель является первой нативной мультимодальной моделью в серии GLM-5, поддерживающей ввод изображений и видео, а также первой новой моделью с мультимодальными возможностями, выпущенной Zhipu после фокусировки стратегии на кодировании.

Выпуск GLM-5.3-Flash произошел после серии массовых повышений цен на рынке китайских ИИ-моделей.
Цена вывода Kimi K3 достигает 100 юаней за миллион токенов, что более чем в три раза превышает цену предыдущей модели K2.6; после повышения цен в первой половине года цена вывода ZhiPu также достигла 28 юаней; цена вывода DeepSeek V4 Pro выросла с 6 до 13,5 юаней, а в пиковые часы — до 27 юаней; цена вывода DeepSeek V4 Flash увеличилась с 2 до 4,5 юаней, а в пиковые часы — до 9 юаней.
Прямым последствием повышения цен является перелив спроса. «Ваньдиань ЛатеПост» отмечает, что после повышения цен на DeepSeek V4 Flash объем запросов на платформе OpenCode снизился наполовину, и этот спрос стал новым пространством для роста отечественных производителей моделей.
Стратегия ценообразования GLM-5.3-Flash направлена именно на этот разрыв.
