Zhipu запускает модель GLM-5.3-Flash на 100 000 отечественных чипах, конкурируя с NVIDIA

iconMetaEra
Поделиться
AI summary iconСводка
Zhipu AI запустила модель GLM-5.3-Flash, теперь развернутую на кластере более чем из 100 000 отечественных чипов. Модель, ранее известная как Ox Alpha, соответствует эффективности и стоимости токенов NVIDIA GPU, показав результат 57 по индексу AA Intelligence. Она предлагает более низкую цену по сравнению с ведущими конкурентами и является первой нативной мультимодальной моделью в серии GLM-5. Данные в цепочке демонстрируют растущий интерес к инфраструктуре ИИ, при этом анализ в цепочке подчеркивает сдвиг в сторону экономически эффективных отечественных решений.
Zhipu выпустила новую модель GLM-5.3-Flash, которая ранее была бесплатно доступна на тестовой платформе под анонимным именем Ox Alpha и за 5 дней обработала более 50 триллионов токенов. Для выполнения инференса модель использует более 100 000 китайских чипов, при этом эффективность аппаратного обеспечения и стоимость на один токен достигли уровня GPU NVIDIA. По производительности модель набрала 57 баллов по общему индексу интеллекта AA, что соответствует уровню Claude Opus 4.8. Ценообразование: 0,8 юаня за миллион входных токенов и 2,8 юаня за миллион выходных токенов — значительно ниже, чем у конкурентов. Архитектура модели использует гибридный дизайн разреженного и линейного внимания и является первой нативной мультимодальной моделью в серии GLM-5. На фоне общего повышения цен на китайские ИИ-модели Zhipu занимает рынок с помощью стратегии низких цен.

Автор и источник статьи: LatePost

26 августа Zhipu официально подтвердила: ранее вызвавшая широкий отклик в сообществе разработчиков анонимная модель Ox Alpha (в китайском сообществе известная как «Ньулай»), является их новейшей моделью GLM-5.3-Flash. Кодовое название вдохновлено недавно вышедшим в прокат китайским фильмом «Ньулай».

До официального запуска модель была бесплатно доступна для тестирования в анонимном режиме на OpenRouter и OpenCode, за 5 дней накопленный трафик превысил 50 триллионов токенов, побив рекорды роста трафика на обеих платформах, а текущий объем использования уже превышает в два раза показатели DeepSeek. Однако настоящий интерес рынка вызвало последующее раскрытие Zhipu одного детального факта: весь этот трафик обрабатывался исключительно на китайских чипах.

ZhiPu заявила в официальной технической документации, что для обслуживания инференса этой модели используется кластер более чем из 100 000 отечественных чипов: «Эффективность оборудования и стоимость на один токен достигли уровня, сопоставимого с ведущими GPU NVIDIA».

Исследовательская организация в области полупроводников SemiAnalysis сразу же опубликовала комментарий на платформе X: «Весь трафик обрабатывается отечественными чипами; эффективность аппаратного обеспечения и стоимость на один токен теперь сопоставимы с GPU от NVIDIA. После объявления вчера о Jalapeño (собственном чипе для вывода OpenAI), защитный ров CUDA снова подвергается испытанию.»

100 000 китайских чипов: от тестирования до производства — Zhipu описала детали развертывания этой китайской чиповой кластерной системы в технической документации.

Основным узким местом одиночного чипа является объем и пропускная способность памяти, особенно сложно поддерживать контекстную длину до 1 миллиона токенов. Для этого Zhipu построило специализированный движок вывода на основе SGLang, используя квантование W8A8, гибридное квантование кэша INT8/FP8/BF16, тензорное параллелизм внутри узла и внедрило производственную архитектуру Encode–Prefill–Decode (EPD) с разделением: многомодальное кодирование, предзаполнение промпта и декодирование по токену были разделены на отдельные рабочие пулы, которые могут планироваться независимо.

ZhiPu сообщает, что производительность конечного сервиса увеличилась в три раза по сравнению с начальной базовой линией на том же аппаратном обеспечении.

По информации LatePost, поставщиками этих чипов могут быть Huawei, Moore Threads и Hygon. Официальный представитель Zhipu не прокомментировал это, а в технической документации конкретные модели чипов не указаны.

SemiAnalysis в комментариях особо отметила, что ранее существовала точка зрения, согласно которой только ведущие передовые лаборатории обладают вычислительной мощностью в размере 100 триллионов токенов в день, «а здесь бесплатный трафик в размере 100 триллионов токенов в день полностью работает на китайских чипах».

Сама модель: аналог DeepSeek, цена составляет 1/40 от цены Claude Opus 4.8. Общий объем параметров GLM-5.3-Flash составляет 320 млрд, активированных параметров — 18 млрд, что составляет примерно 40% от объема параметров предыдущей флагманской модели GLM-5.3 и практически совпадает с DeepSeek V4 Flash.

В плане производительности официальная оценка Zhipu показывает, что GLM-5.3-Flash набрал 57 баллов по Artificial Analysis Intelligence Index (AA-индекс интеллекта), превзойдя предыдущую флагманскую версию GLM-5.2, сравнявшись с Claude Opus 4.8 от Anthropic и опередив официальную версию флагманской модели DeepSeek V4 Pro с результатом 53 балла.

Стоимость: за ввод 1 миллиона токенов GLM-5.3-Flash — 0,8 юаня, за вывод — 2,8 юаня, стоимость попадания в кэш — 0,23 юаня, что составляет одну десятую стоимости GLM-5.3. В течение первых двух недель после запуска действует половина цены.

ZhiPu заявила, что цена GLM-5.3-Flash составляет 1/10 от цены GLM-5.3, а при ограниченной скидке — 1/20 от цены GLM-5.3 и 1/40 от цены Claude Opus 4.8.

По сравнению с DeepSeek V4 Flash после корректировки цен (вход 1,5 юаня, выход 4,5 юаня в ночные часы), GLM-5.3-Flash дешевле в большинстве обычных сценариев использования.

Инновационная архитектура: количество активируемых параметров и слоев почти сокращено вдвое. GLM-5.3-Flash использует архитектуру, полностью отличную от GLM-5.3, что является ключевой причиной его способности достигать более высокой производительности при более низкой стоимости.

По сравнению с GLM-4.5, общее количество параметров GLM-5.3-Flash сопоставимо (355 млрд против 320 млрд), но количество активируемых параметров снизилось с 32 млрд до 18 млрд, а количество слоев уменьшилось с 92 до 45 — почти вдвое.

ZhiPu сообщает, что GLM-5.3-Flash — это первая открытая передовая модель, использующая гибридную архитектуру разреженного и линейного внимания. По сравнению с GLM-5.3, объем вычислений внимания и размер KV-кэша снижены в 3,01 и 4,44 раза соответственно.

Кроме того, эта модель является первой нативной мультимодальной моделью в серии GLM-5, поддерживающей ввод изображений и видео, а также первой новой моделью с мультимодальными возможностями, выпущенной Zhipu после фокусировки стратегии на кодировании.

Выпуск GLM-5.3-Flash произошел после серии массовых повышений цен на рынке китайских ИИ-моделей.

Цена вывода Kimi K3 достигает 100 юаней за миллион токенов, что более чем в три раза превышает цену предыдущей модели K2.6; после повышения цен в первой половине года цена вывода ZhiPu также достигла 28 юаней; цена вывода DeepSeek V4 Pro выросла с 6 до 13,5 юаней, а в пиковые часы — до 27 юаней; цена вывода DeepSeek V4 Flash увеличилась с 2 до 4,5 юаней, а в пиковые часы — до 9 юаней.

Прямым последствием повышения цен является перелив спроса. «Ваньдиань ЛатеПост» отмечает, что после повышения цен на DeepSeek V4 Flash объем запросов на платформе OpenCode снизился наполовину, и этот спрос стал новым пространством для роста отечественных производителей моделей.

Стратегия ценообразования GLM-5.3-Flash направлена именно на этот разрыв.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.