Китайская компания Z.ai, ранее известная как Zhipu AI, выпустила GLM-5.3-Flash 26 августа, сделав её первой нативно мультимодальной моделью в серии GLM-5. Запуск примечателен не только самой моделью: она работает исключительно на отечественных AI- Beschleunigern, что ярко демонстрирует, что китайское оборудование способно справляться с серьёзными масштабными задачами.
Важно время. Экспортные ограничения США ограничили доступ к самым передовым чипам NVIDIA для китайских покупателей, заставив компании, такие как Z.ai, строить решения на основе того, что у них есть.
Что на самом деле делает модель
GLM-5.3-Flash использует гибридную архитектуру, сочетающую разреженное и линейное внимание, что существенно снижает требования к вычислительным ресурсам. Модель содержит в общей сложности 320 миллиардов параметров, но активирует только 18 миллиардов на токен, что позволяет ей использовать огромную базу знаний без полных вычислительных затрат при каждом выводе.
Окно контекста составляет 1 миллион токенов, что относит его к числу самых длинных среди всех открытых моделей. Нативная поддержка изображений и видео делает её по-настоящему мультимодальной на уровне архитектуры, а не как дополнительную функцию.
На бенчмарке кодирования DeepSWE v1.1 GLM-5.3-Flash показал результат 63,4, по сравнению с 46,2 у его предшественника GLM-5.2. Модель также набрала 57 баллов по индексу искусственного аналитического интеллекта.
Цены агрессивные. Доступ к API стоит 0,15 доллара за миллион входных токенов и 0,50 доллара за миллион выходных токенов, при этом кэшированные входы доступны по цене 0,03 доллара. Z.ai описывает стоимость как примерно одну десятую от некоторых конкурентных решений.
Китайские чипы выполняют реальную работу
Z.ai развернула GLM-5.3-Flash на кластерах отечественно произведенных ускорителей ИИ, затем создала пользовательские стеки обслуживания и применила методы квантизации, адаптированные под это оборудование. Результатом стало трехкратное улучшение производительности в режиме end-to-end по сравнению с более универсальным подходом к развертыванию.
Модель поставляется с открытыми весами по лицензии MIT, доступным в форматах FP8 и BF16 на Hugging Face и ModelScope. Лицензия MIT является одной из самых разрешительных: разработчики и компании могут свободно использовать, изменять и распространять веса в коммерческих целях без ограничений.
