Zhipu lance le dernier modèle GLM-5.3-Flash, qui était précédemment disponible gratuitement sur une plateforme de test sous le nom anonyme Ox Alpha, avec plus de 50 billions de tokens traités en cinq jours. Le modèle utilise plus de 100 000 puces nationales pour les services d'inférence, atteignant une efficacité matérielle et un coût par token équivalents à ceux des GPU NVIDIA. En termes de performance, le modèle obtient un score de 57 sur l'indice AA d'intelligence globale, au même niveau que Claude Opus 4.8. En termes de tarification, l'entrée coûte 0,8 yuan pour un million de tokens et la sortie 2,8 yuan, bien inférieure à celle des concurrents. L'architecture combine une attention sparse et linéaire, et il s'agit du premier modèle nativement multimodal de la série GLM-5. Dans un contexte où les modèles d'IA chinois augmentent collectivement leurs prix, Zhipu adopte une stratégie de prix bas pour capturer le marché.Auteur et source de l'article : LatePost
Le 26 août, Zhipu a officiellement confirmé : le modèle anonyme Ox Alpha, largement discuté dans la communauté des développeurs (connu dans la communauté chinoise sous le nom « Niu Lai »), est en réalité le tout nouveau GLM-5.3-Flash. Le code du modèle s'inspire du film récemment sorti en Chine « Niu Lai ».
Avant son lancement officiel, ce modèle a été mis à disposition gratuitement en mode anonyme sur OpenRouter et OpenCode, attirant plus de 50 billions de tokens en cinq jours, battant ainsi les records de croissance du trafic sur les deux plateformes. Sa consommation actuelle dépasse déjà deux fois celle de DeepSeek. Mais ce qui a véritablement attiré l'attention du marché, c'est un détail révélé ultérieurement par Zhipu : tout ce trafic est entièrement supporté par des puces nationales.
ZhiPu a indiqué dans sa documentation technique officielle que plus de 100 000 puces nationales ont été utilisées pour le service d'inférence de ce modèle, « l'efficacité matérielle et le coût par token ayant atteint un niveau comparable à celui des GPU NVIDIA dominants ».
L'organisme de recherche semi-conducteurs SemiAnalysis a publié un commentaire sur X : « Tout le trafic est pris en charge par des puces nationales ; l'efficacité matérielle et le coût par token sont désormais comparables à ceux des GPU NVIDIA. Après l'annonce d'hier de Jalapeño (la puce d'inférence interne d'OpenAI), le fossé CUDA est une nouvelle fois mis à l'épreuve. »

100 000 cartes nationales : de la phase de test à la production, Zhipu décrit les détails du déploiement de ce cluster de puces nationales dans sa documentation technique.
La principale limitation d’un seul puce réside dans la capacité et la bande passante de la mémoire, ce qui rend particulièrement difficile la prise en charge d’une longueur de contexte allant jusqu’à 1 million de tokens. À cet effet, Zhipu a construit un moteur d’inférence dédié sur la base de SGLang, en utilisant des techniques telles que la quantification W8A8, la quantification de cache hybride INT8/FP8/BF16 et le parallélisme tensoriel au sein des nœuds. L’architecture séparée de production Encode–Prefill–Decode (EPD) a également été introduite, permettant de diviser le codage multimodal, le pré-remplissage du prompt et le décodage token par token en des pools de tâches indépendamment planifiables.
Zhipu affirme que la performance du service end-to-end a été multipliée par trois par rapport à la ligne de base initiale sur le même matériel.
Selon LatePost, les fournisseurs de ces puces pourraient être Huawei, Moore Threads et Hygon. Zhipu n'a pas commenté officiellement cette information, et les documents techniques ne précisent pas le modèle exact des puces.
SemiAnalysis a souligné dans ses commentaires qu'il était auparavant considéré que seules les laboratoires de pointe de premier plan possédaient une capacité de calcul de 100 billions de tokens par jour, « alors que ici, 100 billions de tokens gratuits par jour sont entièrement exécutés sur des puces nationales. »

Modèle lui-même : en comparaison avec DeepSeek, le prix est un quarantième de celui de Claude Opus 4.8. GLM-5.3-Flash dispose de 320 milliards de paramètres totaux et de 18 milliards de paramètres activés, soit environ 40 % de la taille du modèle phare précédent GLM-5.3, presque équivalent à DeepSeek V4 Flash.
En termes de performance, les évaluations officielles de Zhipu montrent que GLM-5.3-Flash obtient un score de 57 à l'Artificial Analysis Intelligence Index (indice AA), dépassant la génération précédente, GLM-5.2, égalant le modèle Claude Opus 4.8 d'Anthropic, et dépassant la version officielle du modèle phare DeepSeek V4 Pro, qui obtient 53 points.

En termes de tarification, GLM-5.3-Flash coûte 0,8 yuan pour 1 million de jetons en entrée, 2,8 yuan en sortie, et 0,23 yuan pour un hit de cache, soit un dixième du prix de GLM-5.3. Pendant les deux premières semaines suivant le lancement, les tarifs sont appliqués à moitié prix.
Zhipu indique que le prix de GLM-5.3-Flash est un dixième de celui de GLM-5.3, un vingtième pendant la période de réduction temporaire, et un quarantième de celui de Claude Opus 4.8.
Par rapport à DeepSeek V4 Flash après ajustement de prix (1,5 yuan en entrée, 4,5 yuan en sortie), GLM-5.3-Flash est moins cher dans la plupart des scénarios d'appel courants.

Innovation architecturale : les paramètres et le nombre de couches sont presque divisés par deux. GLM-5.3-Flash utilise une conception architecturale totalement différente de celle de GLM-5.3, ce qui en fait la raison fondamentale de sa capacité à offrir de meilleures performances à un coût réduit.
Par rapport à GLM-4.5, GLM-5.3-Flash a un nombre total de paramètres similaire (355 Go contre 320 Go), mais le nombre de paramètres activés passe de 32 Go à 18 Go, et le nombre de couches diminue de 92 à 45, soit presque divisé par deux.
Zhipu affirme que GLM-5.3-Flash est le premier modèle open source avancé à adopter une architecture hybride combinant attention sparse et attention linéaire. Par rapport à GLM-5.3, son calcul d'attention et la taille du cache KV ont été réduits de 3,01 fois et 4,44 fois respectivement.
De plus, ce modèle est le premier modèle multimodal natif de la série GLM-5, prenant en charge les entrées d’images et de vidéos, et c’est également le premier nouveau modèle doté de capacités multimodales lancé par Zhipu depuis son orientation stratégique sur le codage.

La sortie de GLM-5.3-Flash intervient après une vague de hausses de prix sur le marché chinois des modèles d'IA.
Le prix de sortie de Kimi K3 atteint jusqu'à 100 yuans par million de tokens, plus de trois fois supérieur à celui de son prédécesseur K2.6 ; après la hausse des prix effectuée par Zhipu au premier semestre, le prix de sortie s'élève également à 28 yuans ; DeepSeek V4 Pro est passé de 6 à 13,5 yuans, avec un pic à 27 yuans pendant les heures de pointe ; le prix de sortie de DeepSeek V4 Flash est passé de 2 à 4,5 yuans, avec un pic à 9 yuans pendant les heures de pointe.
La conséquence directe de la hausse des prix est un débordement de la demande. Le Point LatePost souligne qu'après la hausse des prix de DeepSeek V4 Flash, le volume d'appels sur la plateforme OpenCode a diminué de moitié, ce qui crée un nouvel espace de croissance pour les fabricants chinois de modèles.
La stratégie de tarification de GLM-5.3-Flash vise précisément ce créneau.
