Z.ai, la société précédemment connue sous le nom de Zhipu AI, a lancé GLM-5.3-Flash le 26 août, devenant ainsi le premier modèle nativement multimodal de la série GLM-5. Ce lancement est remarquable pour des raisons au-delà du modèle lui-même : il fonctionne entièrement sur des accélérateurs IA produits en Chine, démontrant clairement que le matériel chinois peut gérer des charges de travail importantes.
Le timing est important. Les contrôles à l'exportation américains ont restreint l'accès aux puces les plus avancées de NVIDIA pour les acheteurs chinois, poussant des entreprises comme Z.ai à concevoir des solutions autour de ce qu'elles ont déjà.
Ce que le modèle fait réellement
GLM-5.3-Flash utilise une architecture hybride combinant l'attention clairsemée et linéaire, un choix de conception qui réduit considérablement les besoins en calcul. Le modèle compte 320 milliards de paramètres au total, mais n'active que 18 milliards par token, ce qui lui permet d'exploiter une base de connaissances massive sans supporter le coût computationnel complet à chaque inférence.
La fenêtre de contexte s'élève à 1 million de jetons, la plaçant parmi les plus longues disponibles dans n'importe quel modèle ouvert. La prise en charge native des entrées image et vidéo en fait véritablement un modèle multimodal dès le niveau de l'architecture, et non une fonctionnalité ajoutée ultérieurement.
Sur le benchmark de codage DeepSWE v1.1, GLM-5.3-Flash a obtenu un score de 63,4, contre 46,2 pour son prédécesseur GLM-5.2. Le modèle a également obtenu un score de 57 sur l'indice d'intelligence d'analyse artificielle.
Les prix sont compétitifs. L'accès à l'API coûte 0,15 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie, avec des entrées mises en cache disponibles à 0,03 $. Z.ai décrit ce coût comme environ un dixième de certains concurrents.
Les puces chinoises effectuent un travail réel
Z.ai a déployé GLM-5.3-Flash sur des clusters d'accélérateurs AI fabriqués localement, puis a construit des piles de service personnalisées et appliqué des techniques de quantisation adaptées à ce matériel. Le résultat a été une amélioration triplée des performances globales par rapport à une approche de déploiement plus générique.
Le modèle est fourni avec des poids ouverts sous la licence MIT, disponibles au format FP8 et BF16 sur Hugging Face et ModelScope. La licence MIT est l'une des plus permissives : les développeurs et les entreprises peuvent utiliser, modifier et distribuer les poids à des fins commerciales sans restriction.
