ZhipuAI termine le déploiement de 100 000 accélérateurs AI nationaux en deux semaines

iconMetaEra
Partager
AI summary iconRésumé
ZhipuAI a déployé son système d'inférence GLM-5.3-Flash sur un cluster de plus de 100 000 accélérateurs AI nationaux en seulement deux semaines, selon les actualités AI + crypto. Le débit end-to-end du système a augmenté de 3,2 fois, avec un Infra Agent piloté par l'IA prenant en charge les tâches d'optimisation habituellement réalisées par des ingénieurs seniors. Les actualités sur chaîne mettent en lumière l'intégration rapide de l'IA dans l'infrastructure, montrant comment l'automatisation transforme les processus techniques. Ce déploiement reflète la dynamique croissante du secteur AI + crypto en Chine.
En deux semaines, 100 000 accélérateurs AI nationaux, un début d'optimisation de son propre modèle.

Auteur de l'article : APPSO

Source : Wall Street Journal

Juste maintenant, Tang Jie, scientifique en chef de Zhipu GLM, a partagé sur la plateforme X une étude sur l'optimisation du système d'inférence GLM-5.3-Flash.

Il a révélé que, du premier lancement de GLM-5.3-Flash sur un accélérateur IA national à la prise en charge complète du trafic de production, il n'a fallu que deux semaines. Au cours de ce processus, la capacité de débit bout en bout du système a augmenté de 3,2 fois.

Ce qui a le plus impressionné Tang Jie, c’est que ce ne sont pas seulement les ingénieurs infrastructure qui ont réalisé un grand nombre d’optimisations, mais aussi un Infra Agent piloté par GLM-5.3.

« Un modèle qui aide à optimiser le service lui-même. »唐杰 a ainsi décrit ce changement.

À ses yeux, cela signifie que l’IA commence à participer à l’optimisation des systèmes qui hébergent son propre fonctionnement. Bien qu’il reste encore très loin d’une amélioration récursive autonome (Recursive Self-Improvement, RSI) véritable, une forme précoce est déjà apparue.

L'équipe ZhiPu a également mentionné qu'au cours de la dernière année, ils ont observé que le rôle de GLM évoluait.

Au départ, l'équipe a exploré les capacités de GLM dans la compréhension du code et la cybersécurité, dans l'espoir de faire appel au modèle pour analyser les vulnérabilités dans des codes complexes. Mais à mesure que les capacités du modèle ont progressé, GLM a commencé à participer à la construction même des systèmes d'IA.

L'équipe a indiqué avoir observé des modèles accomplissant des tâches qui, par le passé, nécessitaient plusieurs semaines de travail à une équipe d'ingénieurs infrastructure expérimentés, et qui influencent directement la manière dont les modèles de prochaine génération seront formés et déployés.

Déploiement du cluster de calcul national terminé en deux semaines

Passer d'une première exécution d'un grand modèle sur un nouveau matériel à un service d'inférence capable de gérer de manière stable des demandes de production nécessite un important travail d'ingénierie système.

GLM-5.3-Flash est déployé sur un cluster composé de plus de 100 000 accélérateurs AI nationaux. L'équipe Zhipu indique qu'il s'agit d'un déploiement à grande échelle sans référence expérimentale mature précédente.

L'équipe doit résoudre plusieurs problèmes, notamment les limites de capacité de mémoire vidéo des puces nationales et de bande passante d'interconnexion, l'adaptation à de nouvelles architectures de modèles, la prise en charge de contextes longs de 1 million de tokens, ainsi que le traitement des requêtes multimodales. Parallèlement, l'écosystème logiciel des accélérateurs AI nationaux est encore en développement, avec un support partiel des noyaux et de nombreuses ressources qui doivent être explorées par l'équipe d'ingénierie.

Tang Jie a indiqué que, dans ces conditions de restriction, l'Infra Agent piloté par GLM-5.3 a participé au processus d'optimisation du système de raisonnement, aidant à analyser les goulots d'étranglement de performance, à proposer des solutions d'optimisation et à effectuer certaines modifications de code.

L'ensemble du processus d'optimisation ne consiste pas simplement à augmenter les ressources de calcul, mais à trouver un nouvel équilibre entre la puissance de calcul, la mémoire, la communication et l'ordonnancement.

L'équipe ZhiPu a mis en œuvre une série de solutions d'optimisation. Par exemple, elle utilise ReplaySSM pour échanger de la mémoire contre de l'espace de calcul, applique le parallélisme tensoriel au sein des nœuds pour réduire la pression sur la mémoire GPU, améliore l'utilisation de la capacité grâce au mixage de précision INT8, FP8 et BF16, et introduit une architecture séparée Encode-Prefill-Decode (EPD) permettant un planification plus flexible des différentes étapes d'inférence.

Finalement, la performance du service end-to-end de GLM-5.3-Flash a été améliorée d'environ 3 fois par rapport à la version initiale, avec une utilisation des ressources matérielles et un coût par token atteignant des niveaux proches de ceux des plates-formes NVIDIA GPU principales.

Après le déploiement, GLM-5.3-Flash a été testé dans un environnement d'utilisation réelle. L'équipe Zhipu a indiqué que ce modèle a fonctionné sous le nom anonyme Ox-Alpha sur les plateformes OpenCode et OpenRouter, devenant l'un des modèles les plus utilisés sur les deux plateformes en une semaine, traitant plus de 62 billions de tokens en six jours.

Cependant, le véritable changement de cette expérience ne réside pas seulement à ce que l'IA écrive du code, mais à ce qu'elle puisse comprendre pourquoi des systèmes complexes connaissent des variations de performance.

Par exemple, lorsque le système signale une « baisse du débit de 20 % », il ne peut que indiquer qu'un problème se produit quelque part, sans pouvoir dire directement à l'agent quelle couche est en cause, si l'hypothèse actuelle est erronée, ou quoi vérifier ensuite.

Pour les ingénieurs expérimentés, ce type de jugement repose sur une expérience prolongée. Les ingénieurs savent quand consulter la chronologie d'exécution, quand lancer des micro-benchmarks et quelles sorties de modules comparer.

L'équipe ZhiPu souhaite transformer cette expérience technique en un mécanisme de retour que l'IA peut appeler, qu'elle appelle « dense feedback ».

Le cœur de ce mécanisme est de permettre à l'Agent d'obtenir des informations plus proches du processus de jugement technique.

Lorsque le modèle doit vérifier la précision d'un calcul, il peut obtenir un retour d'information sur la justesse ; lorsqu'il doit analyser la cause d'une baisse de performance, il peut consulter la consommation temporelle pendant le fonctionnement du système ; lorsqu'il expérimente une nouvelle stratégie d'optimisation, il peut évaluer par des tests si cette approche est adaptée au contexte actuel.

L'équipe Zhipu estime que des retours véritablement efficaces doivent répondre à plusieurs conditions : ils doivent être suffisamment proches du problème spécifique, facilement obtenus et vérifiables par des expériences objectives. Sinon, de nombreux journaux et indicateurs pourraient au contraire rendre difficile pour l'agent l'identification de la prochaine action à entreprendre.

Système d'optimisation des modèles, service système de modèles

Avec l'aide du dense feedback, l'Infra Agent commence à participer à la détection de problèmes cachés dans le système de raisonnement.

Dans le contexte des chemins parallèles de KDA, l'agent a identifié un problème affectant la précision du calcul des longs contextes.

Étant donné que les matrices d'état doivent être constamment fusionnées entre les différents fragments de contexte, les erreurs d'arrondi générées par le calcul TF32 s'accumulent avec la longueur de la séquence, entraînant finalement un biais dans les résultats de calcul.

L'agent a identifié le problème comme étant lié au traitement de la précision dans le processus de propagation et de fusion d'état, en comparant les résultats de différentes voies d'exécution. Les correctifs associés ont été intégrés dans la PR #1180 du projet Flash Linear Attention.

Un autre problème survient entre le transfert KV et l'ordonnancement DeepEP.

Pendant le test, l'agent a constaté que KV Transfer ne présentait pas de chevauchement efficace avec DeepEP Dispatch, entraînant un coût de transmission supérieur à 30 % dans certains scénarios.

Ensuite, l'agent a poursuivi l'analyse le long de la chaîne d'appels Python et C++, et a constaté que le GIL Python n'était pas libéré à temps au sein du nœud, empêchant la progression rapide de la tâche de transmission.

Après modification, le surcoût dû à KV Transfer est passé de plus de 30 % à moins de 1 %.

De plus, l'Agent a également optimisé un noyau de décodage.

Il a été constaté que, en raison d'un problème dans la méthode de découpage du noyau, les mêmes calculs de normalisation étaient exécutés quatre fois. En réorganisant la structure des calculs pour réduire les redondances, ce noyau a obtenu une amélioration des performances de 1,71 fois.

Cette approche d'optimisation provient de l'apprentissage de l'Agent sur les noyaux existants des projets SGLang, Flash Linear Attention et DeepGEMM. Elle extrait les expériences d'optimisation de ces codes sous forme de « squelette d'optimisation », puis évalue leur pertinence en fonction des retours du système actuel.

Par le passé, ce type d'expérience d'optimisation dépendait principalement de l'accumulation personnelle des ingénieurs.

Au cours de ce processus, l'agent commence à apprendre des méthodes d'optimisation à partir du code existant, puis à les vérifier par des expériences pour déterminer leur adéquation avec de nouveaux environnements matériels et modèles.

Tang Jie a déclaré que les ingénieurs humains restent responsables de la définition des objectifs, de la mise en place d'un environnement de rétroaction et de l'audit des modifications à haut risque.

Mais le rôle des ingénieurs évolue, passant de celui qui résout directement chaque problème à celui qui conçoit des systèmes de retour.

L'équipe ZhiPu estime qu'un environnement de feedback vérifiable fondé sur des tâches d'infrastructure réelles pourrait également constituer une base essentielle pour former la prochaine génération de modèles. Chaque fois qu'un Agent accomplit une tâche d'ingénierie, cela pourrait devenir des données d'apprentissage pour la prochaine génération de modèles.

Actuellement, les cas de GLM-5.3-Flash sont encore éloignés d'une amélioration récursive et autonome véritable. Toutefois, Tang Jie estime qu'un cycle minimal est déjà apparu.

Le système optimise le modèle, et le service système le modèle.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.