GPT-6 Astra a révélé publiquement avoir été formé avec plus de 100 000 GPU Grace Blackwell, ce qui signifie que la concurrence entre les modèles de pointe a entré l'ère des clusters ultra-échelle.Auteur et source de l’article : ME News

TL;DR :
- GPT-6 Astra a révélé publiquement avoir été formé avec plus de 100 000 GPU Grace Blackwell, ce qui signifie que la concurrence entre les modèles de pointe a entré l'ère des clusters ultra-échelle.
- Les principales entreprises de modèles en Chine ne manquent pas de puissance de calcul à grande échelle, mais les informations publiques révèlent qu'il existe toujours un écart notable en termes de génération avancée de GPU et de déploiement concentré en une seule fois.
- Les entreprises telles que ByteDance, Kimi et DeepSeek étendent leur infrastructure de calcul, mais elle est actuellement principalement axée sur l'architecture Hopper ou des solutions de remplacement nationales, et reste encore en retard par rapport aux clusters de niveau Blackwell.
- La clé de la compétition dans l'IA est passée de « posséder ou non des GPU » à « pouvoir obtenir les GPU de dernière génération et organiser efficacement des dizaines de milliers, voire des centaines de milliers de puces ».
- Même si Blackwell n'est plus l'architecture la plus récente de NVIDIA, la tendance de Rubin à réduire davantage les coûts d'entraînement signifie que l'écart de leadership pourrait continuer de se concentrer sur les capacités d'infrastructure.
Derrière les 100 000 unités Blackwell, la concurrence entre grands modèles entre dans l’ère des infrastructures de calcul
Lorsque Huang Renxun a révélé l'échelle d'entraînement de GPT-6 Astra, l'attention du public ne se limitait pas au chiffre lui-même de « 100 000 GPU », mais à ce que ce chiffre représentait en termes de nouveau paradigme de concurrence dans l'IA.
Au cours des dernières années, la concurrence entre les grands modèles a souvent été perçue comme une compétition entre algorithmes, données et capacités techniques. Les innovations en architecture de modèle, l'optimisation des méthodes d'entraînement et l'amélioration de l'efficacité d'inférence ont effectivement déterminé les capacités finales des produits d'IA. Mais à partir de 2026, une tendance de plus en plus évidente se dessine : à mesure que la taille des modèles continue d'augmenter, les capacités de l'infrastructure deviennent elles-mêmes un facteur déterminant des limites technologiques.
Selon les informations publiées par Jensen Huang, l'entraînement de GPT-6 Astra a utilisé plus de 100 000 GPU Grace Blackwell, interconnectés en cluster haute vitesse via NVLink72. Il a également indiqué que la prochaine vague comptera 400 000 GPU, sans révéler les modèles spécifiques ni les propriétaires.
Quelle que soit la suite des détails de déploiement, ce message transmet un signal très clair : l'entraînement des modèles les plus avancés passe de la compétition basée sur des centaines de billions de paramètres et des milliers de GPU à une compétition entre des clusters de GPU avancés de plusieurs dizaines voire centaines de milliers d'unités.
The key here is not just the quantity.
Si l'on se contente de comparer le nombre de GPU, les entreprises chinoises ne manquent pas entièrement de ressources de calcul à grande échelle. La véritable différence réside dans la capacité à obtenir les dernières générations de GPU haute performance et à faire en sorte que ces GPU travaillent ensemble de manière efficace au sein d'une même tâche d'entraînement.
Pour les grands modèles, la performance maximale d'une seule GPU n'est qu'une base. Former un grand modèle nécessite un échange continu de paramètres et de données entre un grand nombre de GPU. Si l'efficacité de l'interconnexion est insuffisante, même avec un grand nombre de puces, il ne sera pas possible de former une puissance de calcul efficace.
Ainsi, la concurrence sur les infrastructures d'IA est passée de « combien de cartes acheter » à « quel système de calcul construire ».
La répartition des ressources de calcul des principales entreprises de modèles chinoises présente un écart générationnel avec l'ère Blackwell.
Les informations publiques actuelles indiquent que la puissance de calcul des principales entreprises de modèles en Chine augmente rapidement, mais un écart significatif demeure par rapport aux clusters d'entraînement de niveau Blackwell représentés par GPT-6 Astra.
ByteDance est l'une des entreprises les plus proches du niveau des leaders internationaux en matière de déploiement de puissance de calcul publiquement annoncé. Cette année, ByteDance a connecté environ 36 000 GPU B200 via la Malaisie. Ces puces appartiennent à l'architecture Blackwell de NVIDIA et appartiennent à la même génération que les GB200 utilisés par Astra.
Cependant, il convient de noter que ce lot de B200 est déployé à l'étranger. Lorsque ByteDance présente publiquement les infrastructures IA en Chine continentale, elle utilise principalement la version spéciale pour la Chine de l'architecture Hopper, le H20, ainsi que des puces précédemment obtenues comme le H800.
Ce qui se reflète ici n'est pas simplement un écart de quantité, mais un écart en matière de chaîne d'approvisionnement et d'environnement de déploiement.
Blackwell apporte des améliorations par rapport à Hopper en termes de puissance de calcul, de mémoire vidéo et de capacité d'interconnexion. En particulier, le GB200 n'est pas simplement une GPU, mais combine un CPU Grace et une GPU Blackwell, connectant 72 GPU au sein d'un même domaine d'interconnexion haute vitesse via le système NVL72.
Pour l'entraînement de grands modèles, l'importance de cette conception système augmente de plus en plus. Plus le modèle est volumineux, plus la communication entre GPU représente une proportion élevée ; la capacité des puces à coopérer efficacement influence directement l'efficacité de l'entraînement.
La face cachée de Kimi, Yuedian, aurait également obtenu environ 20 000 GPU Hopper via Alibaba. Selon Bloomberg, les modèles spécifiques seraient des H200, mais Alibaba nie avoir utilisé ce modèle.
Si l'on se base sur le H200, il appartient toujours à l'architecture Hopper précédente, tandis que le B200 entre dans l'ère Blackwell. Entre les deux, il ne s'agit pas d'un simple remplacement ancien/nouveau, mais plutôt de capacités d'infrastructure IA à des étapes différentes.
La situation de DeepSeek est encore plus particulière.
DeepSeek a attiré une attention mondiale au début de l'année 2025 grâce à ses modèles à haute efficacité, prouvant que l'optimisation algorithmique et l'efficacité technique peuvent réduire partiellement les besoins en puissance de calcul. Toutefois, selon les informations publiques, l'entreprise n'a pas divulgué la configuration complète du matériel de formation pour V4.
La transcriptions de la réunion d'échanges avec les investisseurs de Liang Wenfeng révèle que l'entreprise disposait d'environ 20 000 unités de puissance de calcul équivalentes H en mai, dont la majorité vient tout juste d'arriver, et que les achats futurs seront « essentiellement des NVIDIA ». Huawei a fourni à DeepSeek une capacité de 950 équivalant à environ 16 000 unités. Liang Wenfeng a déclaré que ces cartes nationales équivalent à environ 4 000 cartes Nvidia de la série B, ce qui suffit à peine à l'entraînement du modèle actuel.
Ces informations reflètent une réalité : même si les entreprises chinoises possèdent déjà une quantité considérable de puissance de calcul IA, il subsiste un écart de taille par rapport à la capacité de concentrer 100 000 GPU avancés de la même génération pour une seule tâche d'entraînement.
Le véritable point faible de la puissance de calcul IA en Chine n'est pas le manque de puces, mais le manque de capacité de clusters avancés
Lorsqu'on discute de la puissance de calcul IA en Chine, on tombe facilement dans deux extrêmes.
Une opinion soutient que la Chine manque complètement de puces AI avancées et ne peut donc pas participer à la compétition ; une autre opinion estime que tant que le nombre de puces nationales augmente, la Chine pourra rattraper rapidement NVIDIA.
En réalité, la situation est plus complexe.
La capacité d'entraînement de l'IA est déterminée par plusieurs éléments, notamment les performances des puces, les processus avancés, la capacité de mémoire vidéo, l'interconnexion à haute vitesse, la conception des serveurs, l'alimentation des centres de données, l'écosystème logiciel et la capacité de planification à grande échelle.
Le GPU n'est qu'une des parties les plus cruciales, mais pas la totalité.
L'avantage à long terme d'NVIDIA ne provient pas seulement du matériel GPU, mais aussi de l'écosystème CUDA, des technologies de connexion réseau, des solutions serveur et du système complet établi avec les fournisseurs de cloud computing.
À l'ère de Blackwell, cet avantage système est encore amplifié.
Lorsqu'une formation de modèle nécessite 100 000 GPU, la question ne se limite plus à l'achat de plusieurs dizaines de milliers de puces, mais à la construction d'une usine de calcul capable de fonctionner de manière stable.
C'est également la raison pour laquelle aucune entreprise chinoise n'a encore révélé dans les documents publics un cas d'entraînement de modèle utilisant 100 000 GPU avancés de la même génération.
Les entreprises chinoises renforcent leurs capacités par divers moyens, notamment en augmentant le déploiement de puissance de calcul à l'étranger, en élargissant l'adaptation des puces nationales, en optimisant les architectures de modèles et en améliorant l'efficacité de l'entraînement. Ces approches ont toutes leur valeur, mais il sera difficile à court terme de remplacer complètement l'avantage fondamental offert par les clusters GPU les plus avancés.
Au cours des dernières années, l'industrie chinoise de l'IA a démontré un fait : l'innovation algorithmique peut réduire significativement certains écarts.
L'apparition d'entreprises comme DeepSeek montre qu'une excellente équipe d'ingénierie peut réaliser des percées dans des conditions de calcul limitées en optimisant la structure du modèle, en ajustant les stratégies d'entraînement et en améliorant l'efficacité de l'utilisation des ressources.
Mais un autre fait demeure : alors que la concurrence mondiale entre dans la phase des modèles de base de la prochaine génération, l'importance de l'échelle de puissance de calcul continuera d'augmenter.
L'optimisation de l'efficacité peut réduire les coûts, mais il est difficile de modifier complètement les limites de performance imposées par les matériels avancés et les clusters ultra-échelle.
Après Blackwell, l'ère Rubin pourrait encore élargir l'écart infrastructurel
Ce qui mérite encore plus d'attention, c'est que Blackwell n'est pas la fin de la trajectoire technologique actuelle de NVIDIA.
La prochaine architecture Vera Rubin d’NVIDIA est entrée en production de masse. Selon les estimations publiques d’NVIDIA, le nombre de GPU requis pour entraîner de grands modèles MoE avec Rubin peut être réduit à environ un quart de celui nécessaire avec Blackwell.
Cela signifie qu'un nouveau cycle de concurrence dans l'IA pourrait émerger à l'avenir.
Les entreprises leaders, dotées de l'architecture la plus récente, peuvent effectuer des entraînements à plus grande échelle avec moins de puces ; un coût d'entraînement réduit les incite à mener davantage d'expériences, améliorant ainsi encore les capacités des modèles.
Les entreprises en retard, si elles ne peuvent accéder qu'à du matériel de la génération précédente, risquent de faire face à deux problèmes : d'une part, une efficacité d'entraînement faible, et d'autre part, la difficulté à participer à la compétition pour les modèles à la plus grande échelle.
Of course, this does not mean that Chinese AI companies have no opportunities.
L'histoire de l'IA a déjà prouvé à plusieurs reprises que la concurrence technologique n'est pas entièrement déterminée par un seul matériel. L'innovation des modèles, les cas d'utilisation, la capacité de commercialisation et l'efficacité technique peuvent toutes créer de nouvelles percées.
Mais si l'on observe du point de vue de l'infrastructure, le fait que GPT-6 Astra utilise 100 000 GPU Blackwell révèle effectivement un changement en cours : le champ de bataille principal de la compétition mondiale en intelligence artificielle se déplace davantage du niveau des modèles vers l'infrastructure de calcul.
Au cours des prochaines années, la compétitivité des entreprises d'IA ne dépendra pas seulement de la capacité à entraîner un modèle performant, mais de la capacité à établir un processus d'entraînement continu pour les modèles de la prochaine génération.
Pour l'industrie chinoise de l'IA, ce qui nécessite véritablement un rattrapage, ce n'est pas un modèle spécifique ou une publication particulière, mais l'ensemble des capacités systémiques, de l'acquisition de puces à la construction de centres de données, en passant par l'ordonnancement de clusters et l'écosystème logiciel.
La signification des 100 000 Blackwell ne réside pas dans la création d'un chiffre impressionnant, mais dans le rappel au marché que l'intelligence artificielle entre dans une phase industrielle, et que la concurrence industrielle se joue finalement sur les infrastructures.
Source de référence :
- Official NVIDIA materials on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
- Informations sur les discours publics et les interviews médiatiques de Huang Renxun.
- Rapports de Bloomberg sur l'achat de puissance de calcul de Kimi et les éléments liés à H200.
- Informations sur l'infrastructure IA et le déploiement de puissance de calcul à l'étranger divulguées par ByteDance.
- Transcriptions des informations publiques de DeepSeek et de la réunion d'échanges avec les investisseurs de Liang Wenhong.
- Informations publiques d'Alibaba Cloud sur les infrastructures IA et la collaboration en matière de puissance de calcul pour les grands modèles.
