Bien que les grands modèles d'IA chinois dominent en volume d'utilisation sur neuf semaines par rapport aux États-Unis, leur coût réel dans les scénarios de programmation intensifs dépasse largement les forfaits GPT Codex. Zhipu enregistre une perte supérieure à 3 milliards de yuans en 2025, tandis que des forfaits comme Kimi sont limités en quota et soumis à des restrictions pendant les périodes de pointe. La cause principale réside dans l'insuffisance des infrastructures de calcul en Chine (449 centres de données contre 5 427 aux États-Unis), empêchant la mise sur le marché de forfaits hautement rentables similaires à Codex. Actuellement, les développeurs doivent équilibrer performance, prix et stabilité : les modèles chinois ne rivalisent avec les modèles internationaux de pointe que sur certains indicateurs de performance et restent globalement confrontés à une situation où ils sont appréciés mais peu adoptés.Auteur et source de l'article : Zuihua FunTalk
Au cours du dernier mois, le monde de l'IA à Sillicon Valley a dévoilé une série de innovations majeures : GPT-5.6, fable5 et Grok-4.5 sont apparus successivement.
Pendant un moment, la communauté des développeurs et programmeurs nationaux s'est enflammée, avec une multitude de discussions et d'évaluations sur des modèles avancés tels que GPT-5.6.
Bien qu'un nouveau modèle national comme Kimi-K3 ait été lancé ce mois-ci, dans l'ensemble, les grands modèles nationaux restent dans une situation de « succès critique mais faible adoption » parmi les développeurs de premier plan.

Selon les dernières données, en termes d'utilisation : les données d'OpenRouter du 22 au 28 juin indiquent que l'utilisation hebdomadaire des modèles chinois a atteint 203,9 milliards de tokens, contre 42,5 milliards pour les modèles américains, ce qui marque la neuvième semaine consécutive de leadership pour les modèles chinois.
En revanche, les six « petits dragons » chinois de l’IA se sont montrés moins performants en termes de revenus : selon les états financiers publiés, Zhipu a enregistré un chiffre d’affaires de 724 millions de yuans en 2025, avec une perte dépassant 3 milliards de yuans ; MiniMax a généré 79 millions de dollars américains (environ 570 millions de yuans) ; les quatre autres entreprises, telles que Moonshot, n’ont pas encore divulgué leurs revenus annuels complets.
Même les entreprises leaders restent à un niveau de revenus de plusieurs centaines de millions de yuans.
En comparaison, Anthropic, leader mondial des entreprises d'IA, affiche un ARR d'environ 60 à 70 milliards de dollars, principalement tiré par les API B2B et les scénarios de codage par IA.
Cela soulève naturellement une question aiguë :
Pourquoi les modèles nationaux, présentés comme « bon marché » et « à fort volume d'utilisation », restent-ils populaires en théorie mais peu adoptés en pratique, et peinent-ils toujours à rivaliser directement avec les modèles internationaux de pointe dans des scénarios à haute valeur ajoutée comme le codage par IA ?
Récemment, après avoir approfondi cette question avec plusieurs développeurs de premier plan, j'ai découvert un fait très contre-intuitif :
Les grands modèles nationaux sont, d'une certaine manière, très « coûteux ».
C'est précisément cette « cherté » qui empêche certains modèles nationaux ayant réalisé des progrès en performance de montrer pleinement leur potentiel.
01 L'illusion du « prix bas »
Lorsqu'on évoque les grands modèles nationaux, beaucoup pensent à des représentants comme DeepSeek ou Kimi, dont l'un des étiquettes les plus étroitement associées est le prix bas, l'abordabilité ;
Si l'on se base uniquement sur le prix par token, les modèles nationaux présentent effectivement un avantage significatif par rapport aux modèles de pointe tels que GPT-5.6 et Fable5. Par exemple, pour GLM-5.2 et DeepSeek V4 : GLM-5.2 coûte 1,4 / 4,4 dollars par million de tokens en entrée/sortie, tandis que DeepSeek-V4-Pro coûte 0,435 / 0,87 dollar ; GPT-5.6 Sol coûte 5 / 30 dollars, et Claude Fable 5 coûte 10 / 50 dollars.
En réalité, cette impression de « prix bas » est un malentendu persistant chez les personnes extérieures au milieu.
Dans les scénarios de programmation intensifs, le prix unitaire des grands modèles nationaux n'est pas seulement désavantageux, il est même plusieurs fois plus élevé que ceux de GPT et Claude proposant des forfaits.
Li Guang (nom d'emprunt) est un chercheur dans le domaine de l'IA qui, en raison de ses besoins professionnels, consomme des dizaines de milliards de tokens chaque jour dans des scénarios de codage par IA. À ce niveau de consommation, l'utilisation de modèles nationaux, comme GLM-5.2, entraînerait un coût globalement très élevé.

Le relevé de tokens présenté par Li Guang
Le jour même de la conversation, les jetons consommés par Li Guang avaient atteint près de 4 milliards. En effectuant un léger calcul, si son utilisation était basée sur GLM-5.2, le coût serait approximativement de : (86,39 millions d'entrées ordinaires × 1,4 $ + 3,38 milliards d'entrées en cache × 0,26 $ + 19,06 millions de sorties et d'inférences × 4,4 $) soit environ 1 084 $, ce qui équivaut à environ 7 800 yuans chinois selon un taux de change de 1 $ = 7,2 yuans.
Et la raison pour laquelle Li Guang peut dépenser autant de tokens est qu'il a souscrit au forfait CodeX de GPT,
Voici une explication simple de la formule CodeX : en résumé, il s'agit d'un forfait dédié aux scénarios de programmation ; strictement parlant, il n'est pas illimité, mais intègre Codex dans l'abonnement ChatGPT : Plus à 20 $/mois, Pro à partir de 100 $/mois, avec un quota environ 5 à 20 fois supérieur à celui de Plus ; après épuisement, vous pouvez acheter des Credits pour continuer à utiliser le service.
De même, Claude Code d'Anthropic propose un ensemble de forfaits similaires : Claude Pro à 20 $/mois, Max 5x et Max 20x à 100 $ et 200 $/mois respectivement ; les quotas horaires de 5 heures et hebdomadaires sont partagés entre l'interface web Claude et Claude Code, et une utilisation supplémentaire est possible au prix de l'API après épuisement.
Under this package structure, the large token cost is effectively offset.
Pour les développeurs en Chine, consommer des dizaines ou des centaines de milliards de tokens par jour dans des scénarios de codage IA intensifs est une norme courante.
Xiao Liu est également un développeur passionné d'IA pour la programmation ; il dépense réellement 300 yuans par semaine sur Codex, même sans remboursement de son entreprise.
Mais même à ce prix, cela reste nettement « moins cher » comparé aux modèles nationaux, car avec les mêmes 300 yuans, il est impossible d'obtenir autant de tokens qu'avec GLM 5.2.

Relevé de tokens de Xiao Liu
Pour les développeurs en Chine, le forfait Codex de GPT est actuellement le token le moins cher disponible à l'achat, bien moins cher que les modèles ZhiPu et Kimi. Cela peut sembler contre-intuitif, mais la réalité est que les modèles nationaux ne peuvent tout simplement pas rivaliser en termes de rapport qualité-prix dans les scénarios de codage intensif.
Il faut préciser que Codex n'est pas un forfait illimité au sens strict : si l'on prend le forfait le plus élevé à 200 dollars, le quota hebdomadaire est d'environ 2 milliards.
Cependant, certains développeurs utilisent des moyens tels que des « stations de transfert » pour accéder aux modèles, ce qui fait que le coût réel de certains modèles est bien inférieur à celui des canaux officiels. Cela permet parfois d'acheter plus de tokens à un prix plus bas, ce qui explique le phénomène selon lequel on peut acheter 12 milliards de tokens pour 300 unités.
En réalité, les modèles nationaux n'ont pas été sans proposer de forfaits similaires, mais si l'on examine de plus près, ces forfaits présentent des restrictions importantes en termes de plafonds par rapport à Codex.
02 La douleur de la fixation des prix nationaux
La situation actuelle des grands modèles nationaux en matière de tarification peut être résumée en une phrase :
Vous pensiez entrer dans un buffet, mais vous avez fini par découvrir que le commerçant facturait encore au poids.
Par exemple, en ce qui concerne les forfaits, Kimi et GLM-5.2 en Chine proposent quatre niveaux de prix : 49, 99, 199 et 699 yuans, avec un quota actualisé chaque semaine ; pour le plan GLM Coding Plan, les versions Lite, Pro et Max offrent respectivement environ 80, 400 et 1600 prompts toutes les 5 heures, soit environ 400, 2000 et 8000 prompts par semaine, et pendant les heures de pointe, GLM-5.2 consomme trois fois plus de quota.
Prenez Qoder d'Alibaba comme exemple : selon un ami de l'auteur, travaillant dans le support client B2B et dont le pseudonyme est Ami, « Qoder était autrefois le meilleur IDE AI en Chine, malheureusement, sa nouvelle politique de tarification a éliminé cet avantage. »
Concernant les forfaits : Qoder CN Personnel Pro et Pro+ coûtent respectivement 59 et 169 yuans par mois, incluant 2 000 et 6 000 crédits ; les versions Équipe et VPC coûtent respectivement 99 et 199 yuans par siège et par mois, incluant chacune 3 000 crédits, avec un minimum de 50 sièges pour la version VPC.
Après qu’ils aient ajusté les prix en fusionnant Lingma, selon ce que je sais, au moins une vingtaine à une trentaine d’entreprises ont renoncé à renouveler leur abonnement, a expliqué Ami plus tard.
Selon les tests d'Ami, le forfait Qoder Enterprise Edition 199 est épuisé en trois jours selon son utilisation ; en cas d'utilisation intensive par un développeur, il serait probablement épuisé en un seul jour.
De même, en ce qui concerne les forfaits, GLM-5.2 laisse les utilisateurs nationaux dans un mélange d'émotions.
Selon le développeur Xiao Wei : « Les forfaits GLM-5.2 équivalent à peu près à n'en avoir aucun ; même avec un forfait, la limitation du débit persiste aux heures de pointe, et il existe des pratiques qui trahissent les utilisateurs. »
Selon un article de 36Kr : les forfaits GLM-5.2 étaient plus difficiles à obtenir que des billets de concert ; ils se rafraîchissaient précisément à 10 heures chaque matin, et l'achat dépendait entièrement de votre rapidité.
En janvier 2026, Zhipu a annoncé qu'en raison de la tension sur la puissance de calcul, la quantité quotidienne disponible à la vente avait été réduite directement à 20 % de l'ancien niveau, avec une libération limitée chaque matin à 10 h, épuisée en quelques minutes.
Au fond, la parcimonie des modèles nationaux en matière de forfaits et de prix est essentiellement due à un manque de puissance de calcul.
Selon les données de 2025 de l'Académie chinoise des technologies de l'information et de l'industrie et des technologies de l'information, la Chine compte 449 centres de données actifs, contre 5 427 aux États-Unis. En termes de puissance de calcul totale, la Chine affiche 1 053 EFLOPS, contre 2 400 aux États-Unis.
Mais le point clé ici est que, parmi les 2 400 EFLOPS américains, la part des GPU haut de gamme est très élevée ; dans les capacités de calcul chinoises, un grand nombre sont des puces nationales comme les Huawei Ascend et Cambricon, dont les performances unitaires présentent toujours un écart générationnel avec les H100.
Pour faire face à la demande croissante en puissance de calcul, à partir de mars 2026, Zhipu, Alibaba Cloud, Tencent Cloud et Baidu ont augmenté collectivement les prix des jetons, avec des hausses variant de 5 % à 460 %.
En clair, le « prix bas » et la « guerre des prix » des modèles nationaux appartiennent désormais au passé.
Ce n’est pas que les modèles nationaux ne veulent pas faire de buffet ; c’est parce que les chiffres ont été vérifiés : avec les coûts actuels de calcul et l’état de perte, proposer un abonnement mensuel revient à parier sur le fait que les utilisateurs ne vont pas épuiser le système, et compte tenu de la consommation des développeurs et programmeurs nationaux, qui utilisent parfois des dizaines ou même des centaines de milliards de tokens par jour, ce modèle commercial sera rapidement mis en défaut au regard des coûts.
Les forfaits de programmation d'OpenAI et d'Anthropic ciblent des clients entreprises à haut revenu — des clients majeurs comme Cursor et GitHub Copilot génèrent jusqu'à 1,4 milliard de dollars de revenus pour Anthropic par an.
Avec le soutien d'une puissance de calcul élevée, ce modèle économique consiste à échanger des frais mensuels fixes contre une fidélisation à long terme, ce qui garantit une qualité client élevée et un ARPU relativement élevé, permettant de répartir efficacement les coûts.
En comparaison, bien que la Chine dispose de géants du cloud comme Alibaba, le problème est que la marge EBITA ajustée d'Alibaba Cloud pour l'exercice fiscal 2026 n'est que de 7,5 % ; bien que le groupe Cloud Intelligence affiche une croissance rapide des revenus, ses bénéfices ne sont pas très élevés.
De plus, les fournisseurs traditionnels de cloud oseront vendre des serveurs cloud « illimités » parce que les utilisateurs ne fonctionnent pas à pleine charge 24 heures sur 24. Un serveur ECS peut avoir une utilisation CPU réelle de seulement 10 %, ce qui permet au fournisseur de survente une machine physique à dix utilisateurs.
Mais l'inférence des grands modèles est différente : chaque token généré consomme réellement de la puissance de calcul GPU. Si un utilisateur effectue des requêtes en continu pendant 24 heures, les coûts liés à la mémoire HBM, aux cœurs GPU et à l'électricité du fournisseur cloud sont des dépenses fixes, sans aucune possibilité de survente.
03 Le triangle d'or du modèle
Outre les facteurs de prix, le choix de Codex et Claude Code par les développeurs nationaux est incontestablement dû à leurs performances de programmation puissantes.
Cependant, en termes de performance, les modèles nationaux ne sont pas aussi limités que certains stéréotypes le suggèrent.
Après avoir discuté avec plusieurs développeurs, l'auteur a constaté une opinion assez répandue : les grands modèles nationaux, en particulier les plus récents comme GLM-5.2, sont désormais capables de prendre en charge certaines tâches auxiliaires et secondaires, telles que les tests et la correction de bogues.
Cependant, pour les tâches asynchrones plus complexes et de longue durée, les modèles nationaux présentent encore un écart significatif par rapport aux modèles de pointe tels que GPT et Claude.
Le développeur Xiao Zhang a utilisé un modèle chinois en mars de cette année pour la programmation, en comparant GLM, Qwen et GPT sur la même tâche ; seul GPT a terminé le processus et répondait aux exigences de la page, il s'agissait d'un projet de comparaison de contenu à plusieurs niveaux et plusieurs colonnes avec génération de résultats.
L'autre développeur, Xiao Wei, a indiqué que, selon son expérience, Kimi 2.7 et DouBao 2.1 Pro offrent également des performances acceptables, mais restent globalement un niveau en dessous (appartenant à la deuxième catégorie), tout en surpassant néanmoins Claude Sonnet 4.6.
Actuellement, le consensus général dans la communauté des développeurs est que GLM-5.2 est le premier modèle chinois à atteindre le niveau Opus.
Il est disponible et occupe une place importante lors de l'exécution de tâches asynchrones réelles, complexes et de longue durée.
Bien qu'il présente encore un écart significatif avec le modèle Opus véritable sur de nombreux axes, comme les connaissances mondiales, cela n'empêche pas qu'il représente un nouveau sommet pour les modèles nationaux.
Mais la réalité est que cela vient tout juste de commencer : quelques « meilleurs élèves » ont été freinés par des facteurs non liés aux performances.
Plus précisément, des facteurs tels qu'une faible efficacité du cache et des limites de débit encore appliquées pendant les heures de pointe rendent l'expérience des développeurs très médiocre.
Cela introduit un autre aspect dans la comparaison actuelle des modèles : la stabilité.
Dans l'expérience des développeurs et programmeurs sur le terrain, le choix du modèle n'est plus simplement une comparaison de performances, mais —
Le triangle d'or de la performance, du prix et de la stabilité.
Sur ces trois dimensions, les modèles nationaux n'ont obtenu que partiellement certaines métriques de la première dimension.
Récemment, Kimi a lancé son dernier modèle phare, K3 : un modèle open-weight doté de 2,8 billions de paramètres, nativement multimodal et avec un contexte de 1 million de tokens, conçu principalement pour la programmation à long terme, le travail intellectuel et le raisonnement approfondi.

Parmi de nombreuses évaluations, son indice d'intelligence sur Artificial Analysis est de 57 points, classé troisième mondial ; il occupe la première place du classement de programmation frontale d'Arena avec 1679 points, et il circulerait même des rumeurs selon lesquelles ses performances sont désormais comparables à celles de Claude Fable 5.
Cependant, derrière les scores et classements éclatants, le mot qui préoccupe le plus les développeurs reste : rapport qualité-prix.
Après le lancement de K3, de nombreux développeurs ont déclaré que Kimi reste encore cher, sans rapport qualité-prix par rapport à Codex, et que les quotas sont insuffisants ; en ne considérant que les prix de l'API, K3 ne peut pas être qualifié de « prix abordable » : les coûts pour un million de tokens en cache/entrée/sortie sont respectivement de 2 / 20 / 100 yuans ; pour GPT-5.6 Sol, ils sont de 0,5 / 5 / 30 dollars ; bien que K3 soit inférieur à Sol, il est nettement supérieur au GPT-5.6 Luna à 0,1 / 1 / 6 dollars.
Au cours de l'utilisation de K3, les développeurs ont indiqué avoir également rencontré des déconnexions API, y compris une interruption toute la matinée.
Dans la situation actuelle, les développeurs nationaux ne refusent pas de payer pour les modèles locaux ; ils ne peuvent tout simplement pas se permettre des forfaits aussi rentables que Codex, en raison de la pénurie de puissance de calcul et des coûts élevés. Ils doivent donc opter pour des forfaits apparemment « tout compris » mais en réalité limités, comme le « forfait Dianping » (similaire au Coding Plan de Zhipu).
L'expérience des forfaits est instable et leur rapport qualité-prix est flou, ce qui rend difficile la rétention des utilisateurs après une utilisation. En réalité, il s'agit d'un choix rationnel de la part des utilisateurs face aux coûts élevés actuels de l'infrastructure de calcul.
Ces éléments ne visent pas à renforcer la confiance des autres ou à affaiblir la nôtre, mais simplement à attirer l'attention sur un risque.
Actuellement, les modèles nationaux, en poursuivant GPT et Claude, mettent fortement l'accent sur les performances, mais le parcours des grands modèles nationaux, de la recherche au déploiement, implique bien plus qu'une seule montagne à gravir : les performances.
Nous devons simplement attendre jusqu'à ce que la base de calcul nationale soit produite à grande échelle, et que la technologie, le prix et la stabilité s'alignent pour que notre produit réponde aux attentes des utilisateurs.
