Neuf modèles IA phares lancés en un mois, signant l'ère « jetable »

iconMetaEra
Partager
AI summary iconRésumé
Neuf modèles d'IA phares ont été lancés sur le marché en juillet 2026, notamment Tencent Hunyuan Hy3, Kimi K3 et Qwen3.8-Max. Les sorties rapides révèlent une concurrence accrue et une innovation plus rapide. Kimi K3 a occupé la première place du classement frontend de Code Arena, tandis qu'Hy3 a utilisé moins de paramètres actifs. Le prix et les performances du code comptent désormais autant que la puissance brute. Les traders suivent l'impact de ces évolutions sur l'indice de peur et de cupidité et les principales altcoins.
La durée de vie du « modèle le plus puissant » raccourcit.

Auteur et source de l'article : Dingjiao

Dans un mois, neuf modèles phares ont été lancés en même temps, ce qui est inhabituel dans l'industrie des grands modèles.

Du déploiement officiel et de l’ouverture du code de Tencent HunYuan Hy3 au début du mois, jusqu’à la sortie de Claude Opus 5 par Anthropic à la fin du mois, des modèles tels que Kimi K3, Qwen3.8-Max en version préliminaire et Grok 4.5 ont progressivement fait leur apparition. Juillet est devenu un pic de publications rare au cours de la dernière année.

Les entreprises n'ont pas choisi les mêmes moments. Certaines ont profité de l'intervalle après la mise à jour de leurs concurrents pour publier, d'autres ont fait leur apparition autour du Congrès mondial de l'intelligence artificielle, et certaines ont réagi à la concurrence par des ajustements de prix.

Mais juillet ne se distingue pas seulement par le grand nombre de modèles publiés, mais aussi par les deux changements qu'illustrent ces publications.

Premièrement, l'écart de performance entre les modèles se réduit. Le dernier indice d'intelligence globale d'Artificial Analysis montre que les différences entre les principaux modèles se sont nettement resserrées. Avec des itérations rapides des versions, la position du « meilleur modèle » devient de plus en plus difficile à maintenir à long terme, et chaque acteur commence à chercher des avantages sur des tâches spécifiques plutôt qu'à poursuivre un leadership absolu sur un seul axe.

Deuxièmement, les modèles open source entrent dans le premier échelon. Parmi les nouveaux modèles publiés en juillet, Tencent Hunyuan Hy3 et Kimi K3 ont choisi d'ouvrir leurs poids (mettant à disposition les paramètres du modèle, permettant aux développeurs de les télécharger et de les déployer eux-mêmes). Parmi ceux-ci, Kimi K3 occupe la première place sur le classement frontend de Code Arena, surpassant GPT-5.6 Sol et Claude Fable 5. Au cours des deux dernières années, les modèles open source étaient principalement perçus comme des poursuivants des modèles propriétaires ; cette nouvelle vague de concurrence montre cependant que les modèles open source commencent désormais à rivaliser directement avec les modèles propriétaires dans certains scénarios de développement.

Alors, quelles sont les changements et les implications de cette série intensive de publications ce mois-ci ?

01. Ne plus se concentrer uniquement sur qui est le plus intelligent

Au cours des dernières années, l'industrie des grands modèles se concentrait principalement sur les compétences générales : qui avait une connaissance plus large et des réponses plus précises. Mais maintenant, les critères de concurrence ont changé.

Cette fois-ci, les compétences en codage sont devenues la direction de concurrence la plus évidente.

OpenAI renforce continuellement la programmation et le raisonnement complexe, tout en élargissant l'écosystème Codex dans le but de lier les développeurs à ses outils. Anthropic mise sur la compréhension du code et les audits de sécurité pour aider les développeurs à résoudre des problèmes d'ingénierie complexes dans de grands projets. Grok 4.5 met l'accent sur la vitesse et le coût réduit, et est intégré à l'outil de programmation AI Cursor pour couvrir les scénarios de développement quotidiens.

Le chercheur en grands modèles Yao Yuhang a déclaré à « Dingjiao One » que toutes les entreprises investissent fortement dans les compétences de programmation, et que l'écart se réduit rapidement ; par exemple, les capacités de codage de Kimi K3 ont nettement progressé et approchent désormais le niveau des principaux modèles propriétaires.

Image source / pexels

L'agent est une autre direction disputée par les entreprises. GPT-5.6 Sol, associé à Codex, explore la programmation automatisée ; Opus 5 met l'accent sur l'exécution de tâches à long terme ; Kimi K3 démontre sa capacité à exécuter en continu des tâches complexes, tandis que Tencent Hunyuan Hy3 tente de combiner l'écosystème WeChat pour explorer les applications d'agents.

Cependant, les agents restent encore immatures dans leur application pratique. Le développeur indépendant Bei Cheng indique que les lacunes actuelles de certains produits d'agents ne résident pas dans leur capacité à utiliser des outils, mais dans leur capacité à planifier les tâches. Par exemple, le mode Ultra de Codex active de nombreux sous-agents qui lisent de manière redondante le même fichier et effectuent des analyses similaires, augmentant ainsi la consommation de tokens sans accroître réellement le travail efficace. Selon lui, l'amélioration des capacités des agents ne peut pas se limiter à augmenter le nombre de sous-agents ; l'essentiel réside dans la capacité à déterminer quelles tâches méritent d'être analysées et quelles étapes peuvent être omises.

Yao Yuhang partage une opinion similaire. Il estime que les agents représentent actuellement la direction la plus à surveiller, mais qu'ils sont encore loin d'être pleinement matures. Selon lui, les agents dans des domaines verticaux tels que la santé et la finance offrent encore de grandes opportunités ; la clé pour créer une différence à la prochaine étape ne réside pas seulement dans les capacités des modèles eux-mêmes, mais aussi dans leur facilité d'utilisation dans des scénarios concrets et la volonté des clients de les payer.

Les modèles nationaux cherchent des points d'entrée grâce à l'amélioration de différentes compétences. Kimi K3 a choisi de renforcer ses capacités en contexte long, en programmation frontend et en conception de produits, se classant parmi les meilleurs sur plusieurs tests de programmation, avec des performances proches des modèles phares propriétaires étrangers.

La compétition entre la taille du modèle et l'efficacité d'inférence devient une autre ligne directrice.

Plusieurs modèles publiés en juillet ont atteint des tailles de paramètres de plusieurs billions, voire plusieurs dizaines de billions, mais la taille des paramètres ne peut plus être directement équivalente à la performance. Avec l'évolution de l'architecture MoE, les modèles peuvent posséder une plus grande capacité en paramètres tout en n'activant qu'une petite partie d'entre eux pour l'inférence, réduisant ainsi le coût de calcul réel.

L'industrie se divise en deux approches : l'une consiste à continuer d'élargir l'échelle, en échangeant des paramètres plus élevés contre des capacités plus puissantes ; l'autre met l'accent sur l'efficacité, en atteignant des performances proches de celles des modèles phares avec des paramètres d'activation réduits.

Le prix est également la variable la plus directe dans la compétition des modèles de juillet.

Les fabricants étrangers adoptent davantage des stratégies de tarification différenciée. OpenAI choisit de segmenter davantage le marché, en divisant GPT-5.6 en différentes versions afin que les utilisateurs puissent sélectionner le modèle adapté à la complexité de leur tâche ; Anthropic maintient quant à lui sa stratégie de modèles phares haute performance, en couvrant les scénarios de développement hautement valorisés et les entreprises via la série Opus ; Grok 4.5 adopte une stratégie de prix bas, son prix de sortie étant seulement un quart de celui de la série Opus, et attire les développeurs grâce à son intégration avec Cursor.

Les fabricants nationaux mettent davantage l'accent sur leur avantage coûts. Au cours des six derniers mois, plusieurs fabricants de modèles nationaux ont continuellement réduit leurs prix d'API, dans le but de baisser les barrières à l'entrée en offrant des coûts plus faibles et d'élargir leur base de développeurs et d'utilisateurs professionnels.

En juillet, la concurrence entre les grands modèles s'est étendue au-delà des performances individuelles pour inclure la codification, les agents intelligents, l'efficacité des paramètres et le prix.

02. Qui a dépassé les attentes, qui a reçu des évaluations divisées ?

En comparant les améliorations par rapport aux générations précédentes, les performances sur les classements et les retours des développeurs, les modèles publiés en juillet peuvent être classés en trois catégories.

Commencez par les catégories ayant dépassé les attentes : Kimi K3, Grok 4.5, Hunyuan Hy3.

Le modèle le plus remarqué est Kimi K3. Ce modèle utilise une architecture MoE avec une taille totale de paramètres atteignant le niveau des billions, en renforçant particulièrement les capacités en contexte long, en programmation frontend et en conception de produits. Le jour de son lancement, Kimi K3 a atteint la première place du classement frontend de Code Arena avec un score de 1679, progressant de 17 places par rapport à la 18e place de son prédécesseur, Kimi K2.6. Une semaine plus tard, sur le classement général d'Arena, Kimi K3 est entré pour la première fois dans le top 10 mondial.

Mais Kimi K3 présente également des limites évidentes. Dans les tests de fiabilité des connaissances d'Artificial Analysis, son taux d'hallucinations est passé de 39 % pour Kimi K2.6 à 51 %, et sa vitesse de sortie est d'environ 33 tokens/s, bien inférieure à celle des modèles similaires.

Les retours des développeurs confirment également ce « déséquilibre ». Bei Cheng estime que Kimi K3 présente effectivement une amélioration notable par rapport à la génération précédente, avec des avantages principalement concentrés sur le développement frontend, le design UI et l'expression produit. Par exemple, pour des tâches telles que l'optimisation de l'UI d'un site web ou la conception d'une interface d'application, Kimi K3 produit de meilleurs résultats, mais sa performance n'est pas suffisamment stable lorsqu'il s'agit de tâches techniques complexes.

Image source / pexels

Grok 4.5 attire également beaucoup d'attention. Après sa publication le 9 juillet, il s'est classé parmi les premiers de l'indice intelligent Artificial Analysis et a excellé lors de certains tests d'appel d'outils, devenant un choix considéré comme offrant un excellent rapport qualité-prix par de nombreux développeurs.

La perception de Beicheng est cohérente avec cela ; il estime que le principal avantage de Grok 4.5 est sa vitesse : un même besoin peut être réalisé en trois à cinq minutes avec Grok 4.5, tandis qu'avec GPT-5.6, cela peut prendre jusqu'à vingt ou trente minutes. En plus de son prix plus bas, il est donc idéal pour des besoins de développement rapide. Yao Yuhang estime que les capacités de programmation de Grok 4.5 ont été spécifiquement optimisées, et que son utilisation combinée avec Cursor offre une expérience globale excellente. À ce sujet, SpaceX a précédemment annoncé l'acquisition d'Anysphere, la société mère de Cursor, avec une transaction prévue pour être finalisée au troisième trimestre ; le partenariat de données entre xAI et Cursor est également considéré comme ayant contribué à l'optimisation de l'expérience de programmation de Grok 4.5.

Hunyuan Hy3 représente une avancée sur la voie de l'efficacité. Ce modèle compte 295 milliards de paramètres totaux et seulement 21 milliards de paramètres activés, atteignant des performances proches de celles de concurrents plus volumineux sur plusieurs benchmarks publics, malgré une taille inférieure au cinquième de celle des modèles phares. Toutefois, sur SWE-Bench Pro, le score de 57,9 de Hunyuan Hy3 reste nettement en dessous des 69,2 de Claude Opus, indiquant que ses capacités en matière de correction de code complexe doivent encore progresser.

Yao Yuhang estime que Hy3 représente une amélioration par rapport aux modèles précédents de Tencent, et qu'avec son ouverture et sa conception compacte, c'est un bon choix parmi les modèles de taille moyenne.

Revenons sur les catégories stables au premier échelon, mais aux surprises limitées : GPT-5.6 Sol et Claude Opus 5.

GPT-5.6 Sol et Claude Opus 5 restent en tête de peloton, mais n'apportent pas de changements majeurs. GPT-5.6 Sol a renforcé ses capacités de raisonnement complexe et de programmation d'agents, atteignant 88,8 % sur le benchmark Terminal-Bench 2.1 (qui évalue la capacité des modèles à accomplir des tâches réelles dans un environnement de ligne de commande), et jusqu'à 91,9 % en mode Ultra. Claude Opus 5 conserve son avantage sur les tâches complexes, en mettant l'accent sur la fiabilité du modèle dans des scénarios tels que l'ingénierie complexe, la compréhension du code et l'analyse de sécurité. L'avantage d'Opus 5 réside dans une performance proche de Fable 5, à moitié prix.

Les deux modèles restent dans le premier peloton, sans toutefois apporter de percée majeure.

Bei Cheng a mentionné que GPT-5.6 couvre déjà la majorité de ses besoins quotidiens en développement, mais qu'il fait appel à Opus 5 pour résoudre des problèmes particulièrement complexes. Toutefois, des capacités plus puissantes impliquent également des coûts plus élevés. Pour lui, Opus 5 joue le rôle d'un « expert » déployé uniquement pour résoudre des problèmes critiques.

Enfin, une catégorie de retours divergents, encore à valider : Gemini 3.6 Flash et la version préliminaire de Qwen3.8-Max.

Le plus typique est Gemini 3.6 Flash, qui obtient un score de 50 sur le classement Artificial Analysis, identique à celui de sa prédécesseur, 3.5 Flash. La communauté des développeurs a globalement noté qu'il n'y a pas d'amélioration significative par rapport à la génération précédente et que ses performances sont inférieures à celles des concurrents de la même période. Toutefois, certains estiment que, en tant que modèle léger, la qualité des sorties de Gemini 3.6 Flash reste globalement acceptable.

Pour le développeur indépendant Kapdim, l'expérience quotidienne de Gemini 3.6 Flash est satisfaisante ; bien que ses compétences en programmation ne soient pas remarquables, sa compréhension multimodale reste excellente. Il prend en charge l'entrée de fichiers au format quelconque, et son style ainsi que son expérience de discussion quotidienne surpassent de nombreux concurrents.

Après le lancement de la version préliminaire de Qwen3.8-Max en juillet, les performances du modèle ont été instables et les retours du marché ont varié. La principale observation de Beicheng est que la version préliminaire de Qwen3.8-Max présente une profondeur de réflexion élevée, mais qu’elle se retrouve parfois piégée dans des raisonnements prolongés, « comme si elle s’embrouillait elle-même », sans parvenir finalement à proposer une solution efficace. Kapdim, quant à lui, estime que la version préliminaire de Qwen3.8-Max est inférieure aux attentes : lorsqu’il l’a évaluée avec son propre jeu de tests basé sur son esthétique frontend, il a constaté un écart marqué entre les capacités réelles et les promesses publicitaires. En tant que produit préliminaire encore en cours d’ajustement, sa performance finale devra être vérifiée après la sortie de la version officielle.

Aucun modèle n'a dominé sur tous les axes en juillet, et différents modèles ont commencé à se spécialiser selon des scénarios spécifiques.

Avec Beicheng, il choisit des outils en fonction des tâches : GPT-5.6 pour le développement quotidien, Grok 4.5 pour accomplir rapidement les exigences, Kimi K3 pour les scénarios produits et front-end, et Claude Opus 5 pour résoudre les problèmes complexes. La combinaison de Kapdim est différente : il utilise les modèles Fable 5 ou Opus 5 de Claude pour la planification, puis exécute via GPT-5.6 Sol.

03. Les publications deviennent de plus en plus fréquentes, le débat entre open source et closed source s'intensifie

Derrière cette série de publications intensives, plusieurs questions méritent d’être analysées : pourquoi les itérations de modèles deviennent-elles de plus en plus rapides, pourquoi se concentrent-elles sur juillet, et pourquoi l’open source va-t-il perturber les modèles économiques existants ?

Tout d'abord, la manière d'itérer les modèles évolue. Par le passé, l'amélioration des capacités des grands modèles reposait principalement sur le réentraînement de modèles plus volumineux, une approche longue et coûteuse. Toutefois, avec la maturité des technologies telles que l'apprentissage par renforcement et le post-entraînement (optimisation continue des performances du modèle après l'entraînement de base, par le biais de micro-ajustements ou d'apprentissage par renforcement), les mises à jour des modèles reposent désormais davantage sur l'optimisation après l'entraînement.

Yao Yuhang a indiqué à « Dingjiao One » que, au cours des deux dernières années, la vitesse de publication des modèles s'est nettement accélérée, principalement parce que l'industrie a désormais maîtrisé des méthodes d'entraînement postérieur plus matures. Aujourd'hui, de nombreuses améliorations des modèles ne nécessitent plus d'entraîner un modèle depuis le début, mais consistent à optimiser des modèles de base existants grâce à des techniques telles que l'apprentissage par renforcement et l'itération autonome.

Cela signifie que le cycle de concurrence entre les modèles s'accélère. Autrefois, un modèle leader pouvait conserver son avantage pendant plusieurs mois ; aujourd'hui, la fenêtre d'avantage apportée par une mise à jour peut ne durer que quelques semaines. Si le rythme de publication ne suit pas, un modèle peut rapidement être dépassé par une nouvelle version. Pour les fabricants, publier un modèle ne se limite pas à une démonstration technique : le moment même de la publication devient un élément de concurrence.

Image source / pexels

Ensuite, juillet est une période où plusieurs événements se chevauchent. Pour les fabricants nationaux, le Congrès mondial de l'intelligence artificielle (WAIC) se tient en juillet, et les entreprises concentrent leurs publications de modèles et la présentation de leurs avancées technologiques autour de cette période. Pour les fabricants internationaux, plusieurs entreprises leaders choisissent également cette phase pour mettre à jour leurs modèles, dans le but de prendre l'avantage dans l'écosystème des développeurs et la concurrence commerciale.

De plus, les règles de la concurrence dans l'industrie évoluent. Avoir un modèle puissant n'est plus le seul objectif ; la concurrence s'étend désormais à la manière dont les modèles sont utilisés et convertis en revenus.

C’est aussi pourquoi le débat entre modèles open source et closed source s’est intensifié à nouveau en juillet. Pendant longtemps, il y a eu un écart de performance entre les modèles open source et les modèles closed source. Mais avec l’entrée de certains modèles open source dans le premier échelon, une question plus réaliste se pose : lorsque des modèles hautement performants sont disponibles gratuitement, les revenus générés par les appels d’API et les abonnements des entreprises de modèles ne risquent-ils pas d’être détournés ?

Les partisans de l'open source estiment que les poids ouverts réduisent les barrières technologiques et permettent à davantage d'entreprises et de développeurs de participer à l'innovation en IA. L'open source signifie que les fournisseurs de technologie renoncent volontairement à une partie de leurs intérêts pour favoriser le développement de l'écosystème ; en revanche, les partisans du closed source craignent que leurs utilisateurs ne soient attirés par des modèles open source. Des entreprises comme Anthropic estiment qu'avec l'amélioration des capacités des modèles, l'ouverture des poids pourrait présenter des risques sécuritaires et nécessiter une gouvernance plus stricte.

Derrière ce débat se cachent en réalité les intérêts divergents des différentes entreprises. Pour les entreprises d’infrastructure comme NVIDIA, l’ouverture des modèles signifie davantage de demandes de déploiement et un marché de calcul plus vaste. Pour les entreprises de modèles comme OpenAI et Anthropic, le modèle fermé permet de maintenir les revenus issus des appels API et des abonnements. Toutefois, il faut aussi considérer l’autre face de la médaille : l’open source augmente effectivement la demande de déploiement, mais avec l’amélioration de l’efficacité paramétrique, la consommation de calcul par tâche unitaire pourrait également être diluée, ce qui signifie que la croissance du marché du calcul ne sera pas nécessairement synchronisée avec le niveau d’ouverture des modèles. Pour les fabricants nationaux, l’ouverture des poids ne constitue pas seulement un choix de voie technologique, mais aussi une stratégie pour conquérir l’écosystème des développeurs, les services cloud et les opportunités de commercialisation futures.

Après juillet, la concurrence entre les grands modèles se poursuivra. La communauté des développeurs prévoit généralement que de nouveaux modèles tels que DeepSeek V4 version officielle, Fable 5.1 et GPT-6 seront publiés progressivement en août.

L'écart de performance entre les modèles se réduit, et il devient de plus en plus difficile de créer un avantage durable en lançant simplement un modèle plus puissant. Les indicateurs concrets à suivre désormais sont les suivants : jusqu'où la version officielle de DeepSeek V4 poussera-t-elle la limite des performances des modèles open source ? Le prix de l'API continuera-t-il de baisser ? Les agents pourront-ils générer des scénarios de paiement stables ? Les modèles open source parviendront-ils à être déployés en interne par davantage d'entreprises ? Les réponses à ces questions expliqueront mieux que les classements ce que cette vague de concurrence a véritablement changé.

*Image de couverture provenant de Pexels.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.