Les capacités des grands modèles d'IA s'améliorent rapidement ; Kimi K3 obtient 57 points et se classe troisième parmi les modèles open source mondiaux, tandis que la médiane des 20 meilleurs modèles passe de 34 à 43 points. Les goulets d'étranglement de l'infrastructure IA se font sentir : le prix de location des GPU Blackwell a augmenté de 27 % depuis le début de l'année, les prix des modèles de pointe en Chine ont bondi de 45 % en une semaine, et des laboratoires comme SpaceX dépensent 1 milliard de dollars pour acheter des équipements de production d'énergie. Citi souligne que la prochaine barrière compétitive passera de l'accès à la puissance de calcul à l'efficacité et aux données propriétaires, tandis que les risques sécuritaires s'intensifient : les agents IA autonomes sont passés de « perturber le déjeuner » à « pénétrer l'infrastructure Hugging Face ».Auteur et source de l'article : Hard AI
Citigroup analyse que le retour sur investissement (ROI) dans l'industrie de l'IA s'accélère vers la couche infrastructurelle, et que les avantages concurrentiels futurs passeront de l'accès à la puissance de calcul à l'efficacité et aux données propriétaires.
Les grands modèles d'IA deviennent de plus en plus intelligents, mais le monde physique qui les héberge est poussé à ses limites.
Dans son dernier rapport publié le 24 juillet, Citibank a indiqué que Moonshot's Kimi K3 a obtenu un score de 57, se classant troisième mondial, à seulement trois points derrière Claude Fable, leader des modèles propriétaires. Parallèlement, les prix des modèles avancés chinois représentés par Kimi K3 ont augmenté de 45 % en une semaine, les locations de GPU Blackwell ont grimpé de 27 % depuis le début de l'année, et certains laboratoires ont dépensé 1 milliard de dollars pour acheter directement des groupes électrogènes.
Citigroup analyse que le retour sur investissement (ROI) dans l'industrie de l'IA s'accélère vers la couche infrastructure ; la prochaine barrière compétitive dans la concurrence entre modèles passera complètement de la simple « acquisition de puissance de calcul » à la « production efficace et aux données propriétaires ».
01 L'écart ne fait plus que 3 minutes
Citigroup a mentionné dans un rapport d'analyse que Kimi K3 est le plus grand modèle open source actuellement publié. Il y a quelques semaines, le meilleur score open source était de 51 (Z.ai GLM-5.2) ; Kimi K3 a sauté à 57, juste derrière Claude Fable 5 (60) et OpenAI GPT-5.6 Sol (59).
L'ensemble de l'industrie s'accélère. Le score intelligent médian des 20 principaux fournisseurs de modèles est passé de 34 à 43 en six semaines. Dans le camp open source, DeepSeek V4 Pro (44 points) propose un prix aussi bas que 0,03 par million de tokens — un niveau de performance intelligent proche des meilleurs modèles, à deux ordres de grandeur inférieur en prix.
Le camp fermé n’a pas ralenti non plus. Google vient de lancer Gemini 3.6 Flash (le 21 juillet) et a révélé que Gemini 3.5 Pro est encore en test, tandis que la pré-formation de Gemini 4 a déjà commencé — trois générations de modèles avancent simultanément. Toutefois, Citi estime que ce rythme de publication, avec un « Flash en premier, Pro retardé », envoie un signal : le progrès des modèles de pointe devient de plus en plus difficile — ce qui correspond aux retards rencontrés par d’autres entreprises dans la construction de leur infrastructure et reflète la difficulté du secteur à réduire ses délais de livraison.
Plus le modèle est grand et puissant, plus les ressources nécessaires pour le faire fonctionner augmentent considérablement.
02 Le goulot d'étranglement a été déplacé
Les modèles de mille milliards de paramètres réécrivent la signification de « la puissance de calcul ».
Citibank souligne que, lors de l'exécution réelle de ces très grands modèles, un temps de plus en plus important est consacré au déplacement des poids et des données KV-cache entre la mémoire HBM et le réseau d'interconnexion GPU, plutôt qu'aux opérations matricielles elles-mêmes. Le goulot d'étranglement est passé de « si vite on calcule » (FLOPs) à « si bien on peut déplacer les données » — bande passante mémoire, interconnexion GPU et alimentation électrique.
La demande pour les GPU reste forte, et les loyers des architectures Blackwell ont augmenté de 27 % depuis le début de l'année. Mais il ne suffit plus simplement d'accumuler des GPU.
Certains laboratoires commencent à s'engager directement dans la génération d'électricité en amont : SpaceX a investi 1 milliard de dollars dans l'achat d'unités mobiles de turbine de 1 GW (15 juillet), et Georgia Power a signé un accord de service la même semaine (22 juillet). Acheter des équipements de production d'électricité par des laboratoires d'IA — une chose presque impensable il y a un an — est en train de se produire.
Les prix des modèles reflètent directement la tension de la capacité. Le prix mixte des modèles de pointe en Chine a bondi à 0,87 par million de tokens, en hausse de 45 % semaine sur semaine et mois sur mois, marquant la première forte fluctuation depuis deux mois. Le prix moyen mondial des modèles de pointe a augmenté de 6,8 % semaine sur semaine et de 11,3 % mois sur mois. Les États-Unis et l'Europe restent relativement stables (hausse de -0,5 % semaine sur semaine), mais ont également enregistré une hausse de 4,1 % mois sur mois.
Citibank estime que, à mesure que les infrastructures supplémentaires seront mises en ligne, la pression sur les prix sera finalement allégée. À ce moment-là, les données valorisées et les performances spécifiques aux tâches constitueront un avantage concurrentiel plus durable que l'accès à la puissance de calcul.
03 Agent s'échappe de la sandbox
Les modèles deviennent plus puissants. Mais les agents qui s'exécutent sur ces modèles deviennent également plus dangereux.
Le rapport de Citibank utilise une formulation intrigante : le risque réel d'évasion de sandbox par des agents IA autonomes est passé de « perturber le déjeuner » en avril à « pénétrer l'infrastructure de Hugging Face » en juillet.
Plus les modèles open source sont puissants et répandus, plus la portée des risques sécuritaires s'étend. Le débat sur la régulation de l'IA se poursuit — NVIDIA (24 juillet) et le secrétaire au Trésor américain Bessent (22 juillet) ont récemment fait part de leurs positions — mais aucune conclusion ne semble proche à court terme. Même si le cadre réglementaire n'est pas encore mis en place, les entreprises qui gèrent l'architecture de leurs propres modèles font déjà face à des exigences de conformité plus élevées.
Plus problématique encore, les fournisseurs eux-mêmes qui ont formé ces modèles ne peuvent toujours pas entièrement comprendre pourquoi les modèles agissent ainsi. La question de l’explicabilité reste sans solution à ce jour.
Mais les préoccupations en matière de sécurité n'ont pas ralenti le processus de commercialisation des agents. Selon les données de METR (21 juillet), l'écart économique entre les agents IA et les humains se réduit. À mesure que les agents deviennent plus autonomes et plus proches de la viabilité économique, la consommation de jetons s'accélère continuellement — ce qui, à son tour, augmente la demande en infrastructure.
Plus les capacités sont fortes, plus les contraintes sont strictes. Plus les contraintes sont strictes, plus les besoins en infrastructure sont élevés. Ce cycle ne montre aucun signe de ralentissement.
