Pourquoi les coûts des jetons AI baissent : la guerre des prix des LLM, les agents IA et l'avenir de l'inférence

Le coût de génération et de traitement des jetons de modèles de langage à grande échelle a chuté à un rythme que peu d'industries ont égalé. Début septembre 2026, l'indice des dépenses en jetons LLM de Silicon Data, un indicateur pondéré par l'utilisation des prix du marché effectifs, a atteint un plus bas historique de 97 cents par million de jetons, soit plus de la moitié de son pic estival et une fraction des niveaux observés il y a seulement quelques années. Cette baisse reflète une concurrence intense entre les laboratoires de pointe, la montée rapide de modèles open-weight performants développés par des entreprises chinoises, les améliorations de l'efficacité logicielle et matérielle, ainsi que des changements dans les schémas de demande induits par les agents IA.
Le résultat est un marché dans lequel l'inférence à haut volume est devenue nettement plus abordable, même si les flux de travail sophistiqués à plusieurs étapes consomment bien plus de jetons que les interactions de chat simples. La baisse des prix des jetons provient principalement de la pression concurrentielle et de l'efficacité technique, et non d'une simple destruction de la demande, ce qui permet des applications agentic plus larges tout en créant une pression sur les marges pour les fournisseurs de modèles et obligeant les entreprises à optimiser soigneusement le routage et la sélection des modèles.
Prix historiquement bas des jetons signale une intensification de la concurrence sur le marché
L'indice des dépenses en jetons LLM de Silicon Data, publié sous le ticker Bloomberg SDLLMTK, est tombé à 0,97 dollar par million de jetons le 1er septembre 2026, selon les données de l'entreprise et les rapports contemporains. Cela marque la lecture la plus basse depuis le lancement de l'indice et représente une baisse de plus de 50 % par rapport aux sommets enregistrés au début de l'été. Une analyse plus large montre que les coûts moyens d'inférence sont passés d'environ 2,04 dollars à la fin mai 2026 à la fourchette de 1,16 à 1,18 dollars début août, avant de continuer à baisser. Ces chiffres capturent les prix effectifs pondérés par l'utilisation à travers un mélange de modèles de pointe et ouverts observés via des plateformes de routage multi-fournisseurs, offrant une image plus claire de ce que le marché paie réellement que les prix listés seuls.
Le contexte à long terme souligne l'ampleur du changement : les performances de la classe GPT-3.5 qui coûtaient environ 20 dollars par million de jetons à la fin de 2022 étaient déjà tombées à environ 0,07 dollar en octobre 2024 selon le suivi de Stanford HAI, avec une compression supplémentaire depuis. Les coûts ajustés selon les capacités ont diminué encore plus rapidement dans de nombreux cas, avec des estimations d'amélioration annuelle de 5 à 10 fois sur la frontière prix-performance pour certains benchmarks. L'accélération récente coïncide avec des mouvements compétitifs spécifiques plutôt qu'une chute soudaine de l'utilisation globale de l'IA. Les entreprises et les développeurs continuent d'augmenter la consommation de jetons, mais le prix moyen payé continue de baisser tandis que les options moins chères gagnent en part de marché et que les fournisseurs ajustent leurs tarifs affichés. Cette dynamique a rendu des tâches à haut volume auparavant coûteuses plus viables tout en mettant en évidence la différence entre l'économie unitaire et la dépense totale.
Les réductions agressives de prix de GPT-5.6 d'OpenAI accélèrent la baisse
À la fin juillet 2026, OpenAI a réduit les prix de sa famille GPT-5.6 quelques semaines seulement après sa disponibilité générale. Le niveau Luna a subi une réduction de 80 %, ramenant les jetons d'entrée à 0,20 dollars et les jetons de sortie à 1,20 dollars par million. Le modèle Terra de milieu de gamme a reçu une réduction de 20 %, à 2 dollars pour les entrées et 12 dollars pour les sorties. Le modèle phare Sol a initialement maintenu son prix de 5/30 avant une réduction promotionnelle ultérieure de plus de 20 % pendant une période de trois mois. Les déclarations de l'entreprise ont attribué ces changements en partie à des gains d'efficacité internes issus des modèles eux-mêmes, notamment une meilleure optimisation du code et une efficacité accrue du service. Ces mesures interviennent alors que les entreprises examinent de plus en plus attentivement leurs factures d'IA et que des alternatives moins coûteuses gagnent en popularité.
Le calendrier, avec une réévaluation si peu de temps après le lancement, a signalé une volonté de privilégier le volume et la position sur le marché plutôt que la marge à court terme pour le trafic de niveau moyen et inférieur. Les charges de travail à fort volume, telles que la classification, l'extraction, le routage et les premières étapes des boucles d'agents, en bénéficieront le plus, car elles peuvent désormais fonctionner à grande échelle sur des modèles performants sans l'obstacle de coût précédent. Les ajustements ultérieurs et l'introduction de modes plus rapides à tarification premium illustrent une stratégie en niveaux qui maintient la capacité de pointe différenciée tout en rendant l'intelligence quotidienne plus accessible. Les réductions ont directement contribué à la compression observée des indices de marché pondérés.
Les modèles open-weight chinois rétablissent le niveau de compétitivité
Les développeurs chinois ont introduit des modèles open-weight très performants et à faible coût qui réduisent les prix des frontières occidentales de marges substantielles. Les offres DeepSeek apparaissent fréquemment parmi les options les plus économiques sur les plateformes de routage, certaines configurations ayant historiquement été facturées à quelques dizaines de cents par million de jetons, et les itérations ultérieures conservant des tarifs agressifs même après ajustements pour les périodes de pointe et creuses. Les modèles Kimi de Moonshot AI, y compris la série K3, offrent un autre vecteur compétitif avec des prix listes qui, bien que supérieurs aux options open les moins chères, contournent encore de nombreuses offres propriétaires de milieu de gamme sur une base ajustée aux performances dans des charges de travail spécifiques.
Les rapports de mi-2026 ont indiqué que les modèles chinois capturaient une part significative sur les plateformes d'agrégation, certaines analyses notant que les quatre modèles les plus populaires sur un routeur majeur étaient chinois à plusieurs moments de l'année. Les écarts de performance se sont réduits sur de nombreuses tâches pratiques telles que la programmation, la synthèse et le travail de connaissance générale, permettant aux utilisateurs sensibles au coût et aux startups de déplacer leur volume. Cette pression oblige les fournisseurs propriétaires à réagir en réduisant leurs prix ou à risquer de perdre des segments à fort volume. Les poids ouverts permettent également l'hébergement autonome et l'hébergement par un tiers à des coûts effectifs encore réduits pour les organisations disposant de la capacité opérationnelle. L'effet cumulatif se manifeste dans les indices combinés, car l'utilisation migre vers des alternatives moins coûteuses pour les tâches adaptées.
Gains d'efficacité dans les logiciels et service exercent une pression tarifaire composée
Au-delà de la concurrence sur les prix affichés, les progrès techniques ont réduit le coût sous-jacent de génération de chaque token. La quantification, le décodage spéculatif, une meilleure gestion du cache KV, un meilleur regroupement et des optimisations spécifiques aux modèles ont tous réduit la puissance de calcul requise par token. Les ingénieurs d’OpenAI ont discuté publiquement, au milieu de 2026, d’optimisations purement logicielles qui ont réduit de plus de moitié certains coûts d’inférence, permettant au trafic invité sur ChatGPT de fonctionner avec une empreinte GPU nettement plus réduite que ce que les estimations antérieures suggéraient. Les accélérateurs personnalisés et la co-conception plus étroite entre les modèles et le matériel continuent d’augmenter l’utilisation.
Ces gains permettent aux fournisseurs de réduire leurs prix tout en protégeant ou même en améliorant leurs marges sur le trafic à haute valeur restant. Les améliorations de performance-prix des matériels d'environ 30 % par an et les gains d'efficacité énergétique proches de 40 %, comme noté dans les analyses industrielles connexes, offrent un vent arrière structurel. La combinaison signifie que même sans pression concurrentielle, le plancher des coûts continuerait de baisser, bien que plus lentement. Ajouté à la concurrence des modèles ouverts et aux réponses tarifaires agressives, le résultat est la compression rapide observée. Les fournisseurs qui ne capturent pas ces efficacités risquent d'être largement dépassés.
Les agents IA stimulent des volumes de jetons plus élevés malgré des coûts unitaires plus faibles
Bien que le prix par token ait chuté de manière marquée, les dépenses totales pour l'inférence n'ont pas nécessairement diminué de façon parallèle. Les systèmes agents, des flux de travail en plusieurs étapes qui planifient, appellent des outils, vérifient les résultats et itèrent, consomment nettement plus de tokens que les applications traditionnelles de chat ou à unique tour. Les analyses indiquent que les agents peuvent nécessiter 5 à 30 fois plus de tokens pour des tâches équivalentes en raison de la transmission répétée du contexte, du raisonnement intermédiaire, des sorties d'outils et des boucles de correction automatique. Un agent de codage fonctionnant pendant une heure pourrait traiter des millions de tokens, tandis qu'un simple chatbot n'en utilise que des dizaines de milliers.
Gartner et d'autres projections de recherche suggèrent que les coûts d'inférence pour les flux de travail agents pourraient augmenter plusieurs fois, même si les prix unitaires baissent, reflétant à la fois un volume plus élevé et le besoin fréquent de modèles de raisonnement plus puissants. Ce schéma ressemble au paradoxe de Jevons : une intelligence moins chère élargit l'ensemble des utilisations économiquement viables, augmentant ainsi la consommation globale. Les entreprises qui déployent des agents à grande échelle font donc face à des factures absolues croissantes, à moins qu'elles n'implémentent un routage soigneux, un cache, une cascade de modèles et une optimisation des invites. La baisse du coût unitaire est précisément ce qui rend le déploiement à grande échelle des agents possible ; sans elle, beaucoup de ces systèmes resteraient trop coûteux pour une utilisation en production.
Les coûts ajustés selon les capacités diminuent plus rapidement que les prix nominaux des jetons
Les prix nominaux par token sous-estiment la véritable amélioration, car les modèles continuent d'acquérir des capacités. Un dollar dépensé en 2026 permet d'acheter à la fois des tokens moins chers et des systèmes plus performants que le même dollar il y a plusieurs années. Les données de suivi de Stanford HAI et d'Epoch AI montrent une baisse des coûts à capacité fixe de l'ordre de 10 fois par an dans de nombreux cas, avec des améliorations spécifiques aux tâches encore plus élevées. Les modèles de pointe sont eux-mêmes devenus moins chers au fil des générations, alors même que leurs performances absolues augmentent.
Une intelligence de classe GPT-4, qui coûtait autrefois des dizaines de dollars par million de jetons, est désormais disponible à une petite fraction de ce coût auprès de plusieurs fournisseurs. Les métriques ajustées à la qualité montrent donc des baisses encore plus marquées que l'indice global. Ce double mouvement — baisse des prix unitaires et augmentation des capacités — explique pourquoi les charges de travail agentic et en temps d'exécution, qui n'étaient pas économiques en 2023–2024, sont devenues courantes. Les organisations évaluant le coût total de propriété doivent prendre en compte ces deux dimensions, et non se concentrer uniquement sur les tarifs affichés.
Les modèles à poids ouverts et la concurrence d'hébergement augmentent l'offre
La disponibilité de modèles open-weight puissants a considérablement augmenté l'offre effective de capacité d'inférence au-delà des laboratoires propriétaires. Les fournisseurs de cloud et les hôtes d'inférence spécialisés peuvent proposer des tarifs compétitifs pour les modèles de la famille Llama, DeepSeek, Qwen et similaires, sans supporter le coût complet de l'entraînement de pointe. Cela crée une contrainte concurrentielle permanente sur la tarification propriétaire. Les plateformes de routage ont observé une augmentation significative de la part du trafic open-source ou open-weight pendant les périodes de lancements agressifs de modèles chinois.
Les entreprises ayant des exigences en matière de sécurité ou de résidence des données, qui évitaient autrefois ces modèles, les évaluent de plus en plus pour des charges de travail non sensibles. L'hébergement autonome réduit davantage les coûts marginaux pour les organisations pouvant amortir le matériel et les efforts d'ingénierie. Le résultat net est un marché bifurqué dans lequel les modèles propriétaires les plus performants commandent un premium, tandis qu'une part importante et croissante du volume migre vers des alternatives moins coûteuses. Les fournisseurs doivent donc concourir à la fois sur la capacité absolue et le rapport performance-prix sur l'ensemble du spectre de la demande.
Les schémas de dépenses des entreprises évoluent vers l'optimisation et le routage
Alors que les prix unitaires baissent et que les volumes d'agents augmentent, les acheteurs sophistiqués ont réagi en mettant en œuvre un routage modélisé, un cascadement, un mise en cache et des contrôles d'utilisation. Des entreprises de legal-tech et d'autres sociétés spécialisées ont signalé des réductions de coûts multiples en combinant des modèles premium pour les étapes critiques avec des alternatives moins coûteuses pour le traitement routinier, sans perte de qualité mesurable sur leurs charges de travail. Les agrégateurs et les passerelles internes rendent désormais pratique l'envoi de chaque demande au modèle le moins coûteux répondant au seuil de qualité requis.
Le cache des invites, le traitement par lots et les modes plus lents non urgents compressent davantage les coûts effectifs. Certaines organisations ayant épuisé leur budget annuel d'IA au début de l'année ont imposé des plafonds internes ou ont opté pour des modèles de niveau inférieur. Ces comportements renforcent la pression à la baisse sur les prix du marché pondérés, tout en permettant à l'adoption globale de l'IA de continuer à s'étendre. Les gagnants dans cet environnement sont les équipes qui considèrent la sélection des modèles et l'infrastructure comme des problèmes d'optimisation continus, et non comme des choix statiques de fournisseurs.
Une pression sur la marge s'accumule chez les fournisseurs de modèles Frontier
Les baisses rapides des prix créent des défis clairs pour les entreprises ayant fortement investi dans la formation de modèles de pointe. Une revenu par unité de capacité plus faible peut comprimer la voie vers la rentabilité, même si l'utilisation totale augmente. À la fois OpenAI et Anthropic ont fait l'objet d'une surveillance accrue concernant leur pouvoir de fixation des prix et leurs marges futures, particulièrement dans le contexte de déclarations potentielles sur les marchés publics. Les laboratoires chinois, qui forment à des coûts et des prix plus bas déclarés, capturent agressivement un volume qui pourrait autrement soutenir des prix plus élevés en Occident.
Dans le même temps, le passage vers des charges de travail agentes qui privilégient des modèles de raisonnement plus puissants offre un certain contrepoids, puisque ces modèles continuent de commander des primes significatives. Les fournisseurs répondent par une tarification en niveaux, des réductions de coûts axées sur l’efficacité et une différenciation des produits. La question de savoir si ces stratégies peuvent restaurer des économies unitaires attractives tout en défendant leur part de marché reste ouverte et façonnera l’intensité capitalistique et la structure concurrentielle de l’industrie au cours des prochaines années.
L'économie du matériel et de l'infrastructure continue d'évoluer
Les coûts informatiques sous-jacents constituent la base du prix de l'inférence. Les améliorations de l'utilisation des GPU, des accélérateurs spécialisés, de la bande passante mémoire et du réseau contribuent toutes à réduire le coût par token. Des puces personnalisées conçues spécifiquement pour les charges de travail transformer promettent des gains supplémentaires une fois produites en série. Les améliorations de l'efficacité énergétique réduisent les dépenses opérationnelles à grande échelle. Ces tendances structurelles soutiennent des baisses de prix continues, indépendamment de l'intensité concurrentielle.
En même temps, le capital énorme requis pour construire et faire fonctionner de grands clusters crée des barrières et détermine quelles entreprises peuvent concourir à la pointe. L'interaction entre les progrès matériels et l'optimisation logicielle déterminera à quelle vitesse le coût minimal continuera de baisser et si les modèles à poids ouverts pourront combler les écarts de capacité restants à des coûts comparables.
L'avenir de l'inférence penche vers des systèmes spécialisés et en cascade
À l'avenir, la combinaison de la baisse des coûts des jetons et de l'augmentation de la complexité des agents pointe vers des architectures d'inférence plus sophistiquées. Les systèmes en cascade qui utilisent des modèles peu coûteux pour un filtrage initial et des modèles coûteux uniquement lorsque nécessaire, le routage mixture-of-experts, des modèles petits spécialisés pour des sous-tâches courantes et le cache avancé deviendront standard. Les techniques de calcul au moment du test qui échangent des jetons supplémentaires contre une fiabilité accrue deviennent plus attractives à mesure que le prix de ces jetons diminue.
La viabilité économique des agents en arrière-plan continus et de l'automatisation à grande échelle s'étend. Les organisations qui mettent en place une infrastructure solide d'évaluation, de routage et de suivi des coûts extrairont la plus grande valeur. La guerre des prix elle-même est peu susceptible de se terminer brusquement ; elle évoluera plutôt en une concurrence continue entre niveaux de qualité, niveaux de latence et spécialisations.
Effets pratiques pour les développeurs et les entreprises
Les développeurs et les entreprises opèrent désormais dans un environnement où le coût marginal de l'intelligence est suffisamment bas pour expérimenter de manière agressive, mais où les dépenses totales peuvent tout de même augmenter rapidement avec le déploiement d'agents. Les meilleures pratiques incluent l'évaluation continue du rapport prix/performance entre les fournisseurs, l'utilisation agressive du cache et des modes par lots, une ingénierie soigneuse des invites pour réduire les jetons inutiles, et une budgétisation interne claire pour les charges de travail des agents.
Choisir le bon modèle pour chaque étape d’un flux de travail génère souvent des économies plus importantes que la négociation de remises sur les prix listés. Surveiller les coûts pondérés par l’utilisation plutôt que les prix listés fournit une image plus précise de l’économie réelle. Les entreprises qui traitent la gestion des coûts d’inférence comme une discipline d’ingénierie fondamentale plutôt que comme une après-pensée scaleront les applications d’IA de la manière la plus efficace alors que le marché continue d’évoluer.
FAQ
De combien les prix des jetons AI ont-ils réellement baissé ces dernières années ?
Les données à long terme provenant de Stanford HAI et des indicateurs associés montrent que les coûts d'inférence de la classe GPT-3.5 ont diminué de plus de 280 fois entre la fin 2022 et la fin 2024, avec une compression supplémentaire prévue jusqu'en 2026. Les mesures ajustées selon les capacités montrent souvent des améliorations annuelles encore plus marquées, d'environ 5 à 10 fois ou plus sur des benchmarks spécifiques. Les indices combinés récents, tels que celui de Silicon Data, ont atteint des niveaux historiquement bas, aux alentours de 97 cents par million de jetons, au début septembre 2026, après de plus importantes baisses au cours de l'année.
Qu'est-ce qui a précisément causé la chute brutale à mi- et fin 2026 ?
Les principaux moteurs à court terme ont été les réductions de prix substantielles d'OpenAI sur les modèles GPT-5.6 Luna et Terra à la fin juillet 2026, combinées à des prix agressifs continus et à des gains de capacité provenant des modèles open-weight chinois, tels que ceux de DeepSeek et Moonshot. Ces mouvements ont orienté l'utilisation vers des options moins coûteuses et imposé des ajustements plus larges sur le marché, visibles dans les indices pondérés par l'utilisation.
La baisse des prix des jetons signifie-t-elle que les factures totales d'IA diminuent ?
Pas nécessairement. Les systèmes agents consomment bien plus de jetons par tâche accomplie, souvent 5 à 30 fois plus que les interactions simples, en raison du raisonnement itératif, de l'utilisation d'outils et de la retransmission du contexte. De nombreuses organisations constatent donc une augmentation des dépenses absolues, même si le prix par jeton diminue, ce qui illustre classiquement une augmentation de l'utilisation suivant une baisse des coûts.
Comment les modèles chinois se comparent-ils en termes de prix et de capacité ?
Les modèles chinois open-weight et via API réduisent fréquemment les prix des frontières occidentales de grandes marges sur des charges de travail comparables, certaines configurations étant historiquement disponibles à moins d'un dollar par million de jetons, tandis que les offres ultérieures restent très compétitives. Les performances ont progressé rapidement sur des tâches pratiques, entraînant des gains mesurables de part de marché sur les plateformes de routage, bien que des différences persistent sur les benchmarks de raisonnement de pointe absolue et spécialisés.
Quel rôle jouent les améliorations d'efficacité par rapport à la simple concurrence sur les prix ?
Les deux sont importants. Les optimisations logicielles, telles qu'une meilleure quantification, la décodage spéculatif et les techniques de service, ont réduit le coût réel de production de jetons, permettant aux fournisseurs de réduire leurs prix tout en protégeant leurs marges. Les progrès matériels renforcent cette tendance. La pression concurrentielle des modèles ouverts et des laboratoires rivaux accélère la traduction de ces gains d'efficacité en prix plus bas et en prix du marché effectifs.
Les entreprises doivent-elles passer entièrement aux modèles les moins chers disponibles ?
Rarement. La meilleure approche est généralement le routage sélectif : utilisez des modèles moins coûteux pour les étapes à fort volume et faible enjeu, et réservez les modèles plus puissants aux tâches de raisonnement critique ou à fort coût d'erreur. De nombreuses organisations réalisent des économies substantielles grâce au cascade et à la sélection pilotée par l'évaluation, sans sacrifier la qualité globale des résultats.
🔥 KuCoin propose une option plus stable sur un marché volatil
Si vous vous inquiétez des fluctuations fréquentes du marché et que vous cherchez une option plus stable pour gagner de l'argent passivement, KuCoin est l'endroit idéal :

Simple Earn : Déposez et retirez des jetons à tout moment, en gagnant des rendements stables.
KuCoin Earn : Gagnez des profits stables grâce à une gestion d'actifs professionnelle.
Conserver pour gagner : Gagnez des récompenses en conservant des actifs dans les comptes Financement, Trading, Marge, Futures, Minage et Compte unifié.
Staking : Libérez le potentiel de gain des actifs sur chaîne.
Investissements avancés : Les investissements avancés proposent une variété de produits structurés pour faire croître votre argent sur tous les marchés.
Shark Fin : Protection du capital et gains garantis
Double investissement : Achetez bas et vendez haut avec des calculs de rendement transparents.
Boule de neige : Rendements élevés, avec une protection des prix.
ACHAT À PRIX RÉDUIT : Achetez des crypto-monnaies à des prix réduits.
KCS Loyalty : Passez au niveau supérieur pour profiter de avantages exclusifs en stakant ≥ 1 KCS.
Patrimoine KuCoin : Découvrez la valeur future et commencez votre parcours d'investissement intelligent.
Avantages KCS : Détenir et mettre en staking KCS pour accéder à des avantages sur l'ensemble de la plateforme.
KCS Staking 2.0 : Participez à la gouvernance sur chaîne de KCS pour générer des rendements.
Avertissement : Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil en investissement. Les investissements dans les cryptomonnaies comportent des risques. Veuillez effectuer vos propres recherches (DYOR).
Avertissement : Pour votre confort, cette page a été traduite à l'aide de la technologie IA. Pour obtenir les informations à la source, consultez la version anglaise originale.
