Le récit central autour des investissements dans les infrastructures IA fait face à des défis sérieux au niveau de l’économie unitaire. Le prix des jetons a chuté plus rapidement que prévu : l’indice High Silicon Data LLM Token Expenditure a baissé de 29 % en août, tombant à environ 0,97 $, pour la première fois sous la barre des 1 $ par million de jetons. Parallèlement, l’utilisation de la plateforme OpenRouter a augmenté de 47 %, mais les dépenses en dollars n’ont progressé que de 7 %. L’écart croissant entre volume croissant et prix en baisse révèle la contradiction fondamentale : les rendements du marché boursier sont calculés en dollars, et non en nombre de jetons. Cela marque un bouleversement fondamental de la logique de revenus qui soutenait la valorisation du secteur IA au cours des deux dernières années, un avertissement déjà émis par les marchés de crédit.Auteur et source de l'article : Wall Street Journal
Le récit central autour des investissements dans les infrastructures IA fait face à des défis sévères au niveau de l'économie unitaire. La chute des prix des tokens a dépassé les attentes du marché, minant fondamentalement la logique de revenus qui soutenait les valorisations du secteur IA au cours des deux dernières années.
Selon le dernier rapport de Rich Privorotsky, responsable de la plateforme de trading One-Delta de Goldman Sachs, l'indice Silicon Data LLM Token Expenditure Index (code : SDLLMTK), qui mesure le prix moyen pondéré utilisé par million de tokens sur le marché, a chuté de 29 % en août, se situant à environ 0,97 dollar à la fin du mois, un niveau historique bas, soit une baisse cumulée de plus de 50 % par rapport au pic de mai à environ 2,05 dollars. Il s'agit de la première fois que cet indice franchit la barre des 1 dollar par million de tokens.

Dans le même temps, selon les données du centre de données de JPMorgan, l'utilisation des jetons sur la plateforme OpenRouter a augmenté d'environ 47 % mois sur mois en août, mais les dépenses en dollars n'ont augmenté que d'environ 7 %. L'écart entre la hausse des volumes et la faible croissance des prix révèle directement la contradiction fondamentale de la logique actuelle d'investissement dans l'IA : les rendements des marchés boursiers sont calculés en dollars, et non en nombre de jetons, et les dépenses en capital des centres de données à très grande échelle sont évaluées sur la base des prévisions de revenus en dollars.
Privorotsky a clairement indiqué dans son rapport : « Une demande accrue combinée à des prix plus bas ne constitue pas automatiquement un signal positif si le prix chute plus vite que la croissance de la consommation. »
Effondrement du prix du token : ce n'est pas la demande qui disparaît, mais l'unité de prix qui s'effondre
L'indice des dépenses en tokens LLM de Silicon Data n'est pas un indicateur de la demande de tokens, mais un indice de prix pondéré par l'utilisation. L'entreprise a elle-même indiqué au marché que la baisse de cet indice pourrait être due à une réduction des prix, à un déplacement des utilisateurs vers des modèles open source moins coûteux, ou aux deux à la fois, et ne signifie pas nécessairement une contraction de l'utilisation de l'IA.
Cependant, c'est précisément le problème. Le volume de routage sur OpenRouter a fortement augmenté, tandis que les prix de location des GPU H100 ont baissé — ce qui contredit le récit d'une demande accrue pour les jetons. Privorotsky souligne que les données d'août révèlent un schéma clair : un volume fortement en hausse, une baisse des prix encore plus prononcée, et des dépenses en dollars à peu près stables.
La conclusion de Goldman Sachs est que la valorisation des actions au cours des deux dernières années reposait sur l'hypothèse selon laquelle « plus de jetons égalent plus de revenus », et les données d'août ont pour la première fois clairement remis en question cette hypothèse.
Renforcement de la concurrence et inférence locale : érosion structurelle du modèle de tarification par token
Privorotsky a déclaré dans son rapport qu'il était sceptique quant à la viabilité du modèle économique basé sur la facturation par token. La logique de tarification au million de tokens pour l'inférence cloud repose sur trois hypothèses simultanément valables : le modèle est trop volumineux pour être exécuté localement, les utilisateurs ne peuvent pas le remplacer par une alternative open source, et la charge de travail est suffisamment imprévisible pour que l'infrastructure propre ne soit pas rentable. Or, ces trois hypothèses sont en train de s'effondrer simultanément.
Au niveau matériel, les ordinateurs portables de la gamme RTX Spark, les stations de travail DGX Spark, les Mac Studio capables d'exécuter des modèles de 70 milliards de paramètres, ainsi que les NPU offrant une puissance de calcul comprise entre 40 et 75+ TOPS, ont réduit le coût marginal de chaque token à un niveau proche de celui de l'électricité. Dès que la facture mensuelle en API d'une entreprise dépasse le coût d'amortissement d'un équipement de 5 000 à 15 000 dollars, cette entreprise passe de consommatrice de tokens à acheteuse unique de matériel, plutôt que d'être un abonné logiciel générant continuellement un taux de marge de 40 %.
Sur le plan de la concurrence entre modèles, Muse Spark 1.3, lancé par Meta le 2 septembre, se situe désormais au même niveau que GPT-5.6 Sol et Claude Opus 5 sur des tests indépendants, et excelle particulièrement dans les tâches d'agents et la génération de code. Privorotsky souligne : « L'avance de pointe se mesure en semaines et ne constitue pas un avantage concurrentiel durable, mais simplement un cycle produit. » Dès qu'un modèle次优 devient suffisamment proche en performance tout en étant moins cher, les entreprises contourneront les niveaux de prime, et l'indice des prix des jetons reflète précisément cette agrégation de décisions de routage.
Les dépenses de capital sont sous pression : les marchés de crédit ont déjà émis des avertissements
Le rapport de Goldman Sachs indique que ce cycle d'investissements en IA n'est pas une dépense opérationnelle flexible, mais un engagement lourd déjà verrouillé. Selon le rapport, les dépenses d'investissement des cinq fournisseurs de nuages hyperscalables notés devraient atteindre environ 737 milliards de dollars en 2026, soit environ 38 % de leur chiffre d'affaires. Moody's a émis une alerte concernant la compression des flux de trésorerie libres, la transition du bilan d'un modèle à actifs légers vers un modèle à actifs lourds, ainsi que les engagements de location qui, bien qu'non exprimés sous forme d'obligations, contraignent réellement les émetteurs.
Les marchés de la dette ont réagi avant les marchés actions. Selon une analyse des obligations concernées, 78 des 91 obligations émises par de grands fournisseurs de cloud pour 2026 ont déjà chuté en dessous de leur prix d'émission avant la fin août. Privorotsky qualifie cela de « réévaluation du crédit » et souligne que les multiples d'évaluation des actions sont des indicateurs retardés.
La chaîne logique est claire : une baisse de 30 % du prix du token et une augmentation de 20 % de l'utilisation entraînent une baisse des revenus ; les amortissements et les intérêts associés au cycle de construction de 2025 à 2027 continuent d'augmenter tandis que les revenus de traitement diminuent, ce qui fait s'effondrer le rendement sur investissement ; une fois ce rendement sur investissement effondré, le marché n'a pas besoin d'une narration dramatique de « bulle éclatée » : il suffit d'ajuster les multiples d'évaluation pour refléter le niveau d'une entreprise d'utilité publique possédant de nombreux actifs mais ayant une capacité de tarification limitée.
GPT-6 Astra : le seul facteur de retournement narratif restant
Dans le rapport, Privorotsky considère le prochain modèle d'OpenAI, Astra, comme le seul catalyseur à court terme susceptible de changer la donne. Le 1er septembre, OpenAI a déclaré qu'Astra avait atteint le seuil critique de sécurité réseau de son cadre de préparation, devenant ainsi le premier modèle à être inclus dans cette catégorie.
Cependant, la plateforme de trading de Goldman Sachs reste prudente à ce sujet. Un modèle agressif soumis à des restrictions d'accès, nécessitant une surveillance et présentant une friction d'utilisation élevée ne complétera pas automatiquement le pool de jetons. Si les charges de travail à haute valeur restent constamment dans des environnements de test contrôlés sans entrer dans le système de facturation public, Astra pourrait même réduire le nombre de jetons facturés.
La conclusion du rapport est que Astra est la dernière variable récente capable de réorienter le portefeuille de revenus vers des niveaux plus élevés. Avant cela, les données de prix des jetons d'août constituent le signal le plus fidèle de l'état actuel du marché : la demande peut croître indéfiniment, mais si le prix au moment de l'arrivée d'une demande infinie ne couvre pas le coût de la dette émise pour construire les centres de données, les actions peuvent toujours chuter.
