Même modèle, le prix officiel n'a baissé que de 20 %, mais votre facture a diminué de 80 %.

Le 24 août, OpenAI a publié les résultats d'un test effectué avec AWS :
Sur Terminal-Bench 2.1, le coût pour accomplir une tâche réussie par GPT-5.6 Terra dans Kiro a diminué d’environ 82 %.
Kiro est la plateforme d'agents de développement logiciel d'AWS, couvrant l'IDE, la CLI et le Web.
Les trois frères Sol, Terra et Luna de la famille GPT-5.6 ont déjà couru pendant plus d'un mois.
Ces 82 % ne constituent pas une réduction officielle.
The last adjustment for Terra was on July 30, at 20%.

Annonce de réajustement de prix d'OpenAI le 30 juillet, Terra baisse de 20 %.
Le prix unitaire diminue de seulement 20 %, mais la facture peut être réduite de 80 %.
Les soixante pour cent d'écart au milieu proviennent de où l'on a économisé, et c'est cela qui mérite vraiment notre attention.
GPT-5.6 a été lancé sur Kiro en juillet de cette année.
D'abord le 13, AWS a annoncé que GPT-5.6 Sol, Terra et Luna sont désormais disponibles sur Amazon Bedrock.
Le lendemain, Kiro a publié un blog annonçant le déploiement de trois modèles sur IDE, CLI et Web.

C'est la première fois que le modèle OpenAI entre dans Kiro, juste à l'occasion du premier anniversaire de la préversion publique de Kiro.
D'abord mettre le modèle sur l'étagère, puis l'envoyer travailler ; plus d'un mois plus tard, OpenAI revient avec son devoir :
Les deux entreprises ont ajusté ensemble l'environnement Kiro et les modèles OpenAI, réduisant le coût d'accomplissement d'une tâche réussie par Terra d'environ 82 %.
Économisé
De l'argent gaspillé
Lors du réajustement du 30 juillet, Terra a baissé de 20 %, mais dans les tests de Kiro, le coût par tâche a diminué de 82 %.
Où viennent les 60 % d'économies supplémentaires ?
Les directions sont limitées à celles-ci :
Le modèle génère moins de tokens, les outils effectuent moins d'appels répétés, et les retries ainsi que les chemins détournés après échec sont réduits.
Ainsi, l'économie réalisée ne concerne pas chaque appel, mais les appels qui auraient été gaspillés.
C'est simple : un agent IA qui échoue une fois dans une tâche se voit quand même facturer. Même s'il choisit une mauvaise voie au milieu du parcours et s'écarte pendant trois tours avant de revenir en arrière, ces tokens sont toujours facturés.
Dans le développement réel, l'argent s'échappe souvent ainsi.
OpenAI a également souligné la même logique sur son blog officiel : l'efficacité provient de trois niveaux :
Cadre d'agent pour l'initiation des requêtes et l'organisation du contexte, système d'orchestration intermédiaire pour la gestion des requêtes, et enfin le modèle lui-même s'exécutant sur le GPU.

OpenAI décompose les sources d'efficacité de GPT-5.6 : les requêtes partent du cadre d'agents, sont orchestrées par un système de planification, puis exécutées sur GPU, chaque couche optimisant les ressources.
Économisez de l'argent jusqu'à la répartition des tâches du modèle.
OpenAI a également mentionné une utilisation : le flux de codage peut d'abord utiliser Sol pour clarifier le problème et établir un plan, puis passer à Luna pour mettre en œuvre les modifications déjà définies, écrire des tests et exécuter des évaluations.
Même chaîne de production, avec des niveaux d'intelligence différents pour chaque étape.
Le modèle ne représente que la moitié de la facture.
Changer de cadre change le prix
Ce jeu de questions Terminal-Bench 2.1 n'est pas conçu pour que le modèle réponde seul.
Il place le modèle dans un environnement de terminal, lui donne un objectif flou, et le laisse planifier lui-même son chemin, appeler des outils, écrire des scripts, gérer les erreurs et itérer répétitivement.
Ainsi, les résultats obtenus sont ceux du couple « agent + modèle ».

Classement public de Terminal-Bench 2.1, un coût supplémentaire apparaît à droite de la précision. (Source : Terminal-Bench)
Les quatre lignes de chiffres dans le classement le mieux illustrent la situation :
Claude Code avec Fable 5, 83,8 %, 552,67 $ ;
Codex avec GPT-5.5, 83,1 %, 2059,19 $ ;
Codex paired with GPT-5.6 Terra, 78.4%, $421.15;
Codex with GPT-5.6 Luna, 75.7%, $241.45.
Les deux premières lignes ne diffèrent que de 0,7 point de pourcentage, mais les factures diffèrent d'environ quatre fois.
Le même modèle, intégré dans des cadres différents, avec des organisations de contexte et des stratégies d'outils variées, donne des résultats complètement différents.
Selon les données fournies par Kiro, Terra obtient 77,4 points sur l'indice Coding Agent, légèrement au-dessus des 77,2 de Claude Fable 5.
Son atout ne réside pas dans le score, mais dans le prix correspondant à ce score.
Le point d'ancrage de la méthode de Kiro, axée sur les spécifications, se trouve ici : la règle fondamentale est simple : ne pas commencer par écrire du code.
Il décompose d'abord l'objectif flou de l'utilisateur en un document de spécifications formel, une conception technique et une liste de tâches exécutables, puis le transmet au modèle.
Ainsi, au lieu d’une phrase vague, le modèle reçoit une tâche clairement définie.
Les personnes familiarisées avec Agent comprendront immédiatement que cette étape élimine la partie la plus coûteuse des dépenses.
Les modèles dérivaient, devaient être révisés, ou entièrement refaits ; les token gaspillés étaient souvent plus nombreux que ceux utilisés pour un travail sérieux.
Kiro a laissé deux barrières dans le processus : s'arrêter pour faire relire le code avant toute modification réelle ; et lancer automatiquement une série de tests après avoir terminé le travail pour vérifier la validité.
Chaque révision bloquée par ces deux barrières permet d'économiser de l'argent réel.
Claude sur le terrain d'Amazon
GPT a pris la moitié
Il y a un an, Kiro n'était qu'un IDE orienté spécifications, et le sélecteur de modèles était le domaine d'Anthropic.
Un an plus tard, AWS a intégré trois modèles OpenAI sur sa propre plateforme d'agents.
Voir Sol, Terra, Luna et Claude affichés côte à côte dans un même menu déroulant serait difficile à imaginer il y a un an.
Bien que GPT-5.6 soit « entièrement installé » cette fois-ci, il n'est pas « entièrement ouvert ».
Les trois modèles sont ouverts de manière progressive et expérimentale aux utilisateurs Pro, Pro+, Pro Max et Power, avec seulement deux régions : le nord de la Virginie aux États-Unis et Francfort en Europe, avec prise en charge de l'inférence interrégionale.
Il y a aussi une autre chose que beaucoup de gens trouvent déroutante : ces modèles utilisent une chaîne de pensée cachée dans Kiro ; vous ne voyez pas les étapes de raisonnement, seulement le résultat final.
Ceux qui sont habitués à suivre les étapes de raisonnement de l'agent trouvent cela comme jeter une tâche dans une boîte opaque.
Selon l'official, il s'agit d'un comportement attendu qui n'affecte pas la qualité de la sortie.
Les trois modèles sont clairement affichés dans Kiro.
Au moment de son lancement le 14 juillet, pour la même tâche, Sol était déduit de 2,4 fois, Terra de 1,2 fois et Luna de 0,6 fois.
Le 30 juillet, après la baisse d'OpenAI, Kiro a suivi le lendemain : Luna a été réduit de 0,6 fois à 0,1 fois, Terra est passé de 1,2 fois à 1,0 fois, tandis que Sol n'a pas été modifié.

La position d'AWS est claire : une plateforme de développement ne peut pas être liée à un seul modèle.
Dans le même sélecteur, deux modèles de pointe commencent à se faire concurrence sur les prix.
Les critères d'évaluation du modèle ont également changé : un score élevé ne garantit plus automatiquement la victoire, et dépenser moins peut également mener à la victoire.
Pour les développeurs, on se demandait auparavant : « Combien coûte ce modèle pour un million de tokens ? » ; maintenant, il faut se demander : « Combien vais-je dépenser pour lui faire accomplir cette tâche ? »
Références :
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
Cet article provient du compte WeChat « Nouvelle Intelligence » (ID : AI_era), auteur : ASI Révélation, éditeur : Yuan Yu
