
Luna d'entrée est en vente flash : le prix d'entrée par million de tokens passe de 1 $ à 0,2 $, et le prix de sortie de 6 $ à 1,2 $.
Converti en yuan chinois, le prix d'entrée passe d'environ 6,8 yuans à 1,35 yuans, et le prix de sortie passe d'environ 40,6 yuans à 8,1 yuans.
Terra, ciblé comme « principal moteur quotidien », a également baissé de 20 %, avec les prix d'entrée et de sortie fixés à 2 $ et 12 $ respectivement.
Converted to CNY, they are approximately RMB 13.5 and RMB 81.2.
Seul le modèle phare Sol conserve son prix d'origine, mais une fonction Fast mode a été introduite, offrant une vitesse jusqu'à 2,5 fois supérieure à celle du mode standard, sans augmentation de prix.

Après la réinitialisation massive de la consommation de Codex, une réduction de prix a été immédiatement mise en place — OpenAI, tu veux éliminer qui ?
Cette guerre des prix est directement devenue brûlante.
OpenAI déclare que la réduction de prix est due au fait que GPT-5.6 Sol s'est lui-même fait des économies.
GPT-5.6 Sol participe à son propre amélioration, entraînant une progression exponentielle de l'efficacité ; nous remercions nos utilisateurs anciens et nouveaux pour cela~
Ce truc de se soulever en piétinant le pied gauche avec le droit, OpenAI, tu t'y mets aussi

.
Deux réductions de prix, une accélération
Actuellement, les prix des API pour les trois modèles GPT-5.6 sont :
GPT-5.6 Luna : 0,2 $ pour l'entrée d'un million de tokens, 1,2 $ pour la sortie ;
GPT-5.6 Terra : 2 $ pour l'entrée d'un million de tokens, 12 $ pour la sortie ;
GPT-5.6 Sol : 5 $ pour l'entrée d'un million de tokens, 30 $ pour la sortie.

Après la baisse, Luna a connu un effondrement soudain.
Son prix d'entrée est déjà équivalent à celui de la génération précédente GPT-5.4 nano, et son prix de sortie est même 0,05 dollar moins cher.
Mais les deux modèles ne réalisent pas exactement les mêmes tâches ; GPT-5.4 nano est principalement conçu pour des tâches simples et fréquentes telles que la classification, l'extraction d'informations et le classement.
GPT-5.6 Luna est positionné par OpenAI comme un modèle destiné aux charges de travail sensibles au coût, capable d'appeler des outils, de traiter des contextes longs et d'exécuter des flux de travail en plusieurs étapes.
En bref, OpenAI vend les modèles qui soutiennent les agents au prix d'anciens petits modèles simples.
Terra est relativement modéré, en baisse de 20 %.
Sol conserve son prix d'origine, avec l'ajout du mode Fast, jusqu'à 2,5 fois plus rapide que le mode standard, à un prix deux fois supérieur, tout en conservant le même niveau d'intelligence du modèle.
Il remplacera également le traitement prioritaire précédent. Les demandes API utilisant précédemment le tag priority seront automatiquement basculées en mode rapide.
L'officiel a déclaré que ce ajustement entrera également dans Codex et ChatGPT Work.
Le prix d'abonnement ne sera pas réduit, et le quota total des utilisateurs n'augmentera pas, mais la consommation de quota lors de l'appel de Terra et Luna sera réduite en conséquence.
Le même abonnement permet au modèle d'effectuer plusieurs tâches.
OpenAI a également remplacé le modèle d'auto-évaluation dans ChatGPT et Codex CLI de GPT-5.4 par GPT-5.6 Luna.
Auto-review est chargé de vérifier en arrière-plan le code et les résultats des modifications, ce qui en fait une tâche d'agent à haute fréquence typique.
En combinant la mise à niveau du modèle et la baisse du prix de Luna, OpenAI prévoit que ses coûts tomberont à environ un dixième de l'ancien niveau.
Les modèles abordables ne se contentent plus de tâches traditionnelles telles que la classification ou l'extraction, mais commencent à intervenir dans des domaines nécessitant jugement et appel d'outils, comme la revue de code et la surveillance des systèmes backend.
Actuellement, les trois modèles sont positionnés comme suit :
Confiez les tâches sensibles au budget et à fort volume d'appels à Luna ;
Les tâches quotidiennes ordinaires sont confiées à Terra ;
Continuez à utiliser Sol pour les tâches à haut niveau de difficulté ;
Si même attendre vous semble trop lent, dépensez deux fois plus pour acheter de la vitesse.
GPT-5.6 commence à participer à la réduction de ses propres coûts
Pourquoi la baisse soudaine ?
OpenAI indique que la raison est que GPT-5.6 Sol a participé à l'optimisation de son propre système de production.
L'efficacité qu'il a améliorée s'est traduite par des chiffres réduits sur le tableau des prix.
Plus précisément, GPT-5.6 Sol a réécrit et optimisé certains noyaux GPU en production, conçu et exécuté des centaines d'expériences de génération de tokens, et participé à la surveillance de l'entraînement en intervenant en cas de problème.
Les résultats finaux sont également remarquables : l'optimisation du noyau GPU a réduit les coûts du service end-to-end de GPT-5.6 de 20 % ; l'amélioration de la décodage par conjecture a augmenté l'efficacité de génération de tokens de plus de 15 %.

Le GPU Kernel peut être compris comme le programme de base qui exécute les tâches de calcul spécifiques du modèle sur le GPU.
Le modèle lui-même ne change pas ; il suffit d'écrire ces programmes de manière plus efficace pour que la même GPU effectue plus rapidement les calculs, traite davantage de demandes et réduise le coût par appel.
La décodage par estimation consiste à générer en bloc des « hypothèses » sur les tokens suivants susceptibles d'apparaître, puis à les soumettre au modèle principal pour validation. Plus les hypothèses sont précises, moins il faut de étapes de génération et d'attente individuelles.
Aucune de ces deux optimisations n'a réduit les capacités du modèle, mais elles permettent au même modèle de fonctionner plus rapidement et à moindre coût.
Cependant, ce n'est pas encore une mise à jour autonome complète de GPT-5.6.
OpenAI a souligné que tout le processus reste dirigé par des humains.
Les modèles peuvent écrire du code, exécuter des expériences et surveiller les anomalies, mais la définition des objectifs, la pertinence des résultats et la mise en production du code nécessitent toujours une intervention humaine.
OMT
Enfin, il y a un autre nouveau changement.
Cette réduction cible un point précis : les flux de travail Agent.
Le Luna le plus fortement réduit n'est pas seulement un petit modèle traditionnel utilisé pour la classification et l'extraction.
Selon la position d'OpenAI, il peut appeler des outils et exécuter des tâches en plusieurs étapes, principalement destinées aux charges de travail à haute fréquence et sensibles aux coûts.
Ainsi, la baisse de 80 % de Luna réduit également le seuil d'entrée pour le fonctionnement à long terme de l'Agent.
Permettre aux tâches d’audit, de vérification et de surveillance, qui étaient auparavant trop coûteuses pour être exécutées fréquemment, de devenir des étapes régulières dans le flux de travail.
En combinant également GPT-5.6 pour optimiser son propre système de production, un nouveau cycle apparaît :
La participation du modèle améliore l'efficacité opérationnelle et réduit les coûts ; après la baisse des prix, le modèle est intégré à davantage de flux de travail à haute fréquence ; l'augmentation de l'échelle d'appel stimule ensuite une nouvelle vague d'optimisation de l'efficacité.
La roue de réduction des prix d'OpenAI est déjà en train de prendre forme.
Après toutes ces actions, la pression est maintenant sur l'entreprise A :
À toi de jouer.

Liens de référence : [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Cet article provient du compte WeChat « Quantum Bit », auteur : Suivre les technologies de pointe
