
エントリーモデルのLunaが大幅値下げ。100万トークンあたりの入力価格が1ドルから0.2ドルに、出力価格が6ドルから1.2ドルに引き下げられました。
人民元に換算すると、入力価格は約6.8元から1.35元に、出力価格は約40.6元から8.1元に低下します。
「日常干活主力」をターゲットとするTerraも20%値下げされ、入出力価格はそれぞれ2ドルと12ドルに引き下げられました。
中国元に換算すると、それぞれ約13.5元と81.2元です。
唯一のフラグシップモデルSolは価格を据え置きながら、Fastモードを導入。速度は標準モードの最大2.5倍に向上し、スピードアップしても価格は変わりません。

Codexの猛々しいリセット後、価格引き下げも即座に実施されたね、OpenAI、誰を圧倒しようとしてるの?…
この価格戦争は直接白熱化しています。
OpenAIは、価格引き下げがGPT-5.6 Solが自らコストを削減したためであると述べています。
GPT-5.6 Solが自身の改善に参加し、効率が飛躍的に向上したため、新規・既存ユーザーへ感謝を込めてお返しします~
左足で右足を踏んでその場で上昇する这套、OpenAIもやり始めたんだね

。
2つが値下げ、1つが加速
現在、GPT-5.6の3つのモデルのAPI料金は次の通りです:
GPT-5.6 Luna:入力100万トークンあたり0.2ドル、出力1.2ドル;
GPT-5.6 Terra:入力100万トークンあたり2ドル、出力12ドル;
GPT-5.6 Sol:入力100万トークンあたり5ドル、出力30ドル。

価格引き下げ後、Lunaは大幅な下落となった。
入力価格は前世代のGPT-5.4 nanoと同等となり、出力価格はさらに0.05ドル安くなっています。
ただし、この2つのモデルが担うタスクは完全には異なり、GPT-5.4 nanoは主に分類、情報抽出、ランキングなどのシンプルで高頻度のタスクに焦点を当てています。
GPT-5.6 Lunaは、OpenAIによってコスト感度の高いワークロード向けのモデルとして位置づけられており、ツールを呼び出し、長文コンテキストを処理し、複数ステップのワークフローを実行できます。
簡単に言えば、OpenAIはエージェントを動かすためのモデルを、かつてのシンプルな小規模モデルと同じ価格で販売しています。
テラは控えめで、20%値下がりしました。
Solは価格をそのままに、Fastモードを追加。速度は標準モードの最大2.5倍で、価格は標準モードの2倍ですが、モデルの知能レベルは変更ありません。
また、以前のPriority Processingを置き換えます。以前priorityタグを使用していたAPIリクエストは、自動的にFast modeに切り替わります。
公式によると、この調整はCodexとChatGPT Workにも適用されます。
サブスクリプション料金は引き下げられず、ユーザーの総クォータも増加しませんが、TerraおよびLunaを呼び出す際のクォータ消費量は相应して減少します。
同じサブスクリプション料で、モデルをより多くの回数動作させることができます。
OpenAIは、ChatGPTおよびCodex CLIの自動レビューモデルをGPT-5.4からGPT-5.6 Lunaに変更しました。
Auto-reviewはバックグラウンドでコードと変更結果をチェックする役割を担っており、典型的な高頻度Agentタスクです。
モデルのアップグレードとLunaの価格低下を組み合わせることで、OpenAIはそのコストを元の約1/10に削減すると予想しています。
安価なモデルは、分類や抽出といった従来の「雑務」にとどまらず、判断とツール呼び出しを要するコードレビューやバックエンド監視の分野にも進出しています。
現在、3つのモデルの位置づけは以下の通りです:
予算に敏感で、呼び出し量が大きいタスクはLunaに委託してください。
日常の業務はTerraに任せる;
高難度タスクは引き続きSolを使用してください;
待つのも遅いと感じるなら、速度を倍速で購入してください。
GPT-5.6が自らのコスト削減に参加開始
なぜ急に値下げしたのですか?
OpenAIは、GPT-5.6 Solが自社の生産システムの最適化に参加したことが原因であると表明しました。
それが向上させた効率は、価格表上の割引額として反映されました。
具体的には、GPT-5.6 Solは生産環境の一部のGPUカーネルを再書き込みし最適化し、数百回のトークン生成実験を設計して実行し、訓練の監視にも参加して問題が発生した際に対応しました。
最終的な成果も顕著です:GPU Kernelの最適化により、GPT-5.6のエンドツーエンドサービスコストを20%削減し、推測デコードを改善してToken生成効率を15%以上向上させました。

GPUカーネルは、モデルがGPU上で具体的な計算タスクを実行するための低レベルプログラムと理解できます。
モデル自体は変更しなくても、これらのプログラムをより効率的に書けば、同じGPUで計算がより速く完了し、より多くのリクエストを処理できるようになり、1回の呼び出しコストも低下します。
推測デコードでは、回答を生成する際に、次に現れる可能性のあるトークンを一括で「推測」し、それをメインモデルが検証します。推測の精度が高いほど、1つずつ生成して待つステップが減ります。
これらの2つの最適化は、モデルの能力を低下させることなく、同じモデルをより速く、より安価に動作させることができます。
しかし、これはGPT-5.6が自ら完全にアップグレードしたわけではありません。
OpenAIは、このプロセス全体が依然として人間によって主導されていることを明確に強調しています。
モデルはコードを書いたり、実験を実行したり、異常を監視したりできますが、目標をどう設定するか、結果が使えるかどうか、コードを本番環境に導入するかどうかは、依然として「Human in the Loop」が必要です。
OMT
最後に、もう一つの新しい変更があります。
今回の値下げには、Agentワークフローという具体的な対象があります。
最も大幅に割引されたLunaは、分類や抽出に使う従来の小型モデルではありません。
OpenAIの位置づけによると、ツールを呼び出し、複数ステップのタスクを実行でき、主に高頻度でコストに敏感なワークロードを対象としています。
したがって、Lunaが80%下落したことで、Agentの長期運用のハードルも低下しました。
かつてコストが高すぎて頻繁に実行できなかった監査、検証、モニタリングのタスクを、ワークフローの標準的なステップにすることが可能になります。
GPT-5.6を再結合して自らの生産システムを最適化すると、新しい循環が生まれた:
モデルの参加により運用効率が向上し、コストが低下する。価格が下がると、モデルがより多くの高頻度ワークフローに導入される。呼び出し規模が拡大し、さらに次の効率最適化を促進する。
OpenAIのこの価格引き下げの輪は、すでにその形を見せ始めている。
この一連の操作により、今や圧力は直接A社にかかっています:
あなたの番です。

参照リンク:[1]https://x.com/OpenAI/status/2082878156483219672[2]https://x.com/sama/status/2082880720989532597
本文は微信公衆アカウント「量子位」より、著者:先端テクノロジーに注目
