同じモデルで、公式価格は20%しか下がっていないのに、あなたの請求額は8割減りました。

8月24日、OpenAIはAWSと共同で実施したテスト結果を発表しました:
Terminal-Bench 2.1上で、GPT-5.6 TerraがKiroで成功したタスクのコストは約82%低下しました。
Kiroは、IDE、CLI、WebをカバーするAWSのソフトウェア開発エージェントプラットフォームです。
GPT-5.6ファミリーのSol、Terra、Lunaの三兄弟は、すでに1ヶ月以上内部で走っています。
この82%は、公式な値下げではありません。
テラの最近の価格調整は7月30日に行われ、変動幅は20%でした。

7月30日、OpenAIが価格調整を発表、Terraが20%引き下げ。
単価は20%しか下がらないのに、請求額は8割も削減できます。
本当に注目すべきは、その60パーセントの差がどこから削減されたかである。
GPT-5.6がKiroに上場したのは今年7月のことです。
まず13日、AWSはGPT-5.6 Sol、Terra、LunaがAmazon Bedrockで正式に利用可能になったと発表しました。
翌日、Kiroはブログで、3つのモデルがIDE、CLI、Webにリリースされたことを発表しました。

これはOpenAIモデルが初めてKiroに導入されるタイミングであり、ちょうどKiroのパブリックプレビュー1周年と重なります。
まずモデルを棚に並べ、その後作業に駆り出す。一か月以上経って、OpenAIが宿題を持って戻ってきた:
両社がKiro環境とOpenAIモデルを共同で調整し、Terraが成功タスクを完了するコストが約82%削減されました。
節約した
遠回りするお金
7月30日の価格調整でTerraは20%下落しましたが、Kiroのテストでは単一タスクのコストが82%低下しました。
それでは、節約した6割はどこから来たのですか?
方向はこれだけです:
モデルが生成するトークンが減り、ツールの再呼び出し回数が減り、失敗後の再試行や遠回りが減りました。
したがって、節約されたこの大きな部分は、毎回の呼び出しにかかる費用ではなく、本来無駄になっていた呼び出しの費用です。
理由很简单:AIエージェントがタスクを1回失敗しても、請求はそのまま。途中で間違った道を選んで3ラウンドも迷い、その後戻ってきても、そのトークンはすべて請求される。
実際の開発では、お金はこうして漏れてしまうものです。
OpenAIは公式ブログでも同じ論理を指摘しており、効率は3層から生まれる:
リクエストを発信し、コンテキストを整理するエージェントフレームワーク、その中間でリクエストをオーケストレーションするシステム、最後にGPU上で実行されるモデル自体。

OpenAIがGPT-5.6の効率の源を分析:リクエストはエージェントフレームワークから始まり、オーケストレーションシステムによってスケジューリングされ、最終的にGPUでモデルが実行される。各層で削減が行われている。
モデルの役割分担まで節約できます。
OpenAIはもう一つの使用例を挙げています:コーディングワークフローでは、まずSolを使って問題を明確にし、計画を立て、その後Lunaに切り替えて、すでに明確に定義された変更を実施し、テストを書き、評価を実行します。
同じ生産ラインで、異なる工程に異なるレベルの知能を割り当てる。
モデルは請求書の半分しか占めていません
フレームを変えると価格も変わる
Terminal-Bench 2.1のこのセットは、モデルが単独で答案を解くためのものではありません。
それはモデルをターミナル環境に投入し、あいまいな目標を与えて、自ら経路を計画し、ツールを呼び出し、スクリプトを書き、エラーを処理し、繰り返しイテレーションさせる。
したがって、出た結果は「エージェント+モデル」の組み合わせの結果です。

Terminal-Bench 2.1の公開ランキングに、正確性の右側にコストの項目が追加されました。(画像提供:Terminal-Bench)
ランキングの4行の数字が最もよく物語っている:
Claude Code、Fable 5、83.8%、552.67ドル;
CodexにGPT-5.5を配布、83.1%、2059.19ドル;
CodexがGPT-5.6 Terraを配布、78.4%、421.15ドル;
CodexがGPT-5.6 Lunaを配布、75.7%、241.45ドル。
上位2行のスコアの差はわずか0.7パーセンテージポイントですが、請求額は約4倍異なります。
同じモデルでも、異なるフレームワークに組み込み、異なるコンテキスト構成とツール戦略を適用すれば、結果はまったく異なるものになる。
Kiro公式データによると、TerraはCoding Agent Indexで77.4点を獲得し、Claude Fable 5の77.2点をわずかに上回っています。
そのポイントはスコアではなく、そのスコアに対応する価格にあります。
キロの仕様中心のアプローチのポイントもここにあり、核心的な玩法はたった一文:最初からコードを書かないこと。
それはまず、ユーザーのあいまいな目標を、正式な要件文書、技術設計、実行可能なタスクリストに分解し、それからモデルに渡す。
これにより、モデルが受け取るのは曖昧な一文ではなく、明確に整理されたタスクになります。
Agentを知っている人は、このステップで省かれているのが最も高額なコストであることにすぐに気づくだろう。
モデルがずれたり、やり直しややり直しを繰り返したりすると、実際に作業するよりも多くのトークンが消費される。
キロはプロセスに二つのチェックポイントを設けました:コードを実際に変更する前に、一度立ち止まって誰かに確認してもらうこと、そして作業が完了した後に、自動でテストを実行して正しく動作しているかを検証することです。
この二つのゲートで阻止されるたびの再作業により、実際のお金が節約できます。
Claudeがアマゾンの地盤で
GPTが半分進んだ
一年前、Kiroは単に仕様中心のIDEであり、モデルセレクターはAnthropicの領域だった。
1年後、AWSは自社開発のエージェントプラットフォームに一気に3つのOpenAIモデルを導入した。
一年前、Sol、Terra、LunaがClaudeと同一のドロップダウンメニューに並ぶ光景を想像するのは難しかった。
GPT-5.6は今回は「全家入驻」ですが、「全面開放」されていません。
3つのモデルは、Pro、Pro+、Pro Max、Powerユーザー向けに段階的かつ実験的に公開され、リージョンは米国バージニア北部とヨーロッパのフランクフルトの2か所のみで、リージョン間推論をサポートしています。
また、多くのユーザーが慣れないもう一つの点があります。このモデルはKiro内で隠された思考チェーンを用いており、推論の手順は見えず、最終的な結果のみが表示されます。
Agentのステップごとの推論を観察することに慣れている人たちは、それを不透明な箱に投げ込むような気分になるだろう。
公式の説明では、これは想定内の動作であり、出力品質に影響しません。
Kiroでは、3段階のモデルが明確に価格表示されています。
7月14日に剛上線した頃、同じタスクで、Solは2.4倍、Terraは1.2倍、Lunaは0.6倍の控除でした。
7月30日にOpenAIのこの値下げが実施され、翌日Kiroが対応:Lunaは0.6倍から0.1倍まで引き下げ、Terraは1.2倍から1.0倍に引き下げ、Solのみ変更なし。

AWSの姿勢が明確に示された:開発プラットフォームは、1つのモデルにのみ縛られてはならない。
同じセレクター内で、2つの先進モデルが互いに価格を引き下げ始めています。
モデルの評価基準も変わった:得点が高くても必ずしも勝てるわけではなく、費用を抑えても勝てる。
開発者にとって、以前は「このモデルは100万トークンあたりいくらか」と聞いていたが、今は「このタスクを完了させるためにどれだけのコストがかかるか」と問うべきだ。
参考資料:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
本文は微信公衆アカウント「新智元」(ID:AI_era)より、著者:ASI启示録、編集:元宇
