同一個模型,官方價格僅降了 20%,但你的帳單卻減少了八成。

8月24日,OpenAI 公布了一項與 AWS 一起做的測試結果:
On Terminal-Bench 2.1, the cost of completing a successful task with GPT-5.6 Terra in Kiro has decreased by approximately 82%.
Kiro 是 AWS 的軟體開發智能體平台,涵蓋 IDE、CLI 和 Web。
GPT-5.6 家族的 Sol、Terra、Luna 三兄弟,已在裡面跑了一個多月。
這 82% 並非官方降價。
Terra 最近一次調價是在 7 月 30 日,幅度 20%。

7月30日 OpenAI 調價公告,Terra 下調 20%。
單價僅降20%,帳單卻能減少八成。
真正值得我們關注的是,中間那六十個百分點是從哪裡省出來的。
GPT-5.6 登陸 Kiro 是今年 7 月的事兒。
先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。
第二天,Kiro 發佈部落格,宣布三款模型上線 IDE、CLI 和 Web。

這是 OpenAI 模型首次進入 Kiro,正好趕上 Kiro 公開預覽一週年。
先把模型上架,再拉去幹活,一個多月後,OpenAI 回來交作業:
兩家合作對 Kiro 環境和 OpenAI 模型進行了調優,Terra 完成一項成功任務的成本降低了約 82%。
省下的
是走彎路的錢
在7月30日的調整中,Terra下降了20%,但在Kiro的測試中,單任務成本下降了82%。
那多省下的六成,是從哪兒來的?
方向就這麼幾個:
模型輸出的 token 更少了,工具調用的次數更少了,失敗後的重試和繞路也更少了。
因此,節省的這一大筆費用並非每次調用的費用,而是那些原本會浪費的調用費用。
道理很簡單:一個 AI 智能體把任務做砸一次,帳單照記。它中途選錯路徑、跑偏三輪再回頭,這些 token 也照收。
在真實開發中,錢往往就是這樣流失的。
OpenAI 在官方部落格中也提過同樣的邏輯,效率來自三層:
發起請求、組織上下文的智能體框架,中間調度請求的編排系統,最後才是 GPU 上運行的模型本身。

OpenAI 拆解 GPT-5.6 的效率來源:請求從智能體框架出發,經編排系統調度,最後到 GPU 跑模型,每一層都在省。
省錢還能省到模型分工上。
OpenAI 也舉過一個用法:編碼工作流可以先用 Sol 把問題想清楚、把計劃定下來,再換 Luna 去實施那些已經定義清楚的變更、寫測試、跑評估。
同一條流水線,不同環節配不同檔位的智能。
模型僅佔賬單的一半
換個框架就換個價
Terminal-Bench 2.1 這套題,不是讓模型單獨答卷。
它將模型放入一個終端環境,給予一個模糊目標,讓模型自行規劃路徑、調用工具、撰寫腳本、處理錯誤並反覆迭代。
因此,所呈現的成績是「智能體+模型」這個組合的成績。

Terminal-Bench 2.1 公開榜單,準確率右邊多了一項成本。(圖源:Terminal-Bench)
榜單裡的四行數字最能說明問題:
Claude Code 配 Fable 5,83.8%,552.67 美元;
Codex 配 GPT-5.5,83.1%,2059.19 美元;
Codex 配 GPT-5.6 Terra,78.4%,421.15 美元;
Codex 配 GPT-5.6 Luna,75.7%,241.45 美元。
前兩行分數僅相差 0.7 個百分點,帳單卻相差近 4 倍。
同一個模型,裝進不同的框架,搭配不同的上下文組織和工具策略,跑出來的結果根本完全不同。
根據 Kiro 官方提供的數據,Terra 在 Coding Agent Index 上獲得 77.4 分,僅略高於 Claude Fable 5 的 77.2 分。
它的賣點不在於分數,而在於這個分數所對應的價格。
Kiro 那套以規格為導向的著力點也在這裡,核心玩法就一句:不許一上來就寫代碼。
它先將用戶那句模糊的目標,拆解成正式的需求文件、技術設計和可執行任務清單,再交給模型。
這樣,模型拿到的不再是模糊不清的一句話,而是一份清晰明瞭的任務。
熟悉 Agent 的人會立刻反應過來,這一步省去的正是最昂貴的那部分開銷。
模型跑偏、返工、推倒重來,燒掉的 token 往往比正經幹活還多。
Kiro 還在流程中設置了兩道閘門:在代碼真正修改前,先停下來讓人審閱;完成工作後,再自動運行一輪測試以驗證是否正確。
每一次因這兩道閘門而避免的返工,都能節省真金白銀。
Claude 在亞馬遜的地盤
GPT 分走了一半
一年前,Kiro 還只是一個 spec-driven 的 IDE,模型選擇器是 Anthropic 的主場。
One year later, AWS introduced three OpenAI models on its in-house agent platform.
Sol、Terra、Luna 與 Claude 並列於同一個下拉菜單中,這畫面放在一年前很難想像。
Although GPT-5.6 is now “fully onboarded,” it has not been “fully opened.”
三款模型以漸進式、實驗性方式開放,面向 Pro、Pro+、Pro Max 和 Power 用戶,區域僅有兩個:美國維吉尼亞北部和歐洲法蘭克福,支援跨區域推理。
還有一條很多人不適應的:這批模型在 Kiro 裡走的是隱藏思維鏈,你看不到它的推理步驟,只看得到最終結果。
習慣了盯著 Agent 一步步推理的人,會覺得像把任務扔進了一個不透明的盒子。
官方表示,這是預期行為,不影響輸出品質。
Three-tier model is clearly priced in Kiro.
7月14日剛上線時,同樣的任務,Sol 扣 2.4 倍,Terra 扣 1.2 倍,Luna 扣 0.6 倍。
7月30日,OpenAI 那輪降價落地,第二天 Kiro 跟進:Luna 從 0.6 倍一路砍到 0.1 倍,Terra 從 1.2 倍降到 1.0 倍,只有 Sol 未動。

AWS 的態度已明確表明:一個開發平台不能只綁定一家模型。
在同一個選擇器中,兩家前沿模型開始互相壓價。
模型的評價標準也隨之改變:分數高不再默认能贏,花錢少同樣能贏。
對於開發者來說,過去選模型時問的是「這個模型每百萬 token 要多少錢」,現在得問「讓它完成這件事,我到底要花多少」。
參考資料:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
本文來自微信公眾號「新智元」(ID:AI_era),作者:ASI 啟示錄,編輯:元宇
