GPT-5.6 在 AWS Kiro 上將任務成本降低 82%,儘管價格下調 20%

icon MarsBit
分享
AI summary icon精華摘要
儘管7月30日價格下跌了20%,GPT-5.6 Terra 在 AWS Kiro 上仍將任務成本降低了82%。效率提升來自於失敗嘗試減少和代幣使用量降低。GPT-5.6 模型——Sol、Terra 和 Luna——於7月在 Kiro 上線。AWS 與 OpenAI 共同優化了該環境。由於加密貨幣價格仍處於波動狀態,恐懼與貪婪指數顯示出混合信號。

同一個模型,官方價格僅降了 20%,但你的帳單卻減少了八成。

Kiro

8月24日,OpenAI 公布了一項與 AWS 一起做的測試結果:

On Terminal-Bench 2.1, the cost of completing a successful task with GPT-5.6 Terra in Kiro has decreased by approximately 82%.

Kiro 是 AWS 的軟體開發智能體平台,涵蓋 IDE、CLI 和 Web。

GPT-5.6 家族的 Sol、Terra、Luna 三兄弟,已在裡面跑了一個多月。

這 82% 並非官方降價。

Terra 最近一次調價是在 7 月 30 日,幅度 20%。

Kiro

7月30日 OpenAI 調價公告,Terra 下調 20%。

單價僅降20%,帳單卻能減少八成。

真正值得我們關注的是,中間那六十個百分點是從哪裡省出來的。

GPT-5.6 登陸 Kiro 是今年 7 月的事兒。

先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。

第二天,Kiro 發佈部落格,宣布三款模型上線 IDE、CLI 和 Web。

Kiro

這是 OpenAI 模型首次進入 Kiro,正好趕上 Kiro 公開預覽一週年。

先把模型上架,再拉去幹活,一個多月後,OpenAI 回來交作業:

兩家合作對 Kiro 環境和 OpenAI 模型進行了調優,Terra 完成一項成功任務的成本降低了約 82%。

省下的

是走彎路的錢

在7月30日的調整中,Terra下降了20%,但在Kiro的測試中,單任務成本下降了82%。

那多省下的六成,是從哪兒來的?

方向就這麼幾個:

模型輸出的 token 更少了,工具調用的次數更少了,失敗後的重試和繞路也更少了。

因此,節省的這一大筆費用並非每次調用的費用,而是那些原本會浪費的調用費用。

道理很簡單:一個 AI 智能體把任務做砸一次,帳單照記。它中途選錯路徑、跑偏三輪再回頭,這些 token 也照收。

在真實開發中,錢往往就是這樣流失的。

OpenAI 在官方部落格中也提過同樣的邏輯,效率來自三層:

發起請求、組織上下文的智能體框架,中間調度請求的編排系統,最後才是 GPU 上運行的模型本身。

Kiro

OpenAI 拆解 GPT-5.6 的效率來源:請求從智能體框架出發,經編排系統調度,最後到 GPU 跑模型,每一層都在省。

省錢還能省到模型分工上。

OpenAI 也舉過一個用法:編碼工作流可以先用 Sol 把問題想清楚、把計劃定下來,再換 Luna 去實施那些已經定義清楚的變更、寫測試、跑評估。

同一條流水線,不同環節配不同檔位的智能。

模型僅佔賬單的一半

換個框架就換個價

Terminal-Bench 2.1 這套題,不是讓模型單獨答卷。

它將模型放入一個終端環境,給予一個模糊目標,讓模型自行規劃路徑、調用工具、撰寫腳本、處理錯誤並反覆迭代。

因此,所呈現的成績是「智能體+模型」這個組合的成績。

Kiro

Terminal-Bench 2.1 公開榜單,準確率右邊多了一項成本。(圖源:Terminal-Bench)

榜單裡的四行數字最能說明問題:

Claude Code 配 Fable 5,83.8%,552.67 美元;

Codex 配 GPT-5.5,83.1%,2059.19 美元;

Codex 配 GPT-5.6 Terra,78.4%,421.15 美元;

Codex 配 GPT-5.6 Luna,75.7%,241.45 美元。

前兩行分數僅相差 0.7 個百分點,帳單卻相差近 4 倍。

同一個模型,裝進不同的框架,搭配不同的上下文組織和工具策略,跑出來的結果根本完全不同。

根據 Kiro 官方提供的數據,Terra 在 Coding Agent Index 上獲得 77.4 分,僅略高於 Claude Fable 5 的 77.2 分。

它的賣點不在於分數,而在於這個分數所對應的價格。

Kiro 那套以規格為導向的著力點也在這裡,核心玩法就一句:不許一上來就寫代碼。

它先將用戶那句模糊的目標,拆解成正式的需求文件、技術設計和可執行任務清單,再交給模型。

這樣,模型拿到的不再是模糊不清的一句話,而是一份清晰明瞭的任務。

熟悉 Agent 的人會立刻反應過來,這一步省去的正是最昂貴的那部分開銷。

模型跑偏、返工、推倒重來,燒掉的 token 往往比正經幹活還多。

Kiro 還在流程中設置了兩道閘門:在代碼真正修改前,先停下來讓人審閱;完成工作後,再自動運行一輪測試以驗證是否正確。

每一次因這兩道閘門而避免的返工,都能節省真金白銀。

Claude 在亞馬遜的地盤

GPT 分走了一半

一年前,Kiro 還只是一個 spec-driven 的 IDE,模型選擇器是 Anthropic 的主場。

One year later, AWS introduced three OpenAI models on its in-house agent platform.

Sol、Terra、Luna 與 Claude 並列於同一個下拉菜單中,這畫面放在一年前很難想像。

Although GPT-5.6 is now “fully onboarded,” it has not been “fully opened.”

三款模型以漸進式、實驗性方式開放,面向 Pro、Pro+、Pro Max 和 Power 用戶,區域僅有兩個:美國維吉尼亞北部和歐洲法蘭克福,支援跨區域推理。

還有一條很多人不適應的:這批模型在 Kiro 裡走的是隱藏思維鏈,你看不到它的推理步驟,只看得到最終結果。

習慣了盯著 Agent 一步步推理的人,會覺得像把任務扔進了一個不透明的盒子。

官方表示,這是預期行為,不影響輸出品質。

Three-tier model is clearly priced in Kiro.

7月14日剛上線時,同樣的任務,Sol 扣 2.4 倍,Terra 扣 1.2 倍,Luna 扣 0.6 倍。

7月30日,OpenAI 那輪降價落地,第二天 Kiro 跟進:Luna 從 0.6 倍一路砍到 0.1 倍,Terra 從 1.2 倍降到 1.0 倍,只有 Sol 未動。

Kiro

AWS 的態度已明確表明:一個開發平台不能只綁定一家模型。

在同一個選擇器中,兩家前沿模型開始互相壓價。

模型的評價標準也隨之改變:分數高不再默认能贏,花錢少同樣能贏。

對於開發者來說,過去選模型時問的是「這個模型每百萬 token 要多少錢」,現在得問「讓它完成這件事,我到底要花多少」。

參考資料:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

本文來自微信公眾號「新智元」(ID:AI_era),作者:ASI 啟示錄,編輯:元宇

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露