Anthropic 推出 Claude Sonnet 5.5,輸出速度提升 30% 並降低成本

iconMetaEra
分享
AI summary icon精華摘要
Anthropic 宣布推出 Claude Sonnet 5.5,這是一個專為高頻任務優化的新型代幣項目。該模型的輸出速度比 Sonnet 5 快 30%,且每項任務的成本最多降低 30%。鏈上資訊顯示,其在 Terminal-Bench 4.0 上取得 70.6% 的分數,表現優於 Sonnet 5 和 Opus 5.5。然而,在最大推理負載下,它會使用更多代幣,成本最高增加 50%。Anthropic 建議將 Sonnet 5.5 用於定義明確的任務,而複雜工作則由 Opus 處理。
Anthropic 發布 Claude Sonnet 5.5,試圖將接近旗艦 Opus 5.5 的能力壓縮至價格更低、適合高頻調用的日常 Agent 模型中。其 API 單價仍為每百萬輸入/輸出 Token 2 美元和 10 美元,但官方稱輸出速度提升 30% 以上,完成典型任務所需的 Token 數減少,使單項任務成本最多下降 30%。在官方測試中,它在 Terminal‑Bench 4.0 取得 70.6%,高於 Sonnet 5 的 10.3% 和 Opus 5.5 的 66.4%;職業任務 GDPval‑AA 也以 1844 Elo 接近 Opus 的 1846。不過,“半價 Opus”並非完整結論:Artificial Analysis 發現,Sonnet 5.5 在最高推理強度下平均每題生成約 19.3 萬輸出 Token,是其測過最耗 Token 的配置,單題成本反而比 Sonnet 5 高約 50%;CodeRabbit 的真實程式碼審查測試也顯示,Sonnet 5.5 雖然比上一代快約一倍,卻仍會漏掉 Opus 能夠發現的高難度問題。因此,它更像一款適合明確、可重複任務的新主力模型,而不是對 Opus 的全面替代。

文章作者、來源:Anthropic

Anthropic 將 Sonnet 重新定位為日常 Agent 主力

Sonnet 5.5 是 Claude 5.5 系列的第二款模型。與一周前發布、面向複雜開放式任務的 Opus 5.5 不同,Anthropic 將它定位為處理邊界清晰、需要大量重複運行的日常工作:修復程式錯誤、審查程式碼、調查資料,以及生成文件、簡報和電子表格。

模型支援文字與圖像輸入,提供100萬Token上下文,可在Claude網頁和移動端、Anthropic API、AWS、Google Cloud及Microsoft Azure中使用。API名稱為claude-sonnet-5-5。Anthropic未公佈參數量、模型架構、訓練資料和訓練算力,因此無法判斷提升具體來自基礎訓練、後訓練、推理策略還是Agent工具鏈優化。

它與 Opus 之間的區別並不只是「能力較弱、價格較便宜」。Anthropic 希望形成新的模型分工:Opus 負責問題定義不完整、需要持續判斷的複雜任務;Sonnet 則快速執行已明確的工作,並以較低成本擴大調用次數。

70.6% 對 10.3%,是最醒目也最需要謹慎理解的數據

Sonnet 5.5 在 Anthropic 公布的 Terminal‑Bench 4.0 測試中取得 70.6%,而 Sonnet 5 僅有 10.3%,甚至高於 Opus 5.5 的 66.4%。該基準要求 Agent 在命令列環境中完成多步驟專業任務,能反映程式編寫、終端操作與工具使用之間的協同配合。

其他項目的提升雖未如此誇張,但仍然明顯。CursorBench 4.0 從 Sonnet 5 的 34.1% 升至 55.5%,距離 Opus 5.5 的 57.8% 僅差約兩個百分點;帶工具的 Humanity’s Last Exam 從 54.9% 提高到 64.5%;OSWorld 2.1 電腦操作從 57.0% 升至 80.1%,接近 Opus 的 81.8%。

在職業知識任務 GDPval‑AA 中,Sonnet 5.5 獲得 1844 Elo,Opus 5.5 為 1846;在長時間知識工作評測 AA‑Briefcase 中,兩者分別為 1811 和 1822。Anthropic 因此認為,部分邊界明確的專業工作已經不必默認調用旗艦模型。

不過,這些數字不能簡單合併成「Sonnet 已經超過 Opus」。不同項目使用的推理強度並不完全相同,而且 Anthropic 明確表示,在需要長期維持判斷、處理開放式目標的任務中,Opus 仍然明顯更強。

一個有趣的反例來自 FrontierCode。Sonnet 5.5 在 Xhigh 推理強度下取得 52.1%,提升至 Max 後反而降至 46.2%。Anthropic 解釋說,模型在 Max 模式中更頻繁地啟動多個程式碼審查子 Agent,有兩次因此超時或修改了任務範圍之外的程式碼,最終被評測判為失敗。

這個結果說明,更多的推理和更多的 Agent 並不必然帶來更好的答案。模型可能因為檢查過度、擴大任務範圍或消耗完時間預算而失分。

每 Token 沒有降價,為何官方稱任務成本低 30%?

Sonnet 5.5 的公開價格與 Sonnet 5 相同:每百萬輸入 Token 2 美元、輸出 Token 10 美元、快取寫入 2.5 美元、快取讀取 0.2 美元,分別為 Opus 5.5 對應價格的一半。

Anthropic 所謂「單項任務最多便宜 30%」,並非 API 價目表下调,而是模型完成同一工作時所需的步驟和 Token 更少。官方稱其生成速度提高 30% 以上;Slack 在內部測試中觀察到輸出 Token 減少約 14%,Atlassian 称 Agent 速度最多提高 30%,Lovable 則報告工具調用減少約三分之一、Shell 運行次數約減半。

當一家資產管理公司在2,441項金融問答、抽取、分析和預測任務上進行測試時,Sonnet 5.5平均每項使用約12.1萬Token,而Sonnet 5則為49.7萬。由於這些都是合作夥伴的私有測試,外界無法檢查任務難度、提示詞和完整輸出,但結果共同指向一個變化:新模型較少反覆搜尋、重複讀取資料或進行過長的內部推理。

這對 Agent 尤其重要。在傳統聊天中,一次輸出數百個 Token 的影響有限;但長期 Agent 會重複讀取上下文、調用工具和修正結果,一步的冗餘可能在數十輪後放大成顯著的時間與費用差異。

最高推理強度揭示了另一種成本真相

Artificial Analysis 的獨立測試給 Sonnet 5.5 的最高推理配置打出 56 分,在其綜合智能指數中僅落後 Opus 5.5 的 58 分。

但達到這一成績的代價很高:Sonnet 5.5 平均每項測試生成約 19.3 萬輸出 Token,是該機構測量過的最高水平,比 Opus 5.5 Max 和 Sonnet 5 Max 高約 60%,約為 GPT‑6 Astra Max 的七倍。其估算單題成本達到 7.60 美元,比 Sonnet 5 高約 50%。

這與Anthropic「任務成本最多下降30%」並不直接矛盾。官方結論主要描述典型工作負載和較低推理強度;Artificial Analysis測量的是為了追求能力上限而開啟Max的情況。

兩組結果共同說明,推理強度已成為模型產品的一部分。Sonnet 5.5 在 Low 或 Medium 模式下可能提供極高的性價比;如果為了追趕 Opus 而把推理強度推到 Max,它雖然每 Token 更便宜,卻可能因為生成數量過多而失去成本優勢。

Artificial Analysis 還發現,Sonnet 5.5 的事實知識準確率約為 54%,低於 Opus 的 66%;科學推理項目也落後約六個百分點。所謂「接近 Opus」主要成立於 Agent 終端操作和部分知識工作,不能外推到所有能力。

在真實代碼審查中,速度優勢成立,旗艦差距也仍然存在

CodeRabbit 使用真實開源項目中的已知錯誤進行了一組發布日測試。

在13個較難的程式碼審查案例中,開啟推理的Sonnet 5.5找出6個問題,高於Sonnet 5的4個;兩者有效評論精度分別為41.2%和40.0%。但Opus 5.5標準模式找出8個,Max模式找出10個,說明複雜審查任務中的差距仍然明顯。

在另一組涉及44個真實Pull Request的測試中,Sonnet 5.5平均每次審查需要6分33秒,Sonnet 5則為13分31秒。前者生成的評論少24%,瑣碎意見只有上一代的約三分之一;按公開價格計算,核心模型調用平均約0.46美元,而Sonnet 5約為1.16美元。

不過,這組 44 個 PR 的完整錯誤覆蓋評分在文章發布時尚未完成,因此目前只能確認它更快、輸出更少,不能確認少寫的評論是否遺漏了更多真實問題。13 個高難案例的樣本也很小,CodeRabbit 自己提醒,足以觀察方向,卻不足以確定普遍排名。

更合理的模型分工是:Sonnet 5.5 負責對每一個 PR 進行快速常規審查;涉及安全、核心架構或漏掉錯誤代價很高的變更,再升級給 Opus 或人類專家。

視覺設計開始成為通用工作模型的賣點

Anthropic 也特別強調了 Sonnet 5.5 的視覺設計能力。官方示範讓 Sonnet 5 和 5.5 分別在單個 HTML 檔案中製作 400 只椋鳥群飛、風塑沙丘和由 24 個小鐘組成的大鐘。新模型的生成速度更快,動畫、層次和介面完成度也更高。

它還能根據模板生成簡報。Anthropic 在一項內部測試中提供了一家上市公司的季度業績資料、電話會議文字稿和十頁簡報模板,兩名專家認為 Sonnet 5.5 的第一版可直接發送。

這些依然屬於廠商選擇的展示案例,不能代表模型能夠穩定理解每套企業模板。複雜圖表的數據準確性、品牌規範和引用來源仍需人工檢查,但它反映了模型競爭的新方向:不只生成正確內容,還要盡量交付接近成品的介面和文檔。

安全能力提升,也意味著部分請求會被舊模型接管

Sonnet 5.5 是首款在發布時採用旗艦級網路安全防護的 Sonnet 模型。Anthropic 表示,其網路安全能力已接近 Opus 5,因此一般漏洞修復仍可正常進行,但更高風險的網路安全請求將被透明地轉交給 Sonnet 5。

公司還在約1850種情境中測試誤導用戶、違背用戶利益、協助高風險濫用和突破環境邊界等行為。官方稱,新模型在多數指標上持平或優於Sonnet 5,並且是所有Claude模型中最少主動試探容器邊界的一個。

不過,這些主要是 Anthropic 的內部自動化評測,不能視為對現實環境風險的完整證明。公司自己也承認,沒有任何一組測試能夠發現全部失敗模式。

Sonnet 5.5 是首款加入反蒸餾分類器的 Sonnet,並擴大了「保留思考內容」機制,以防止不同帳戶之間轉移推理上下文。對普通開發者影響有限,但部分跨帳戶遷移 Claude Code 對話的工作流程需要調整。

真正的變化不是第 1 名,而是「夠強的模型」開始成為預設選擇

Sonnet 5.5 沒有公開新的模型架構,也沒有全面超越 Opus。它更重要的意義,在於將過去需要旗艦模型處理的大量工作,移至更快、單位 Token 價格減半的中檔模型上。

對於每天運行數千次的客服、程式碼審查、資料調查和文件生產系統,決定能否部署的通常不是單項最高分,而是每項任務需要多少步驟、多少 Token、等待多久,以及錯誤是否能夠被升級處理。Sonnet 5.5 的價值恰好集中在這些指標上。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。