Claude Fable 5.1 將機器人任務表現提升 8 倍

iconCryptoBriefing
分享
AI summary icon精華摘要
Anthropic 的 Claude Fable 5.1 於 2026 年 9 月 1 日推出,將機器人抓取與放置的性能提升了 8 倍,成功率從 5% 提升至 40%。鏈上數據顯示,在 Terminal-Bench-Science 和 OSWorld 2.0 等長周期任務中表現顯著提升。企業用戶報告複雜工作流程的可靠性提高,並實現了 45% 的成本節省。快取讀取成本下降了 75%,但價格未作調整。恐懼與貪婪指數趨勢顯示,市場對 AI 驅動的自動化工具興趣日益增長。

機械臂長期以來被記錄為在抓取物品時令人煩躁地表現不佳。Anthropic 於 2026 年 9 月 1 日發布的 Claude Fable 5.1,剛剛在解決這一問題上取得了重大突破。

該模型在機器人抓取與放置任務中的成功率達 40%,較其前身 Claude Fable 5 的 5% 有顯著提升。

底層有什麼變化

Fable 5.1 專為長時程代理任務設計,此類任務需要模型在多個步驟中進行規劃、執行與恢復,而無需人類全程協助。程式碼管道、科學研究工作流程與複雜商業自動化是其目標應用場景。

基準數字反映了這一重點。在 Terminal-Bench-Science 上,Fable 5.1 的得分為 52.6%,而 Fable 5 則為 24.7%。OSWorld 2.0 嚴格完成率從 36.1% 提升至 41.7%。用於測試多步軟體自動化的 AutomationBench,得分從 17.1% 上升至 31.4%。

廣告

發佈後的客戶反饋重申了基準故事。企業用戶特別指出,對於運行數小時而非數分鐘的項目,該模型的可靠性有所提升,並以比先前版本更少的 token 完成這些任務。

定價的數學比看起來更有趣

Fable 5.1 的基準定價維持不變,為每百萬輸入代幣 $10,每百萬輸出代幣 $50,與前一版本相同。

快取讀取成本下降了 75%,降至每百萬個標記 $0.25。Anthropic 評估,快取減少可為典型工作負載帶來約 25% 的節省;對於更複雜的代理管道,節省幅度可達 45%。

該模型適用於 Pro、Max、Team 和 Enterprise 用戶,並可透過 API 及主要雲端市場存取。

為何機器人數字值得單獨討論

挑選與放置的改進是主要數據,但值得深入探討為何這一特定基準至關重要。挑選與放置是對現實世界接地能力的代指:AI 模型能否將抽象推理轉化為精確的現實世界機械指令?此任務涉及物體識別、空間推理、抓取規劃,以及在出現錯誤時的恢復能力。

5% 的成功率本質上是噪音。40% 的成功率尚未達到無人監督工業部署的標準,但已跨越技術可作為人類輔助層而非僅是新奇事物的門檻。

競爭性情境

獨立評估者在 Claude Fable 5.1 發布後不久,於智力指數上將其評定為高於或等同於先前的領先者。在 Terminal-Bench-Science、OSWorld 2.0 和 AutomationBench 上的改進模式表明,Anthropic 的目標客戶是運行複雜、多步驟、多小時工作流程的企業客戶,而非僅提出快速問題的消費者。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露