機械臂長期以來被記錄為在抓取物品時令人煩躁地表現不佳。Anthropic 於 2026 年 9 月 1 日發布的 Claude Fable 5.1,剛剛在解決這一問題上取得了重大突破。
該模型在機器人抓取與放置任務中的成功率達 40%,較其前身 Claude Fable 5 的 5% 有顯著提升。
底層有什麼變化
Fable 5.1 專為長時程代理任務設計,此類任務需要模型在多個步驟中進行規劃、執行與恢復,而無需人類全程協助。程式碼管道、科學研究工作流程與複雜商業自動化是其目標應用場景。
基準數字反映了這一重點。在 Terminal-Bench-Science 上,Fable 5.1 的得分為 52.6%,而 Fable 5 則為 24.7%。OSWorld 2.0 嚴格完成率從 36.1% 提升至 41.7%。用於測試多步軟體自動化的 AutomationBench,得分從 17.1% 上升至 31.4%。
發佈後的客戶反饋重申了基準故事。企業用戶特別指出,對於運行數小時而非數分鐘的項目,該模型的可靠性有所提升,並以比先前版本更少的 token 完成這些任務。
定價的數學比看起來更有趣
Fable 5.1 的基準定價維持不變,為每百萬輸入代幣 $10,每百萬輸出代幣 $50,與前一版本相同。
快取讀取成本下降了 75%,降至每百萬個標記 $0.25。Anthropic 評估,快取減少可為典型工作負載帶來約 25% 的節省;對於更複雜的代理管道,節省幅度可達 45%。
該模型適用於 Pro、Max、Team 和 Enterprise 用戶,並可透過 API 及主要雲端市場存取。
為何機器人數字值得單獨討論
挑選與放置的改進是主要數據,但值得深入探討為何這一特定基準至關重要。挑選與放置是對現實世界接地能力的代指:AI 模型能否將抽象推理轉化為精確的現實世界機械指令?此任務涉及物體識別、空間推理、抓取規劃,以及在出現錯誤時的恢復能力。
5% 的成功率本質上是噪音。40% 的成功率尚未達到無人監督工業部署的標準,但已跨越技術可作為人類輔助層而非僅是新奇事物的門檻。
競爭性情境
獨立評估者在 Claude Fable 5.1 發布後不久,於智力指數上將其評定為高於或等同於先前的領先者。在 Terminal-Bench-Science、OSWorld 2.0 和 AutomationBench 上的改進模式表明,Anthropic 的目標客戶是運行複雜、多步驟、多小時工作流程的企業客戶,而非僅提出快速問題的消費者。
