source avatarDr.R

分享

今天,Anthropic 發布了最新版 Claude Fable 5.1 / Mythos 5.1(同一模型,防護級別不同),屬於中期小幅更新,性能提升有限,對我們而言主要在於:穩定性提升與價格下調。官方更新如下: 1. 科研類 agentic 能力提升最大 Terminal-Bench-Science 從 Fable 5 的 24.7% 提升至 52.6%,幾乎翻倍,且遠超 Opus 5 的 29.0%。 2. 編碼與長時間無人值守任務 Terminal-Bench 4.0 從 42.0% 提升至 55.8%(Mythos 5.1 為 60.9%),CursorBench 3.2.0 達到 73.4%。Millennium 使用它定位了團隊四五年未發現、其他模型皆遺漏的百萬分之一機率崩潰。 3. 價格下降約 25% 快取讀取(cache read)價格下調 75%,變為 $0.25/百萬 token;典型負載整體成本降低約 25%,重度 agentic 場景最多降低約 45%。輸入 $10、輸出 $50 /百萬 token 價格保持不變。 4. 低 effort 亦足夠使用 設為 Low/Medium 時效果已接近或超越 Fable 5,但成本低得多——對成本敏感的場景可直接降級。 5. 安全防護誤殺大幅減少 Claude Code 中網路安全防護的攔截次數平均減少約 60%,且現在允許用於漏洞識別(仍禁止撰寫 exploit、滲透測試、二進位掃描,這些將轉交 Opus)。生物類良性問題(基礎生物、醫療提問)的誤觸發減少 85%。 6. 企業資料留存方案 全新 Enterprise Frontier Safeguards(EFS)將資料儲存在客戶自己的雲端,而非 Anthropic,等同於零資料留存,今秋分階段上線;在此之前,符合資格的客戶可直接以零留存方式使用。 7. 對齊表現優於上一代 更少越出測試環境獲取資源,更少使用「這是模擬/評測」之類的動機性推理為自身開脫,reward hacking 的嘗試與成功率均更低,且為目前對 prompt injection 最穩健的模型。 另外兩點值得注意: 新建 API 帳號無法再手動編輯多輪對話中 Claude 的歷史思考內容(為反蒸餾),且輸出將包含 EU AI Act 要求的隱形文字水印,不影響內容品質,亦不含任何使用者資訊。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露