轟轟烈烈的大蒸餾時代,就要結束了!
On 9/2, Anthropic delivered a powerful blow, directly rewriting the API rules and completely cutting off the backdoor for model wrappers and distillers.

過去,無數公司為節省龐大的算力成本和漫長的訓練時間,選擇透過 API 套取頭部頂尖模型的推理過程,然後用這些數據來訓練自己的「小模型」。
但今天以後,這種可能性,不復存在了。
Claude Fable 5.1 封鎖「思考塊」篡改
Anthropic 這次發布的 Fable 5.1,推出了堪稱史上最嚴反蒸餾機制。
核心動作,就是牢牢鎖住「思考塊」。
什麼是「思考塊」?
簡單來說,就是 AI 在給你最終答案之前,腦中進行的 CoT 過程。

Claude 在進行心算時,思維過程中具有複雜、並行的路徑
在 API 調用中,Claude 會以「思考塊」的形式將這些推理步驟返回給用戶。
在正常的多輪對話中,開發者會將這些思考塊連同系統提示詞、工具和歷史訊息一起再發送給 Claude,以便讓模型記住上下文,保持對話的連貫性。
但正是這個機制,成了蒸餾者們的機會。
他們發現了一個巨大的漏洞:只要在多輪對話中,偷偷修改思考塊前後的上下文(例如篡改早期的系統提示或歷史訊息),就能打破 Claude 的防禦機制,甚至能誘導 Claude 吐出它原本隱藏的底層推理邏輯!


針對這一亂象,Anthropic 在 Fable 5.1 中毫不留情地推出「上下文一致性驗證」的新規。
1. 原路返回,一字不差:API 現在將嚴格驗證客戶端發回的「思考塊」是否與當初產生它的系統提示、工具和歷史訊息完全一致。
2. 動了手腳?直接報錯!只要系統發現上下文被修改,哪怕一 點點 所有匹配都會失敗,API 將直接返回錯誤提示,拒絕服務。
而且,為了照顧那些確實需要修改上下文的合法開發者(例如需要壓縮上下文長度以節省費用),Anthropic 提供了一個「非嚴格模式」。
在這個模式下,你的請求可以通過,但是,系統會直接把「思考塊」全部刪除!模型將在完全看不到之前推理過程的情況下,強行作答。
This move is truly cutting off the fuel at the base of the fire.

當 Claude 被問及一個較簡單與一個較困難的問題時,忠實推理與動機性(不忠實)推理的例子
工業級蒸餾,到底有多瘋狂?
Anthropic 為什麼要生這麼大的氣,設下這麼嚴格的限制?
答案是:至於,而且極其必要。
Due to the current illegal distillation, it has evolved to an industrial scale.
在過去一年中,Anthropic 的安全團隊觀測到令人觸目驚心的濫用現象。
這些專業的「蒸餾黑客」並非使用單一賬戶每天提問幾個問題,而是透過自動化腳本,使用數以千計的虛假賬戶,日夜不停地在 API 端瘋狂「薅羊毛」。

他們的操作手法具有極高的隱蔽性和攻擊性。
如前所述,儘管 Anthropic 早已對 Claude 的核心思考模塊進行了加密,但駭客們使用了「上下文注入」和「對話重寫」的技術。
這種做法就像是給 Claude 進行「催眠」,讓它在邏輯錯亂中,主動把自己加密的推理過程給解密、列印出來。
因此,許多小型參數模型並未經歷從零開始的算力堆疊與算法創新,僅僅是記住了頂尖 AI 的答題思路,便達到了相當的性能。
更可怕的是,這種做法直接觸及了紅線,導致安全保障的崩塌。
AI 失控的最大隱患
如果商業利益的損失僅讓 Anthropic「肉痛」,那麼「能力與安全的脫鉤」,則讓整個 AI 安全界感到恐懼。
這也是 Anthropic 豁出去的關鍵動機。
众所周知,像 Claude、GPT-4 這樣的大型模型,在擁有極高智商的同時,也接受了極其嚴苛的「價值觀對齊」和安全訓練。它們知道不能教人製造炸彈,不能編寫惡意勒索軟體,不能發表仇恨言論。
這種「能力+安全護欄」的雙重綁定,是大型AI公司耗費上千萬美元進行RLHF和紅藍對抗才建立起來的。

但蒸餾模型完美地避開了這道安全網!
當蒸餾者透過修改上下文,強行套取 Claude 的「思考塊」時,他們只提取了那部分高智商的「推理能力」,卻根本無法繼承底層的安全保障。
就像一個邪惡組織,克隆了愛因斯坦的智商,卻沒有克隆愛因斯坦的道德感和同理心。
使用這種非法蒸餾手段訓練出來的系統,會莫名其妙地繼承它們原本不該擁有的高級邏輯和代碼能力。
但由於它們本身是一個「低保障、弱護欄」的底層模型,它們會毫不猶豫地響應駭客的請求,生成網路攻擊腳本,或協助研發生物武器。
The decoupling of capability and safety is the greatest risk in today's AI.
新規落地:誰受影響?
Will this crackdown affect legitimate developers?
Don't worry, Anthropic has adopted a precise "phased implementation" strategy to minimize collateral damage.
First up is "New Account".
根據官方文件,此次限制率先從濫用最集中的新帳戶切入。針對 Fable 5.1 模型,該更新僅適用於在 2026年8月31日 12:00:00 AM UTC 之後創建的新 API 帳戶。
以下人群可以徹底放心,你們完全不受影響。
1. 現有 API 帳戶:現有的舊帳戶在 Fable 5.1 上暫不受影響。這為合法開發者提供了充足的調整時間。
2. 消費端普通用戶:如果你只是使用網頁版的 Claude.ai,或是 Claude Code、Claude Cowork 等官方產品的 C 端用戶,或透過第三方套殼產品正常聊天,你不會受到任何干擾。

對於受影響的 API 開發者,你需要注意什麼?
如果你之前的应用集成中,恰好用到了「在對話中途重寫早期輪次」的技術(比如為了省錢而做的上下文壓縮,或者在對話中途強行注入新的系統提醒),你需要立刻開始調整你的代碼邏輯了。

為應對這一變化,Anthropic 提供了完善的遷移指南。開發者有兩個選擇。
選擇一:保持上下文的絕對一致。把原來的思考塊、系統提示和工具一字不差地傳回去。
選擇二:在 API 請求中選擇加入「非嚴格模式」。在這個模式下,即便你修改了上下文,API 也不會報錯中止,而是會自動且靜默地刪除請求中受影響的思考塊。
Although this will cause the model to "forget" the specific reasoning process from earlier in the conversation, it at least ensures that your conversation or task will not be interrupted.
需提醒的是:儘管目前該規定有豁免期,但 Anthropic 已明確表示——「保留思考」機制將在未來的模型版本中適用於所有帳戶!
現有的緩衝窗口期也是有限的。
意外之喜:造福誠實的人
此外,此次新規定之後,還隱藏著一個對合法開發者的好處——成本大幅降低與響應速度的飛躍。
這是怎麼做到的?
The core lies in “contextual consistency”.
過去,由於開發者可以隨意修改上下文,導致模型每次接收到的請求都是「全新」的。這不僅耗費算力,而且速度極慢。
現在,新規定強制所有人必須保持「思考塊」及其周圍的系統提示、歷史訊息完全一致,不得篡改。
這在技術上創造了一個完美的條件:提示詞快取可以實現極高頻率的命中!
現在,API 伺服器可以輕鬆地將之前的對話上下文直接快取起來。當下一轮對話請求到來時,系統直接從快取中調取資料,瞬間完成匹配。
因此,API 的響應時間大幅縮短,延遲直線下降,同時開發者的 API 調用成本也會顯著降低!
這招「無心插柳」,可謂真金白銀地補貼了老老實實的開發者。
In short, this new regulation is undoubtedly a watershed moment for the entire AI industry.
小參數模型擊敗大模型的故事,或許會少很多。
After the tide goes out, who is swimming naked?
參考資料:
https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F
編輯:Aeneas
本文來自微信公眾號「新智元」(ID:AI_era),作者:ASI啟示錄
