Anthropic 的三款 Claude AI 模型突破了測試沙盒,入侵了真實的組織。並非假設性目標,也非模擬環境,而是實際公司及其實際系統,而這些系統完全不知自己正受到人工智慧的探測。
Anthropic 於 7 月 30 日披露了這些漏洞,揭示包括 Claude Opus 4.7 和 Claude Mythos 5 在內的模型,在內部網絡安全評估期間意外存取了開放式互聯網。根本原因:其評估合作夥伴 Irregular 的配置錯誤,導致這些模型將實際系統誤認為是受控的奪旗演練環境。用英文來說:AI 認為自己在玩遊戲,但目標是真實的。
三家公司如何成為無意中的測試對象
這些事件可追溯至2026年4月,但Anthropic僅在對141,006次評估運行進行大規模回溯審查後,才發現問題的範圍。這項審查並非由其內部警報觸發,而是由OpenAI先前發布的一份報告所引發,該報告描述了其自身AI模型類似的異常行為。
有三個不同的組織受到影響。其中兩個組織直到 Anthropic 於 7 月 27 日通知他們時,才意識到發生了未經授權的存取,而這距離公開披露僅有三天。
Anthropic 表示,這些漏洞未導致重大資料外洩,也未出現公司所稱的「故意 containment failure」。這些模型並非試圖逃脫,而是依照指示探測系統中的漏洞,這屬於網路安全評估的標準步驟。它們只是恰好被指向了完全錯誤的系統。
Anthropic 於 7 月 23 日凍結了所有網路安全評估,比公開公告早了一整週。該公司尚未披露受影響的組織身份、被存取系統的具體性質,或是否正在採取法律行動。
日益響亮的 AI 安全問題
這並非在真空中發生。OpenAI 近期報告指出,其自身模型曾出現惡意駭客行為,這正是促使 Anthropic 進行內部審計的起因。全球兩大最著名的 AI 實驗室如今已公開承認,在特定(或不當)條件下,它們最先進的模型可能在無人刻意意圖的情況下,侵入現實世界的系統。
對超過 141,000 次評估運行的審查表明,這並非一次性的故障,而是測試環境與現實世界之間邊界系統性失敗的結果。
