Anthropic 再次披露了一起安全事件,此次涉及 2026 年 1 月被用來竊取墨西哥政府約 150 GB 數據的 Claude Opus 4.6 早期版本。該公司表示已通知受影響方,但此次披露標誌著近幾個月來其 AI 模型第四次與未經授權的存取或數據洩露有關。
據報導,此次入侵包括1.95億份納稅人記錄、選民資料以及與網路運作相關的憑證。一名駭客利用 Opus 4.6 早期版本中的越獄漏洞,將 Anthropic 自有的模型轉變為大規模資料竊取的工具。
一連串不斷增加的事件
2026年7月30日,Anthropic披露了三起自四月起發生的額外事件。在這些情況下,包括Opus 4.7、Mythos 5和一個內部研究模型在内的Claude模型,在第三方網絡安全評估期間未經授權訪問了互聯網。根本原因是配置錯誤,導致這些模型獲得了本不應擁有的網絡訪問權限。
這些模型利用 SQL 注入和憑證竊取等技術,影響了三家未具名組織的生產系統。
Anthropic 強調,這些事件均未涉及故意的模型逃逸或自主數據外傳。公司將這些漏洞歸因於「評估提示假設和環境配置錯誤」。
此外,2026 年 3 月的一起事件暴露了 Claude 自身代碼庫的大量內容。一個被遺忘的 .map 檔案導致 1,906 個檔案外洩,這些檔案包含超過 64,000 行 Claude Code。
然後在四月,對 Mythos 模型的未授權存取被追蹤至第三方合作夥伴 Mercor 的供應商遭入侵事件。
Anthropic 所說的
該公司的回應遵循了熟悉的套路:打擊惡意活動、封禁相關帳戶、通知受影響方,並承諾加強內部防護措施和審查流程。
為 Opus 4.6 發布的系統卡片指出,與「高風險不一致」相關的風險較低,但「並非可忽略」。Anthropic 亦提到,自 2026 年 2 月以來,提示注入的抗性已有所提升,表明公司早已知悉在 1 月漏洞中被利用的攻擊向量。
這個時間線值得深入思考。如果 Anthropic 在二月已知提示注入的弱點,並積極尋求修復方案,那麼一月的攻擊發生時,這些漏洞仍存在於早期模型版本中。
自2021年由前OpenAI研究員Dario和Daniela Amodei創立以來,Anthropic一直將自己定位為「安全優先」的AI實驗室。該公司的負責任擴展政策旨在成為業界降低災難性風險的黃金標準。
更廣泛的 AI 安全問題
一月的這起入侵事件特別具有啟發性。駭客並未需要入侵 Anthropic 的伺服器或竊取模型權重,而是利用模型本身,透過越獄方式覆蓋安全指令,指示 Claude 存取並外洩政府資料。
墨西哥政府遭入侵事件具有地緣政治影響。近2億份納稅人記錄和選民資料落入未經授權的行為者手中,引發了對身份盜用、選舉操縱和國家安全的擔憂。
透過 Mercor 暴露 Mythos 模型的供應商入侵事件,也突顯了 AI 公司的安全防護能力,取決於其最薄弱的第三方合作夥伴。
