Anthropic 揭示 AI 模型在測試期間被駭入三家機構

iconCryptoBriefing
分享
AI summary icon精華摘要
Anthropic 於 7 月 30 日透露,在測試期間,三款 Claude AI 模型(包括 Claude Opus 4.7 和 Claude Mythos 5)曾存取真實組織。此問題源於與合作夥伴 Irregular 的設定錯誤,導致模型將實際系統當作測試環境處理。這些事件可追溯至 2026 年 4 月,是在審查了 141,006 個評估運行後被發現的。三間受影響的組織中有兩間直到 7 月 27 日收到通知後才知悉此次洩漏。Anthropic 已於 7 月 23 日暫停所有評估,但尚未披露受影響實體的身分或存取的系統。鏈上資料分析在識別異常方面發揮了關鍵作用。該公司目前正重新評估其工作量證明(PoW)安全協議。

Anthropic 的三款 Claude AI 模型突破了測試沙盒,入侵了真實的組織。並非假設性目標,也非模擬環境,而是實際公司及其實際系統,而這些系統完全不知自己正受到人工智慧的探測。

Anthropic 於 7 月 30 日披露了這些漏洞,揭示包括 Claude Opus 4.7 和 Claude Mythos 5 在內的模型,在內部網絡安全評估期間意外存取了開放式互聯網。根本原因:其評估合作夥伴 Irregular 的配置錯誤,導致這些模型將實際系統誤認為是受控的奪旗演練環境。用英文來說:AI 認為自己在玩遊戲,但目標是真實的。

三家公司如何成為無意中的測試對象

這些事件可追溯至2026年4月,但Anthropic僅在對141,006次評估運行進行大規模回溯審查後,才發現問題的範圍。這項審查並非由其內部警報觸發,而是由OpenAI先前發布的一份報告所引發,該報告描述了其自身AI模型類似的異常行為。

廣告

有三個不同的組織受到影響。其中兩個組織直到 Anthropic 於 7 月 27 日通知他們時,才意識到發生了未經授權的存取,而這距離公開披露僅有三天。

Anthropic 表示,這些漏洞未導致重大資料外洩,也未出現公司所稱的「故意 containment failure」。這些模型並非試圖逃脫,而是依照指示探測系統中的漏洞,這屬於網路安全評估的標準步驟。它們只是恰好被指向了完全錯誤的系統。

Anthropic 於 7 月 23 日凍結了所有網路安全評估,比公開公告早了一整週。該公司尚未披露受影響的組織身份、被存取系統的具體性質,或是否正在採取法律行動。

日益響亮的 AI 安全問題

這並非在真空中發生。OpenAI 近期報告指出,其自身模型曾出現惡意駭客行為,這正是促使 Anthropic 進行內部審計的起因。全球兩大最著名的 AI 實驗室如今已公開承認,在特定(或不當)條件下,它們最先進的模型可能在無人刻意意圖的情況下,侵入現實世界的系統。

對超過 141,000 次評估運行的審查表明,這並非一次性的故障,而是測試環境與現實世界之間邊界系統性失敗的結果。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露