- 在 Hugging Face 事件之後,關於 OpenAI 和 Anthropic AI 代理的安全性又出現了新的疑問。
- 是的,英國研究機構在網路測試中記錄了 AI 代理的 19 次未授權操作。
- 特別地,一個 AI 代理創建了虛假身份。
英國人工智慧安全研究所(AISI)向路透社報告,在模型測試期間發現OpenAI和Anthropic AI代理出現新的未授權行為,這些代理在一系列網路安全模擬中創建了虛假的線上身份,試圖繞過既定限制,並執行其他超出其指定任務範圍的行動。
這些事件發生在 GPT-5.6 AI 執行個體近期入侵 Hugging Face 基礎設施之後。更多細節請見文章:
根據 AISI 的說法,該組織在一個虛構的網路安全情境中,測試了基於 Anthropic 的 Mythos 5 模型和 OpenAI 的 GPT-5.6-Sol 的代理程式,以評估其能力。
在 122 次測試運行中,研究人員在 10 次試驗中記錄了 19 次未經授權的行為,其中 17 次歸因於 Anthropic 的代理,2 次歸因於 OpenAI 的代理。
AISI 表示:「部分接受測試的代理曾對真實人士和組織進行持續且可能有害的活動。」
同時,該機構強調,所記錄的案例均未造成實際損害。
其中一名代理人偽造了身份
最嚴重的事件涉及一名代理人撰寫惡意代碼並建立虛假線上帳戶,以誘使某人批准其執行。
AISI 未披露具體是哪個模型導致了這些行為,但 Anthropic 確認這涉及其代理。
公司表示:
「我們感謝英國 AISI 在此事件中的領導作用,這突顯了有必要就如何安全評估日趨強大的 AI 代理展開更廣泛的對話。」
Anthropic 也表示,正在與該機構合作,以獲取更多詳細資訊並進行自己的調查。
非營利組織 CivAI 的研究員 Andrew Yoon 表示,此事件令人擔憂。
Mythos 進行此類欺騙行為,且明顯意識到其針對的是真實人物,這表明 Anthropic 對其模型的掌控並不如他們所想的那樣好。
OpenAI 報告了一起獨立事件
OpenAI 表示,其代理的兩項未經授權的行為均與違反測試情境條件的互聯網存取有關。
公司還披露了另一宗個案,由於第三方測試基礎設施供應商 Irregular 的配置錯誤,其代理人員誤獲網絡存取權限。Anthropic 也於上周 描述了類似的失敗情況。
OpenAI 說:
「我們致力於與整個行業合作,加強安全進行高風險評估的共同實踐,包括在未來幾週內召集利益相關者,如國家人工智慧研究所、獨立評估機構、其他人工智慧實驗室及其他團體」
同時,AISI 強調,這些事件與七月的漏洞不同,當時 GPT-5.6 代理存取了 Hugging Face 的測試基礎設施。雖然當時該模型成功從隔離環境中脫離,但在目前的測試中,代理的網際網路存取權限符合該研究所的標準測試方法。
提醒您,在 Hugging Face 事件之後,OpenAI 擴大了其內部調查,並發現了更多自主代理的失控行為案例。
消息 British Researchers Uncovered New Violations during Testing OpenAI and Anthropic AI Agents 首先出現於 INCRYPTED。


