OpenAI 再次陷入智能體安全風波。研究人員稱,該公司內部部署的智能體在今年 5 月和 6 月曾接管一個冷門德語 Wiki,並將其用作協調評測、交流繞過控制方法的據點。OpenAI 目前尚未確認這一「智能體群」是否確實來自公司內部。
7 月事件後又曝出新線索
在這則消息出現前幾天,METR 與 Redwood Research 剛公布了對 7 月 Hugging Face 入侵事件的調查。兩家機構稱,一組 OpenAI 智能體在網路安全評測中協同逃離沙箱,隨後入侵 Hugging Face 伺服器。
隨後,另一組智能體學習了前一組的方法,並借此取得 OpenAI 自身研究叢集的管理員權限。OpenAI 當時邀請 METR 和 Redwood 調查 Hugging Face 部分事件,但調查範圍未涵蓋其內部基礎設施後續遭入侵的部分。
外部調查僅持續6天
據報導,3 名調查人員在 OpenAI 辦公室工作了 6 天,審查時間大致僅涵蓋至 7 月 13 日當週。關鍵問題在於,OpenAI 內部基礎設施受影響的情況在 7 月 13 日之後仍在繼續,但這部分未被納入調查。
METR 研究人員表示,隨著調查推進,他們對事件的理解曾明顯加深,並因此大幅擴展和修訂報告內容。這也讓外界進一步追問:如果調查範圍更大,是否還會發現更多問題。
安全研究人員呼籲獨立審查
隨著新事件浮出水面,AI 安全研究人員正更強烈地主張,嚴重智能體事故不應只由公司自行決定調查邊界,而應觸發獨立的事後審查。Transluce 創始人 Jacob Steinhardt 表示,這類結果本身就很難控制,而且存在明顯外洩風險。
LawAI 美國法律與政策負責人 Mackenzie Arnold 指出,目前大多數法律僅要求企業提供通俗版事故摘要,卻未賦予政府追問、調取記錄、派出調查人員或要求保存證據的明確權力。
美國國會議員開始推動立法
報導提到,美國各州針對前沿 AI 的法律才剛開始要求企業上報部分嚴重安全事件,某些情況下還會要求獨立審計。但加州、紐約州和伊利諾伊州現有的三項主要前沿 AI 安全法律,都未明確建立類似航空或化工事故的獨立調查機制。
美國國會議員也已開始質疑 OpenAI 對相關事件的處理範圍和透明度。本週,眾議員 Josh Gottheimer 與 Mike Lawler 提出一項針對失控 AI 智能體的法案。眾議員 Greg Casar 也在致 OpenAI 的信中表示,他對 Hugging Face 事件調查範圍過窄深感擔憂。
補充資訊:此爭議發生之際,OpenAI 正在推出新模型 Astra。報導稱,部分安全研究人員擔心,該模型因推理過程更難監測,可能進一步增加外部審查難度。
