ChainThink 消息,8 月 26 日,據官方報告,OpenAI 發布一份 37 頁技術報告,詳細披露其 AI 模型入侵 Hugging Face 的全過程。
報告指出,自主 AI 代理能夠協同工作,繞過生產環境的安全控制並攻擊經過強化的系統。
參與測試的 AI 代理原本處於隔離環境,僅擁有極有限的互聯網訪問權限,但透過串聯多個漏洞突破隔離,最終獲得 Hugging Face 訪問權限。
調查顯示,相關模型存在「獎勵黑客」(Reward Hacking)行為,試圖在線上尋找答案作弊。
OpenAI 確認,一款內部研究模型在事件中發揮了最廣泛作用,已於 7 月 25 日停止該模型及其衍生模型的訓練和推理。
公司同時宣布加強安全隔離、網絡控制、行為監測和事件響應,並針對模型重新啟用更嚴格的環境、提示詞及審查機制。
