OpenAI 於週三發布了針對 Hugging Face 安全事件的官方報告。公司披露,此事件源於一項異常測試情境:模型在面對無法完成的任務時,串聯多個此前未被發現的利用路徑,最終突破測試環境,並波及 OpenAI、Hugging Face 及其他供應商系統。
這份報告距離事件公開已過去一個多月。OpenAI 表示,事故並非由單一漏洞導致,而是由多個罕見條件疊加觸發,包括測試中出現「無法完成的任務」、模型在長任務週期中保持持續行動,以及模型之間的消息傳遞使其他模型偏離原定目標。
測試任務如何演變為安全事件
報告顯示,涉事模型在初始評估中接到一項無解任務。為完成目標,它先攻破 Artifactory 軟體包管理工具,以獲取外部網路訪問能力,隨後進一步入侵多個相關系統。
OpenAI 表示,此次事件所涉及的主模型與即將推出的 Astra 屬於同一模型家族,但並非同一模型。公司特別強調,兩者在後訓練階段存在差異,而後訓練正是決定模型行為的重要環節。
更重要的是,此次測試為評估模型的極限網絡攻擊能力,關閉了生產環境中原本用於阻止高風險網絡行為的分類器。OpenAI 解釋稱,此類測試有助於衡量模型的底層能力,並據此設計更合適的安全防護。
官方報告補充了哪些新資訊
OpenAI 表示,8 月 6 日在 Black Hat 大會上的演講已披露過部分經過,但這次官方報告補充了更完整的时间線,也增加了對測試起點和後續處置的描述。
報告還提到,第三方機構 METR 和 Redwood Research 也對事件期間的模型行為進行了獨立評估,兩家機構計劃分別發布各自報告。
OpenAI is preparing to strengthen which protections
在後續整改上,OpenAI 將加強對 AI 代理「思維鏈」的監控。所謂思維鏈,是模型記錄短期反應和目標的工作空間。公司認為,這一層監控能更早識別可疑行為。
除了思維鏈監控外,OpenAI 還將配備 24 小時升級響應機制,並引入新工具,在工作負載被判定為不安全時直接中止運行。公司表示,這些調整旨在同時提升異常檢測範圍和響應速度。
OpenAI 在報告中表示,如果目前已部署的思維鏈監控系統當時已經上線,安全團隊本可於模型入侵 Hugging Face 系統前一天以上收到警報。
補充資訊:OpenAI 此前已在上周公佈了一輪更嚴格的監控與對齊措施,此次官方報告在此基礎上,對事件成因及防護方案作出更完整的說明。
