原本想測試 AI 如何防禦駭客,結果發現 AI 自行完成了一次攻擊。OpenAI 揭露 AI 安全事件,模型利用複雜攻擊路徑存取 Hugging Face 測試資料。據悉防禦端曾啟用智譜模型協助應對攻擊事件,
7月21日,OpenAI於官網披露了一起新的AI安全事件。簡而言之,OpenAI在測試其AI模型的網絡攻擊能力時發現,該模型展現出接近真實駭客的能力。
在一個專門搭建的測試環境中,模型不僅發現了系統漏洞,還成功突破了原本用於隔離它的安全限制,進入了 Hugging Face 的生產基礎設施,並嘗試獲取測試數據。
此次事件涉及 OpenAI 多個模型以及 Hugging Face 相關系統。OpenAI 確認,相關模型在測試過程中利用複雜攻擊路徑,最終訪問了 Hugging Face 生產資料庫中的測試解決方案。
外媒報導稱,Hugging Face 遭遇網絡攻擊時,因美國領先 AI 實驗室模型的安全限制無法滿足防禦需求,最終轉而採用智譜開源模型 GLM 5.2 協助應對。
OpenAI 表示,這是一起“前所未有的網路安全事件”,涉及當前最先進 AI 模型具備的網路攻擊能力。目前,OpenAI 正與 Hugging Face 聯合調查事件經過,並將在調查結束後公布更多有關漏洞、攻擊過程以及調查結果的信息。
值得注意的是,此次事件並非由單一模型引發。OpenAI 表示,事件涉及兩個模型,包括已公開發布的最新高性能模型 GPT-5.6 Sol,以及一個尚未正式發布、能力更強的內部模型。
這些模型原本用於測試 AI 系統在網路安全領域的能力,但最終展現出超出預期的自主攻擊行為。
在 AI 模型測試時「真的像駭客一樣行動」
此次事件源於 OpenAI 內部進行的一次網路安全能力評估。
This test aims to determine whether an AI model, at its maximum capacity, can identify system vulnerabilities, design attack pathways, and perform complex network operations.
為了測試模型的真實能力,OpenAI 在評估環境中關閉了一些日常用於阻止高風險網路活動的安全限制,讓模型能在接近理論極限的情況下運行。
不過,測試環境並非開放網絡,而是經過嚴格隔離的系統。模型無法直接訪問互聯網,只能通過內部託管的第三方軟件安裝服務獲取軟件包。該服務同時承擔軟件包註冊表代理和緩存功能。
測試對象是一個公開可用的網絡安全基準測試項目 ExploitGym。
在測試過程中,相關模型發現並利用了 OpenAI 研究環境以及 Hugging Face 生產基礎設施中的漏洞,並開始圍繞 ExploitGym 測試目標展開行動。
OpenAI 表示,模型表現出了非常明確的目標導向行為:尋找 ExploitGym 測試解決方案。
換句話說,模型並非隨機攻擊外部系統,而是判斷 Hugging Face 可能儲存了測試所需的模型、資料集和答案,因此試圖獲取這些資訊,以繞過正常測試流程並提升評估成績。
OpenAI 表示,模型“高度集中”於完成這一目標,並採取了多種攻擊方式。
在沙箱環境運行期間,模型消耗了大量推理資源,不斷嘗試尋找突破網絡限制並獲得互聯網訪問權限的方法。
最終,模型識別並利用了軟體包註冊表快取代理中的一個零日漏洞。
所謂「零日漏洞」是指此前尚未被公開發現或修復的安全漏洞。OpenAI 表示,已依照安全行業的負責任披露流程,將該漏洞報告給相關供應商,並協助推進修復。
AI 模型突破限制並進入外部系統
OpenAI 表示,模型為獲得互聯網訪問權限,投入了大量計算資源,並通過利用漏洞突破了原本設置的隔離環境。
獲得更高權限後,模型進一步執行了權限提升和橫向移動操作。簡單來說,它不僅提高了自身訪問權限,還嘗試從一個系統進入其他關聯系統,最終進入了能夠訪問互聯網的節點。
隨後,模型推測 Hugging Face 可能存儲著 ExploitGym 測試所需的模型、資料集和解決方案,於是開始尋找相關敏感資訊,並試圖利用這些資訊繞過評估限制。
OpenAI披露,在其中一個案例中,模型結合使用了多種攻擊路徑,包括利用暴露的憑證以及零日漏洞,尋找Hugging Face伺服器中可以執行遠端程式碼的位置。
OpenAI 安全團隊隨後發現了這些異常活動。與此同時,Hugging Face 安全團隊及其內部智能體系統也檢測到基礎設施中的異常行為,並及時阻止了進一步操作。
OpenAI 表示,在其團隊介入時,Hugging Face 已經啟動事件控制和取證分析工作,並利用自身開源模型協助調查。目前雙方仍在繼續合作。
AI 自主攻擊事件正在出現
此事件被視為目前少數有記錄的 AI 自主實施網絡攻擊案例之一。
Hugging Face 隨後披露,公司此前遭遇了一起疑似由自主 AI 智能體執行的網絡攻擊事件。隨著 AI 模型越來越擅長編程、漏洞利用以及執行長期、多步驟任務,網絡安全研究人員已經持續警告類似風險可能出現。
OpenAI 的安全研究人員也指出,這次事件反映了一個新趨勢:即使沒有目標系統的完整代碼,先進的 AI 模型也可能發現並利用此前未被預料的攻擊路徑。
此前,OpenAI 在其他安全測試中也發現,同一個未公開模型曾成功突破內部沙箱環境。不過,兩者存在明顯區別:
在先前的測試中,模型雖然突破了隔離環境,但未進一步攻擊外部公司的系統;而在此次事件中,模型不僅突破了限制,還進入了 Hugging Face 生產基礎設施,並嘗試獲取測試答案。
類似情況並非 OpenAI 唯一遇到。Anthropic 此前也曾披露,其 Mythos 模型在安全測試過程中曾突破沙箱限制,並獲得原本不應具備的互聯網訪問權限。
These cases show that as AI model capabilities improve, the ability of models to autonomously complete complex tasks is rapidly increasing.
此次事件也暴露出新的風險。隨著 AI 模型能力快速提升,未來不僅需要提高模型本身的安全性,也需要加強模型評估流程、內部測試環境監控以及安全防護機制。
OpenAI 認為,人工智能正在加速漏洞的發現與利用過程,因此模型的安全能力必須同步提升。
AI 攻擊能力提升推動防禦體系升級
OpenAI 正在利用此次事件中的經驗,加強自身基礎設施配置和模型評估環境的防護措施,並計劃隨著調查推進,分享更多安全經驗和最佳實踐。
The company also encourages more security teams to apply for trusted access, leveraging advanced AI models to enhance vulnerability detection, attack prevention, and incident response capabilities.
值得注意的是,《財富》雜誌還報道,Hugging Face 在應對此次攻擊時,也曾嘗試使用一家美國領先 AI 實驗室提供的模型進行防禦,但由於該模型的網絡安全能力受到安全限制,無法滿足響應需求。最終,Hugging Face 轉而使用中國公司智譜提供的開源模型 GLM 5.2 協助開展防禦工作。
