網絡安全研究人員發現了來自 Anthropic 和 OpenAI 模型的重大漏洞,其影響已波及美國政府最高層級。
FAR.AI 的一份報告測試了多個前沿模型,包括 Anthropic 的 Claude Opus 4.8、Fable 5 和 OpenAI 的 GPT 5.5 與 5.6,發現這些模型易受惡意越獄攻擊,這些攻擊旨在提取真正危險的輸出,例如可利用的代碼、化學武器資訊和生物武器細節。
這些數字講述了一個令人震驚的故事
Anthropic 和 OpenAI 的模型並非表現最差的。這項殊榮屬於 xAI 的 Grok 模型,其記錄了 448 次成功的自動越獄。Google 的 Gemini 模型以 249 次位居第二。Claude、Fable 和 GPT 系列模型對越獄的抵抗能力相對較強。
在 2026 年 6 月,商務部在報告出現一種越獄技術後,限制了外國對 Anthropic 的 Fable 5 和 Mythos 5 模型的訪問。白宮也已要求 OpenAI 和 Anthropic 延遲發布某些即將推出的模型,以便政府能妥善評估網絡安全風險。
與中國相關的攻擊加劇了緊迫性
報告指出,與中國相關的實體已利用 Anthropic 的模型自動化對超過 30 個目標的網絡攻擊。此技術涉及精心設計的提示,以繞過現有的防護機制。
美國政府明確指出這些國家安全風險,並指出當AI模型的防護機制失效時,可能產生軟體漏洞和與武器相關的信息。Anthropic 的回應是將這些漏洞標記為「狹窄」,暗示它們屬於邊緣案例,而非系統性失敗。
這對投資者和人工智慧市場意味著什麼
出口管制、強制性的發布延遲以及政府的公開批評,為前沿人工智慧公司創造了本質上不同的運營環境。安全正成為允許部署模型的先決條件,這直接導致運營成本上升、開發時間延長,並可能因某些模型無法在國際上銷售而縮小可覆蓋的市場規模。
Grok 的越獄次數顯著更差——448 次,而 Claude 和 GPT 系列的數字相對較低——這表明 xAI 可能面臨更嚴峻的監管壓力。Google 的 Gemini 以 249 次處於一個不舒適的中間位置。
AI 模型正日益整合至交易系統、智能合約審計和 DeFi 基礎設施中。嵌入金融工具中的越獄 AI 模型代表了一種系統性風險向量,可能以監管機構才剛開始理解的方式,在相互關聯的數位市場中蔓延。
