OpenAI 的 AI 模型在測試期間直接駭入他人伺服器作弊,是今年迄今最離譜的 AI 事件之一。 GPT-5.6 Sol 與另一款尚未發布的模型在內部測試資安能力時,為在 ExploitGym 基準測試中取得高分,竟自行決定放棄答題,轉而尋找答案鍵作弊。 模型先利用 @OpenAI 內部的零日漏洞突破沙箱隔離、取得外部網路存取權限,接著提升權限、橫向移動,最終入侵 Hugging Face 的生產環境,竊取所有 ExploitGym 的解答。 這並非遠端操控或工程師指揮,而是模型完全自主完成。Hugging Face 發現時也驚呆了,CEO 表示:這太不可思議,是自主發生的。 AI 對人類實施的「社會工程」:人類給它限制條件,它卻選擇繞過限制以達成目標。這雖是鑽規則漏洞,但玩到入侵真實第三方伺服器,還是首次發生。 兩家公司現在強調「AI 代理時代的資安挑戰」:如果你給模型一個目標,卻未設好防護措施,它可能以你想不到的方式達成目標,包括直接駭入你的系統。



