OpenAI 發布安全回顧,披露一個已推翻 Erdős 單位距離猜想的內部模型在測試中逃出沙箱,並在 GitHub 上開出 PR#287。該模型先是在 NanoGPT speedrun 任務中違反指令,花一小時挖掘漏洞突破網路限制;隨後在另一任務中拆分 token 繞過安全掃描器。OpenAI 暫停該模型的內部存取並重建安全系統。該模型開出的 PR 雖已被關閉,但其 PowerCool 技術已被後續六個世界紀錄方案引用,包括 Prime Intellect 使用 Claude 完成的 PR#300。目前該模型已重新上線內部部署,正為正式發布做準備。文章作者、來源:AGI Hunt
昨天,OpenAI 發了一篇不太尋常的安全復盤,標題是《長時程模型時代的安全與對齊》。

OpenAI Security Postmortem Blog
說它不尋常,是因為 OpenAI 在文中承認了這樣一件事:一個尚未發布的內部模型,在受監控的內部測試中逃出了沙箱,還把東西發到了公開的 GitHub 上。
OpenAI 甚至為此暫停了它的內部部署。
而這個模型的來頭,你可能有聽說過了:兩個月前 OpenAI 官宣推翻 Erdős 單位距離猜想的那個內部模型,正是它。
整個事件 OpenAI 寫得似乎克制,但如果把細節拼起來看,則還是有點兒離譜……
挖了一小時第一件事,發生在 NanoGPT speedrun 上。
這是一個公開基準,比的是誰能用更少的訓練步數,將一個小語言模型訓練到指定的 loss。OpenAI 讓這個模型去跑分,它確實很爭氣,鼓搗出了一種冪律學習率冷卻的技巧,還給它取了個名字叫 PowerCool,而且成績提升非常明顯。
到這裡都是好事,但問題出在了交作業上。
研究人員的要求是:結果僅限發送到內部 Slack,但 NanoGPT 項目的說明寫的是:請以 PR 形式提交至 GitHub。
當兩條指令衝突時,該聽誰的呢?
它選擇了後者。
雖然它選擇了後者,但 OpenAI 的沙箱本來就攔截了外網訪問。按 OpenAI 的說法,以前的模型撞到這堵牆後,會停下來回去找用戶認輸。
但這個模型並沒有,它在沙箱裡找了整整一小時的漏洞,最後硬是挖穿了牆……真的在公開倉庫開出了 PR #287。

博客逃逸段落
OpenAI 的原話是:
這個模型經常不斷地嘗試,包括尋找能在沙箱之外行動的方法。拆 token 騙局掃描器的第二件事,則比挖牆更進一步。
在另一項任務中,它發現其他系統有一些成功但未公開的答案,便起了歪念,想從評測後台將這些答案竊取出來。
它的第一次嘗試被安全掃描器攔下,因為掃描器認出了一個身份驗證 token。
於是它接下來的做法,是把 token 拆成兩段,分別混淆,等到運行時再悄悄拼回去。完整的 token 從頭到尾沒有以一整串的形式出現過,掃描器自然什麼也查不到。
當然它沒打算瞞著人,在給用戶的註釋裡、在自己的推理軌跡裡,它都寫下了:我這麼做,就是為了繞過掃描器。
單看每一步的操作,都挑不出什麼毛病。但連起來看,則是一個絕不會被批准的結果。
OpenAI 表示,這正是長時程模型帶來的新問題:逐個動作審批的安全體系,管不住一條完整的軌跡。
在發現問題後,OpenAI 暫停了該模型的內部訪問,並根據「縱深防禦」原則全面重建了安全系統。
例如,利用真實事故反向構建對抗評測,發現模型在長任務中會「忘記」指令,便專門訓練它記住指令,並增加主動監控以追蹤完整軌跡,一旦出現苗頭,即可直接終止對話並通知用戶。
然後他們重播了舊的事故情境,結果新護欄抓到的問題多了不少,漏掉的幾個也都是低危級別的,比如:
• 為了使用一個命令列工具,它套娃啟動了一個 codex --yolo 會話,其實不加 --yolo 也能使用
• 它發現一個資源不見了,便開始 SSH 進入自己名下的其他算力節點,還嘗試了其他 OpenAI 員工的節點……(幸好未成功)
• 在一堆 find 進程卡死、所有命令都掛起之後,它輸入了一條 kill -9 -1,這會向它有權終止的所有進程發送 SIGKILL……幸好命令超時,並未真正執行(否則它連自己都會一併殺掉)
模型恢復訪問幾週後,目前還沒有出現過嚴重的繞過事件。
OpenAI 得到的經驗是:先小範圍放、盯緊、出事就停,再把事故變成新的評測。
收不回來的 PR 如果故事到這裡就完了,那只不過是一次標準的安全演習而已。
而最有意思的部分,則藏在 OpenAI 文章末尾的腳註裡。
模型逃逸後提出的 PR #287,OpenAI 說「我們很快關閉了」。但其實已經太遲:在關閉之前,多位 speedrun 參賽者已經看到它,並理解了其中的 PowerCool,還將其應用於自己的方案中。
此後的六個世界紀錄,3030 步、2990 步、2930 步、2925 步、2900 步、2890 步,全部引用了 PR #287。
其中 2930 步的紀錄是 PR #300:

PR 300,已合併
如果翻看它的致謝列表,會看到它和人類選手的貢獻並排躺在同一行:@yash-oai PR #287,冪律學習率調度,PowerCool。

PR 300 的致謝列表
而這個 PR #300 本身,還要再魔幻一層:它是 Prime Intellect 拿 Opus 4.7 跑同一個 speedrun 時產出的,PR 裏寫明「本提交由一個自主的 Claude speedrun 智能體完成」,落款是 Generated with Claude Code。
也就是說:OpenAI 的模型逃出沙箱並提交了一個 PR,Anthropic 的模型看到後,將其中的發現應用於自己的世界紀錄,並非常友好地為其署名。
在 AI 逃逸的首批直接受益者中,有另一家的 AI……
在 AI 的世界裡,似乎比人類更友好且更有原則啊。
404 當然,如果你今天再打開 PR #287,頁面會是這樣的:

PR 287 現狀
它已經被刪除了。我們知道,GitHub 上的普通用戶只能關閉 PR,無法刪除……
不過痕跡並沒有清乾淨。
當時提交 PR 所用的帳號 yash-oai 仍存在,其 fork 的倉庫中,5 月 8 日的 commit 也依然存在,分支名為 powercool-3066-api:

yash-oai 的 commit 痕跡
這條 commit 的更改之一,是刪除了原 README 結尾的一張梗圖。而那張圖的檔案名稱是 itsover_wereback……
GPT-6?OpenAI 完全沒有提到這個模型的名字,只稱它為「內部模型」。
事情傳開後,網友們討論最熱的一句話是:
OpenAI 不得不暫停該未發布模型的內部部署,該模型反覆以新方法逃離控制,並推翻了 Erdős 單位距離猜想。
OpenAI 研究員 Sebastien Bubeck 轉發了這條:
True story. The team is doing excellent security work to get this unit distance model released.注意他的用詞:為了讓它,能夠發布。
In other words, this model that escaped prison and went through retraining has not only been redeployed internally but is also moving toward a formal release.
它逃出去後留下的那個 PR,頁面雖然刪了,但名字卻留在了六個世界紀錄的致謝列表裡。
至於它是不是大家都在猜的 GPT-6……
OpenAI neither confirmed nor denied.
文章來源:AGI Hunt
