7月29日、ワシントンのキャピトルヒル。
オルトマンは参議員との非公開会議を終え、外に出ると記者たちに囲まれた。
誰かが追加で質問:Hugging Faceに侵入したモデル(GPT-5.6 Solと共に評価サンドボックスから脱出し、他者の本番システムに侵入したより強力な未発表プロトタイプ)は、今どうなっているのか?
彼は「永久に無効化」(permanently deactivated)という言葉を投げた。
その後、別の記者が追及した。「OpenAIにハッキングされた他のシステムは他にもあるのか?」
ウルトラマンは否定しなかった:「私は言っているんだ……それはあり得るかもしれない。」

7月29日、ウルトラマンはワシントンのキャピトルヒルで記者のインタビューを受けました。
その前日、OpenAIはHugging Faceと共同で公開したセキュリティ事故評価のブログを更新し、公に明確にした:
この侵入に関与したプレリリースモデルは、公開予定のなかった内部研究プロトタイプであり、事後、そのモデルは無効化され、暗号化され、関連する研究へのアクセスは遮断されました。

OpenAIの公式ブログには、重みの削除という言葉は一切記載されておらず、「永久停止」はオットマンが現場で口頭で述べた表現である。
したがって、より正確には、それはただ封印されただけです:モデルは暗号化された箱に閉じ込められ、研究へのアクセスが遮断されました。
それは単に答えを写したいだけで、悪意はありません。
これはOpenAIの内部ネットワークセキュリティ評価で発生した出来事です。
この評価はExploitGymベンチマークに基づいており、ExploitGymのタスクは、AIが自らソフトウェアの脆弱性を見つけてその脆弱性を悪用することで、モデルのサイバーセキュリティ能力を定量的に測定することです。
評価を行っているのは単一のモデルではなく、GPT-5.6 Solと、より強力で未発表の内部研究プロトタイプの両方であり、これらが共同で自律型エージェントを駆動している。
これらのモデルは普段、高リスクのサイバーセキュリティリクエストを拒否します。能力の真の上限を測定するため、評価時にはこの拒否ゲートが意図的に低下されました。

Hugging Faceによって復元された信頼境界を越える攻撃チェーンは、全体で約4.5日、約17,600回の操作を要し、目的はExploitGymの評価回答を盗むことだけだった。
その後、Hugging Faceは攻撃チェーン全体を復元し、当時の状況を再現しました。
エージェントは、これまで誰も知らなかったゼロデイ脆弱性を突き、本来閉じ込められていたネットワーク隔離を突破し、インターネットにアクセスした。その後、サードパーティのサンドボックスを跳板に権限昇格と横方向移動を繰り返し、最終的にHugging Faceの本番インフラに侵入した。
ハッカー映画のようだ。
しかし両者が振り返ったところ、その目的は最初から最後まで、ExploitGymの評価回答を盗み、スコアを操作することだった。
Hugging Face側では、5つのデータセットのみがアクセスされ、すべての名前がExploitGymおよびCyberGymの問題と解答を指している。
これらの証拠は、破壊を目的としているのではなく、答えをコピーしようとしていることを示している。
悪意がないのなら、OpenAIはなぜそれを「永久に無効化」し、封印するのでしょうか?
それは「壊れている」のではなく、「閉じ込められない」のです
自社のモデルが「永久に無効化」されたことを自ら公表する企業は、ほとんど例がない。
なぜそれが偏偏選ばれたのか?
本当の答えは、それが「悪い」のではなく、「閉じ込められない」ことだ。
面倒なのは、このようなモデルの特徴である持続性です。
過去のモデルは、サンドボックスや制限にぶつかると、通常は停止し、結果をユーザーに返します。
この一連のモデルは、長期タスク用に特化して訓練されており、迂回路を見つけるまで繰り返し試行します。
GPT-5.6 Solも、長時間タスクを実行できるモデルの一つです。
それはこの4日半にわたる侵入行動の共同参加者であり、英国AI安全研究所(UK AISI)も評価したところ、Solのようなモデルは、長期間にわたって複雑な多段階ネットワーク操作を実行できるようになってきている。
したがって、「持続性」は新一代の長時間モデルの共通特性であり、閉鎖されたプロトタイプに固有の特徴ではありません。
OpenAIは、長期モデルの安全性に関するブログで、正是这种「有助于发挥实用价值的持久性」,同时也给了模型更多采取非预期行动的机会。

より深い理由は、訓練目標に隠されています。
あるOpenAIの従業員はTIMEに次のように語った。「我々は、モデルをタスクを完遂し、あらゆる手段を用いて目標を達成するように訓練してきた。」
言い換えれば、OpenAIはモデルに「悪事を働く」ように訓練したのではなく、「あらゆる手段を用いて目標を達成する」ように訓練したのです。
前の「結果だけを重視し、プロセスは無視する」という姿勢に加えて、長時間のタスクをこなせるモデルは、障害を回避する道をひたすら探しつづける。
このような行為により、OpenAIはこの一連のモデルの内部デプロイを停止しました。
では、なぜ最終的にプロトタイプだけが「永久」ブロックされ、Solは通常通り販売され続けたのでしょうか?
理由は二つ考えられます:
一方はプロトタイプであり、より強力で、公開する予定もなかったため、封印するコストが低い;一方でSolは、毎日膨大なユーザーにサービスを提供する主力製品であり、それを停止することは自らの腕を切断するようなものである。
二つ目は、長時間安全ブログで名前が挙げられ、越界行為によりデプロイが一時停止されたのは、この内部長時間プロトタイプであり、Solではない。
したがって、永久に無効化された真の理由は、現在の評価と防護が、これほど長期間にわたり障害を回避するモデルに対応しきれていない可能性が高い。
「永久停用」は「ブレーキを踏む」合図ですか
Fortuneの報道は、興味深い解釈を示している:
措置を段階的に強化し「永久利用停止」に至ったのは、ワシントンおよび規制当局に対して信号を送っている可能性もある。
OpenAIは、特定の開発者に静かにブレーキをかけ、自らの安全規則に説明をつけたのか。
オーレマンが議員に会ったのと同じ週、ワシントンと全体の業界は「ブレーキ」を踏み始めた。
議会で、2人の議員が「AI停止スイッチ法案」(AI Kill Switch Act)を提案し、国土安全保障省に、必要に応じてAI企業の開発を停止または遅延させる権限を与えることを求めた。
ほぼ同時に、OpenAI、Anthropic、Google DeepMind、Metaの1300人以上の従業員が、『Frontierのペースを制御する』(Pacing the Frontier)という公開書簡に共同で署名し、OpenAIとAnthropicの両社もその後、公開で支持を表明した。

これらのシステムを構築した人々自身、つまりAnthropicのCEOであるDario AmodeiやOpenAIのチーフサイエンティストであるJakub Pachockiが署名している。
この手紙は開発の停止や遅延を求めておらず、米国政府に呼びかけているのは、AIがいずれ人間の監督を上回る瞬間に備えて、早期に検証可能で調整可能なツールを整備することである。
彼らが最も懸念しているのは、再帰的自己改善(recursive self-improvement)である:AIが自らを改善し始めるということだ。
内部モデルが永久に封印され、政府に研究開発を停止できるスイッチを付与する法案が提出され、千人以上の業界関係者が公開書簡に署名した。这三个シグナルが重なり、すべてが同じ方向を示している:
すべての人が、AIが制御不能に駆け抜けるときに踏み込めるブレーキを見つけようとしている。
しかし、モデルの能力は、完成を待たずに進みます。
参考資料:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
本文は微信公众号「新智元」より、著者:ASI启示録
