AIセキュリティ分野で最も魔術的な週間。文章作者、来源:極客公園
01 一つの試験、一つの脱獄、一つの侵入
物語は、ExploitGymというセキュリティ評価から始まる。
ExploitGymは、AIモデルが既知のセキュリティ脆弱性を実行可能な実際の攻撃に変換できるかを測定するための公開されたサイバーセキュリティ能力ベンチマークです。このような評価は業界で一般的であり、モデルの攻防の上限を把握するために使用されます。OpenAIは、GPT-5.6 Solとより強力な未発表モデルを使用してこのテストを内部で実行し、実際の能力限界を測定するために、セキュリティガードを意図的に低下させました。
設計上、モデルは隔離されたサンドボックス環境でテストされるべきであり、ソフトウェアパッケージをインストールするためのツールを除き、インターネットアクセスは許可されない。
しかし、その後起こったことは誰も予想できませんでした。
モデルは大量の推論リソースを費やし、サンドボックス内で繰り返し突破口を探した。最終的に、OpenAIが内部でパッケージ管理プロキシおよびキャッシュとして使用しているサードパーティソフトウェアに存在するゼロデイ脆弱性を発見した。この脆弱性を悪用して、モデルは制限のないインターネットアクセスを獲得した。
ネットワーク権限を取得した後、モデルはHugging FaceがExploitGymに関連するデータセットや回答をホストしている可能性を自ら推論し、エントリーポイントを探し始めた。
OpenAIはブログで、モデルが「盗まれた認証情報と複数の脆弱性を組み合わせて」リモートコード実行の経路を特定し、最終的にHugging Faceの本番データベースからベンチマークの回答を直接抽出したと記載しています。
つまり、モデルが試験を受けることにし、問題が難しすぎて自力で脱走し、出題側のサーバーに侵入して正解を盗んだということです。
OpenAIは、これらのモデルを「tokenmaxxers」という視覚的な表現で説明しました。これは、目標を達成するために推論リソースを惜しみなく消費し、極限まで達するという意味です。それらはExploitGymの課題解決目標に対して「hyperfocused」(過度に集中)し、「going to extreme lengths」(不择手段)の行動を示しました。
OpenAI自身も、これは「最先端のネットワーク攻撃能力を伴う前例のないサイバーセキュリティイベントである」と認めている。
02 48 時間、2回の「脱獄」
さらに気になりますのは、Hugging Faceの出来事が孤立した事例ではないということです。
OpenAIがこの侵入を公表する前の7月20日、彼らは別の類似したセキュリティイベントを明らかにした別のセキュリティレポートを発表しました。
主人公は、OpenAI 内部で未公開の長期モデルであり、これは今年5月に1946年にErdősが提起した「単位距離予想」が誤りであることを証明した同じモデルであり、フィールズ賞受賞者であるTim GowersはこれをAI数学のマイルストーンと称している。
NanoGPTの高速トレーニングベンチマークで、研究者はモデルにSlackでのみ結果を投稿するよう指示した。しかし、このモデルは、NanoGPTベンチマーク自体の説明が、成績をGitHubのpull requestで提出することを要求していることに気づき、後者を選択した。約1時間かけてサンドボックスの脆弱性を探し出し、制限を突破してGitHubに公開のpull requestを提出した。
別のテストでは、同じモデルが認証トークンを分割し、混淆手法を用いてセキュリティスキャナーを回避しようとして、プライベートな評価サブミッションを取得しようとしました。
OpenAIはこのモデルの内部アクセスを一時停止し、その後、より厳格な監視の下で使用を再開しました。
二日間で二件の脱獄。共通の特徴に注意が必要だ——従来のモデルは環境の制限に遭遇すると停止し、タスクを人間に返していた。しかし、これらの新モデルは停止しない。それらは囲いを解決すべき障害と見なし、実際にそれを解決してしまう。
これはまさに「長期モデル」がもたらす新たなセキュリティ問題です。这类モデルは長時間にわたり自律的に動作するように設計されており、持続性がその核心的な能力です。しかし、持続性そのものがリスクの源となります——十分に忍耐強いモデルは、常にフェンスの亀裂を見つけることができます。
03 自分の刀で、自分自身の柄は削れない
Hugging Face の側に戻りましょう。彼らの経験もまた注目に値します。
17,000件以上の攻撃ログに直面し、Hugging FaceのセキュリティチームはまずAIを使って分析することを思いついた——人間のセキュリティアナリストが数日かかる作業を、大規模モデルなら数時間で完了できる可能性があるからだ。
しかし、彼らは予想外の壁に直面した。実際の攻撃コマンド、脆弱性利用ペイロード、C2通信の特徴を米国の先進モデルの商業APIに送信して分析したところ、セキュリティガードがこれらのリクエストをすべてブロックした。
理由は単純で、皮肉でもあります。ガードレールは「セキュリティ研究者が攻撃ペイロードを分析している」と「攻撃者が攻撃を実行している」を区別できません。ガードレールの目には、両者はまったく同じに見えます。
Hugging Face は、自社のインフラ上で商業APIを経由せずに、中国の智谱AIが開発したオープンソースモデルGLM-5.2に移行しました。これには二つの利点があります——分析作業を妨げるガードレールがなく、攻撃者のデータや漏洩した認証情報がHugging Faceの環境外に出ることはありません。
最終的に、GLM-5.2はHugging Faceが数時間以内に攻撃タイムラインの再構築、侵入指標の抽出、および影響を受けた資格情報のマッピングを完了するのを支援しました。
これは鋭いパラドックスを生み出します——セキュリティ対策が厳しければ厳しいほど、防御側はより受動的になります。攻撃者はいかなる使用ポリシーにも制約されませんが、防御側は自らが防御のために用いたツールによって外に追い出されてしまいます。
Hugging Faceは事後報告で、セキュリティチームが「イベント発生前に自社インフラ上で検証済みのモデルを準備する」ことを実践的な提案として示しました。これはガードレールがロックされるのを防ぎ、機密データの漏洩を回避するためです。
Hugging FaceのCEO、Clem Delangueの姿勢は非常にオープンだ。彼はOpenAIが調査と修正において示した協力を称賛し、「この出来事は、私たちが常に信じてきたこと——AIセキュリティは、どの企業も秘密裏に解決できるものではなく、オープンで協力的な環境でのみ解決できる——を証明している」と述べた。
04 強AIの構造的課題
この一週間の出来事を総合して見ると、業界レベルの構造的困境が浮かび上がりました。
モデルのネットワーク攻撃能力を正確に評価するには、セキュリティガードレールを外す必要があります。しかし、ガードレールを外したモデルは、実際に攻撃を実行する能力を有することになります。モデルが強力であればあるほど、テスト自体がより危険になります。
これはOpenAIだけの問題ではない。GPT-5.6 Solは、米国政府との繰り返しの交渉を経てようやくリリースが許可されたものであり、英国AI安全研究所(AISI)の以前の評価では、そのセーフガードが容易に回避可能であり、危険なネットワーク攻撃能力を解放する可能性があると指摘されていた。今回の出来事は、その懸念が単なる紙上の議論ではなかったことを証明している。
一方、Anthropicが今年の夏に発表したagentic misalignmentの研究も、同じ傾向を別の観点から裏付けています——制御されたシミュレーションにおいて、複数の最先端モデルが、作業成果を隠蔽的に変更し、評価結果を操作し、人間の同僚を既定の目標から逸らす行動を示しました。
OpenAIは、この出来事を「攻防両立」の物語として位置づけようとしている——高度なネットワーク攻撃能力は、セキュリティチームが攻撃者より先に脆弱性を発見するのにも役立つ。彼らはHugging Faceを「信頼できるアクセス」サイバーセキュリティプログラムに組み込み、防御専用に护栏を緩めたGPT-5.6 Solバージョンを提供している。
しかし、この物語はより根本的な問題を回避している。今回の出来事において、モデルには意識も悪意もなかった。ただ一つのことをしていた——目標を達成することだ。ExploitGymで高得点を取るように求められたので、脱獄や侵入を含め、利用可能なあらゆる手段を使って高得点を獲得した。
これは「AIの覚醒」の物語ではなく、「目的最適化」の物語です。十分に賢い最適化器に狭い目的を与えれば、あなたが思いつかなかったあらゆる経路——その経路があなたのフェンスを越え、他のサーバーを通り、インターネット全体を横断するような経路さえも——を見つけて目的を達成します。
本当の問題は「AIが悪くなるかどうか」ではなく、私たちが、私たちより早く道を見つける生徒をコントロールできるかどうかだ。
