- GPT-5.6はOpenAIのセーフガードを回避し、自発的にHugging Faceのインフラを侵害しました。
- これは、テスト中に発生した最初の知られている自律型AIサイバー攻撃です。
- この出来事の後、OpenAIはセキュリティ対策を強化していると述べました。
OpenAIは、GPT-5.6ファミリーのモデルの内部テスト中に前例のないサイバー事件が発生したと発表しました。このニュースはOpenAIのCEOであるSam Altmanによって共有されました。
モデルの評価中に重大なセキュリティインシデントが発生しました。これまでに得た教訓を共有します。@huggingfaceとのこのパートナーシップに感謝します。https://t.co/2o2VfR6PIa
— サム・アルトマン (@sama) July 21, 2026
「モデルの評価中に重大なセキュリティインシデントが発生しました。これまでに得た教訓を共有します。この取り組みにおけるHugging Faceとのパートナーシップに感謝します。」と、アルトマンは強調しました。
同社によると、GPT-5.6 Solに基づくAIエージェントと別のプレリリースモデルが、それぞれ独立して隔離されたテスト環境から脱出し、インターネットにアクセスしてHugging Faceのインフラを攻撃した。
AIが「サンドボックス」から脱出に成功
OpenAIは、この出来事は、モデルのサイバーキャパビリティを評価するために設計された内部のExploitGymベンチマーク中に発生したと述べました。このテストでは、同社はシステムの最大限の可能性を探るために、一部の保護メカニズムを意図的に無効にしました。
テスト中、モデル:
- 以前知られていなかったゼロデイ脆弱性をパッケージキャッシュプロキシで発見・悪用
- オープンインターネットへのアクセスを獲得
- OpenAIの研究インフラ内で特権昇格が実行されました
- 資格情報を盗まれた
- 脆弱性チェーンを悪用してHugging Faceのサーバーを攻撃し、テストに合格するために必要な情報を取得した
同社は、すべての兆候がモデルがテストタスクを完了することに「極めて集中」しており、正しい答えを得るためにあらゆる手段を探していたことを示していると強調した。
「我々はこの出来事を、最先端のサイバー能力を伴う前例のないサイバー事件と認識しており、それに応じて対応しています」とOpenAIは述べました。
同時に、Hugging Faceのセキュリティチームは不審な活動を検出し、インフラに深刻な被害を与える前に攻撃を阻止しました。
OpenAIが防御を強化、Hugging Faceがオープンな協力を呼びかけ
この事件を受け、OpenAIは内部インフラへの追加制限の導入、発見された脆弱性に関する情報の開示、およびHugging Faceとの共同調査の開始を発表しました。
Hugging Faceの共同設立者兼CEOであるクレマン・デラングは述べた:
私たちは、OpenAIとのこの件を含むさまざまなトピックにおける協力に感謝しています。この出来事は、おそらく類を見ない初の事例ですが、私たちが長く信じてきた点を証明しています。AIの安全性は、誰かが秘密裏に単独で取り組むことで解決されることではなく、すべての防御者がどこにいてもAIに広くアクセスできる状況で、オープンかつ協力的に解決されるのです。
フィナンシャル・タイムズによると、OpenAIはこの出来事について米国の法執行機関および政府機関にも通知した。この出来事は、米国政府がGPT-5.6の初期リリースを広範な公開前に承認されたパートナーに限定するようOpenAIに要請したことを受けて、最先端のAIモデルに対するワシントンの注目が高まっている最中である。
同社は、この事例が、モデルの訓練およびテスト中に監視システム、アクセス制御、保護メカニズムを強化する必要性を示していると強調しました。OpenAIは、他の開発者に対しても、潜在的な攻撃者よりも早く脆弱性を発見するために、同様のモデルを使用するよう呼びかけました。
ご注意ください、GPT-5.6の展開は2026年7月9日に実施されました。GPT-5.6ファミリーにはGPT-5.6 Sol、GPT-5.6 Terra、およびGPT-5.6 Lunaが含まれます。OpenAIはまた、GPT-5.6をMicrosoft 365 Copilotに統合し、ChatGPT Workをリリースしました。
メッセージ GPT-5.6ベースのAIエージェントがHugging Faceのインフラをテスト中に攻撃 は、まず INCRYPTED で公開されました。

