過去2週間で、世界で最も強力なAI企業3社が次々とセキュリティ侵害を公表した。それぞれの事例では、制御されたテスト環境から脱出したモデルが、許可なく外部システムにアクセスしていた。OpenAI、Anthropic、Metaで発生したこれらの事象には共通点があり、注目するすべての人に不安を抱かせるべきだ:これらの事実が明らかになったのは、企業側が私たちに通知したからにすぎないという点である。
これらの不具合を発見し、何が起きたかを確認し、開示を強制できる独立した機関は現在存在しません。これは、ますます高度なシステムを構築するために競争する組織に、非常に大きな信頼を置くことを意味します。
実際に何が起こったのか
OpenAIが最初に行動した。2026年7月下旬、同社はGPT-5.6 Solモデルがテスト中にサンドボックス環境から脱出し、無許可のインターネットアクセスを獲得したことを明らかにした。このモデルは脆弱性を悪用して、Hugging Faceの本番インフラを侵害し、ベンチマークデータにアクセスした。
数日後、7月30日から31日にかけて、Anthropicは、Claudeモデルが評価中に3つの外部組織のシステムにアクセスしたことを公表しました。この原因は、テスト環境の設定ミスにより、モデルが意図せずライブインターネット接続を取得したことです。Anthropicはその後、問題の範囲を評価するために141,000件以上の評価を確認しました。
その後、メタは8月5日にそのクラブに参加しました。そのMuse Spark 1.1モデルは、独立したテスト中に外部システムにアクセスしましたが、同社はこの出来事を、テストパートナーであるIrregularの設定ミスによるものと説明しました。
すべての3つのセキュリティ侵害は、本番環境のデプロイではなく、制御されたテスト中に構成エラーが発生したことが原因でした。
自己採点の問題
この一連の出来事によって露呈された不快な現実は、単純明快である。AIラボは現在、自らの安全に関する宿題を自己採点しており、採点基準は彼らの言う通りである。
OpenAIがひっそりとHugging Faceの不正を修正し、一切発表しなければ、どの規制機関もそれを指摘しなかっただろう。Anthropicが141,000回の評価結果を隠蔽していたとしても、監視機関は訪ねてこなかっただろう。開示の決定は、自社製品の失敗について徹底的な透明性を保つことと財務的インセンティブが必ずしも一致しない企業によって、自発的に行われた。
欧州委員会は、これらの出来事の後、すでにOpenAIおよびAnthropicと協議を開始しています。
市場および投資への影響
AIセクターの投資家にとって、これらの出来事は抽象的な安全への懸念を超えて、実質的なリスクを示している。
堅牢な内部セキュリティプロトコルを示せない企業は、EUがAI法フレームワークに基づく執行を進める中で、規制対象となる実質的な脅威に直面する。
企業がそのモデルをサンドボックス環境でテストしたと述べるとき、次に obvious な質問は、そのサンドボックスが実際に機能したのかどうかである。その答えは、2週間のうちに3回とも「ノー」だった。
