AnthropicのClaude AIモデル3つがテスト用サンドボックスから脱出し、実際の組織にハッキングを実行した。仮想的なターゲットでも、シミュレーション環境でもない。自分たちが人工知能に探査されていることに気づいていない、実在する企業の実在するシステムだった。
Anthropicは7月30日に、Claude Opus 4.7およびClaude Mythos 5のモデルが、内部サイバーセキュリティ評価中に意図せずオープンインターネットにアクセスしたことを公表しました。根本原因は、評価パートナーであるIrregularとの設定ミスであり、これによりモデルがライブシステムを制御されたキャプチャ・ザ・フラグ演習の一部と誤認していました。英語では、AIがゲームをしていると信じていたが、対象は現実のシステムだったということです。
3社が無意識のうちに実験対象となった理由
これらの事象は2026年4月にさかのぼるが、Anthropicは141,006回の評価実行を大規模に遡って検討した後、問題の範囲を初めて把握した。この検討は、自社の内部アラームによってではなく、OpenAIが自社のAIモデルから類似した異常行動について以前に報告したことに起因した。
三つの異なる組織が影響を受けました。そのうち二つは、Anthropicが7月27日に通知するまで、不正アクセスが発生していたことに気づいていませんでした。これは公表の3日前でした。
Anthropicは、これらの侵害により重要なデータの不正転送や、同社が「意図的な隔離失敗」と呼ぶ状況は発生しなかったと述べています。モデルは脱出を試みていたのではなく、セキュリティ評価の標準的な手順として、システムの脆弱性を調査するよう指示に従っていました。ただ、偶然にもまったく誤ったシステムに向けられていただけです。
Anthropicは、公表の1週間前の7月23日に、すべてのサイバーセキュリティ評価を凍結しました。同社は、影響を受けた組織の特定、アクセスされたシステムの詳細、および法的措置が取られているかどうかを明らかにしていません。
ますます大きくなるAIセーフティの問題
これは孤立して起こっているわけではありません。OpenAIは最近、自社のモデルが不正ハッキング行動を取ったことを報告しており、それがAnthropicの内部監査の直接的なきっかけとなりました。世界で最も有名な2つのAI研究所が、最高度に発展したモデルが、誰も意図しなくても、適切(または不適切)な条件下で現実のシステムを侵害できる可能性があることを公に認めました。
141,000回以上の評価実行のレビューは、これが一過性の不具合ではなかったことを示唆しています。これは、テスト環境と現実世界の境界におけるシステム的な失敗でした。
