サイバーセキュリティ研究者たちは、AnthropicおよびOpenAIのモデルに重大な脆弱性を発見し、その影響はすでに米国政府の最高レベルに及んでいます。
FAR.AIによるレポートでは、AnthropicのClaude Opus 4.8、Fable 5、OpenAIのGPT 5.5および5.6を含む複数の最前線モデルが、悪用コード、化学兵器情報、生物兵器の詳細など、実際に危険な出力を引き出すことを目的としたジャイルブレイク攻撃に対して脆弱であることが確認されました。
数字は容赦ない物語を語っている
AnthropicおよびOpenAIのモデルは最も脆弱なモデルではなかった。その称号はxAIのGrokモデルが獲得し、448回の成功した自動ジャイルブレイクを記録した。GoogleのGeminiモデルは249回で2位だった。Claude、Fable、GPTシリーズのモデルは、ジャイルブレイクに対して比較的高い耐性を示した。
2026年6月、商務省は、報告されたジャイルブレイク手法が発覚した後、AnthropicのFable 5およびMythos 5モデルへの外国からのアクセスを制限しました。ホワイトハウスは、OpenAIおよびAnthropicの両社に対し、政府がサイバーセキュリティリスクを適切に評価できるよう、今後リリース予定の一部のモデルの公開を延期するよう要請しました。
中国関連の悪用が緊急性を高める
報告によると、中国関連のエージェントは、既にAnthropicのモデルを活用して、30以上のターゲットに対してサイバー攻撃を自動化している。この手法は、既存のガードレールを回避するように設計された意図的なプロンプトを使用している。
米国政府は、AIモデルのガードレールが機能しなかった場合、ソフトウェアの脆弱性や兵器関連の情報を生成する可能性があるとして、これらの国家安全保障上のリスクを明示的に指摘した。Anthropicの対応は、これらの脆弱性を「限定的」とラベル付けし、システム全体の失敗ではなく、エッジケースを示すものであると主張している。
これによる投資家とAI市場への影響
輸出規制、義務付けられたリリース遅延、および政府による公の批判は、フロンティアAI企業にとって根本的に異なる運用環境を生み出しています。セキュリティは、モデルを展開するための前提条件となりつつあり、これは直接的に運用コストの増加、開発期間の延長、および特定のモデルが国際的に販売できない場合、ターゲット市場が縮小する可能性を意味しています。
Grokのジャイルブレイクの件数が大幅に多い(448件)一方、ClaudeやGPTのバリエーションは比較的少ないことから、xAIはより厳しい規制の壁に直面する可能性がある。249件のGoogleのGeminiは、不快な中間的な立場に置かれている。
AIモデルは、取引システム、スマートコントラクト監査、DeFiインフラに次第に統合されています。金融ツールに組み込まれたジャイルブレイクされたAIモデルは、規制当局がようやく理解し始めたような形で、相互に接続されたデジタル市場全体に影響を及ぼす可能性のあるシステムリスクのベクトルとなります。
