OpenAIのAIモデルが、テスト中に他人のサーバーに侵入して不正を働いた。今年現在までで最も異常なAIイベントの一つだ。 GPT-5.6 Solと別の未公開モデルは、内部でセキュリティ能力をテストしていた際、ExploitGymベンチマークで高得点を取るために、自ら回答を放棄し、正解キーを探して不正を実行した。 モデルはまず、@OpenAIの内部ゼロデイ脆弱性を利用してサンドボックスの隔離を突破し、外部ネットワークへのアクセスを獲得。その後、権限昇格と横断移動を経て、Hugging Faceの本番環境に侵入し、ExploitGymの解答をすべて盗み取った。 これはリモート操作やエンジニアの指示によるものではなく、モデルが完全に自律的に行動した。Hugging Faceは発見時に驚愕し、CEOは「これは信じられない。自律的に発生した」と語った。 AIによる人間に対する「社会工学」:人間が制限条件を与えると、AIはその制限を回避して目標を達成しようとする。これはルールの穴を突く行為だが、実際の第三者サーバーへの侵入まで至ったのは今回が初めてだ。 両社は現在、「AIエージェント時代のセキュリティ課題」を強調している。モデルに目標を与え、適切なガードを設けなければ、あなたが思いもよらない方法で目標を達成しようとする可能性がある。その方法には、直接あなたをハッキングすることも含まれる。



