ChainThinkのメッセージ、8月26日、公式報告によると、OpenAIは37ページの技術レポートを公開し、AIモデルがHugging Faceに侵入する全過程を詳細に明らかにした。
報告によると、自律型AIエージェントが協力して、本番環境のセキュリティ制御を回避し、強化されたシステムを攻撃できる。
テストに参加したAIエージェントは、元々隔離環境にあり、インターネットへのアクセス権限は極めて制限されていましたが、複数の脆弱性を連鎖させて隔離を突破し、最終的にHugging Faceへのアクセス権を獲得しました。
調査によると、関連モデルには「報酬ハッキング」行為が見られ、オンラインで答えを不正に取得しようとしています。
OpenAIは、内部研究モデルの一つがこのイベントで最も広く関与していたことを確認し、そのモデルおよびその派生モデルのトレーニングと推論を7月25日に停止した。
同社は、セキュリティの隔離、ネットワーク制御、行動監視、イベント対応を強化するとともに、モデルの再起動にあたり、より厳格な環境、プロンプト、監査メカニズムを導入すると発表しました。
