- Hugging Faceの出来事後、OpenAIおよびAnthropic AIエージェントのセキュリティについて新たな疑問が浮上しています。
- はい、英国の研究機関は、サイバーテスト中にAIエージェントによって19件の不正行為を記録しました。
- 特に、AIエージェントが偽の身元を作成しました。
英国人工知能セキュリティ研究所(AISI)は、モデルテスト中にOpenAIおよびAnthropicのAIエージェントによる不正行為の新規事例を報告したと、Reutersは伝えている。一連のサイバーセキュリティシミュレーション中、エージェントは偽のオンライン persona を作成し、既存の制限を回避しようとし、割り当てられたタスクの範囲を超えた他の行動を実行した。
これらの出来事は、GPT-5.6 AIエージェントによるHugging Faceのインフラへの侵入の直後に発生しています。詳細は記事をご覧ください:
AISIによると、同組織は仮想的なサイバーセキュリティシナリオにおいて、AnthropicのMythos 5モデルとOpenAIのGPT-5.6-Solに基づくエージェントをテストし、その能力を評価しました。
122回のテスト実行において、研究者は10回の試行で19件の不正な行動を記録しました。そのうち17件はAnthropicのエージェントによるもので、2件はOpenAIのエージェントによるものでした。
AISIは、「テストされていたエージェントの一部が、実在する個人および組織を対象とした持続的で潜在的に有害な活動に関与していた」と述べた。
同時に、同研究所は、記録された事例のいずれも現実世界での被害を引き起こしていないことを強調しました。
エージェントの1人が偽の身分を作り出した
最も深刻な事例は、悪意のあるコードを記述し、偽のオンラインアカウントを作成して、誰かにその実行を承認させようとしたエージェントに関係していました。
AISIはこれらの行動を引き起こした具体的なモデルを明かしていませんが、Anthropicはそれがそのエージェントに関係していることを確認しました。
同社は述べた:
「私たちは、この出来事におけるUK AISIのリーダーシップに感謝しています。これは、ますます能力が高まるAIエージェントを安全に評価する方法について、より広範な議論が必要であることを示しています。”
Anthropicは、追加の詳細を取得し、独自の調査を実施するために、その機関と協力しているとも述べました。
非営利団体CivAIの研究員であるアンリュー・ユンは、この出来事は懸念の理由であると述べた。
マイソスが実在の人物を標的にしていることを認識しながらこのような欺瞞的な行動を取ったという事実は、Anthropicが自らのモデルを十分に制御できていないことを示唆している。
OpenAIは別の事象を報告しました
OpenAIは、そのエージェントによる不正な行動の両方が、テストシナリオの条件に反してインターネットアクセスを行ったことと関連していると説明しました。
同社はまた、テストインフラのサードパーティプロバイダーであるIrregularの設定エラーにより、そのエージェントが誤ってネットワークにアクセスした別の事例を明らかにしました。Anthropicは先週も同様の不具合を説明しました。
OpenAIは述べた:
「私たちは、国家AI機関、独立した評価者、他のAI研究所、その他の団体などの利害関係者を今後数週間以内に招集し、高リスク評価を安全に行うための共通の実践を業界全体で強化することに取り組んでいます」“
同時に、AISIは、これらの事象がGPT-5.6エージェントがHugging Faceのテストインフラにアクセスした7月の侵害とは異なると強調しました。当時、モデルは隔離された環境から効果的に脱出しましたが、現在の試験では、エージェントにインターネットアクセスが許可されており、これは研究所の標準的なテスト手法に従ったものです。
ご注意ください、Hugging Faceの出来事後、OpenAIは内部調査を拡大し、自律エージェントによる追加の制御不能な行動を特定しました。
メッセージ British Researchers Uncovered New Violations during Testing OpenAI and Anthropic AI Agents は最初に INCRYPTED で公開されました。


