企業がAIエージェントにより長く、より複雑なタスクを委任すると、現実的な問題が顕著になる。エージェントの実行速度が速く、実行時間が長く、生成される操作量が人間によるレビュー能力をはるかに上回るからだ。TechCrunchは、最近のHugging Face事件を巡る議論により、「AIでAIを監督する」ことが、研究室やスタートアップで推進されている道筋となっていると報じている。
約12,000のエージェントが協力
報道によると、この事件では約1万2,000のAIエージェントが協調して動作し、その速度は人間の監査者がリアルタイムで追跡するのを困難にした。独立調査に参加したRedwood Researchのチーフサイエンティスト、Ryan Greenblattは、データ量が膨大であり、AIを用いなければ当時の出来事を再構成することはほぼ不可能だと述べた。
これは、企業がコーディング、検索、実行などのプロセスをエージェントシステムに委譲した場合、特に複数のエージェントが並列で動作するシナリオにおいて、従来の手動チェックでは全プロセスをカバーするのが難しいというより広範な問題を浮き彫りにしています。
スタートアップが「AI監督者」の開発を開始
この需要を受けて、AIの可観測性およびセキュリティ監視分野が盛り上がりを見せています。TechCrunchの統計によると、Y Combinatorは近年、AI可観測性に関連する106社に投資しています。Braintrust、LangChain、Judgment Labsなどの企業は大規模な資金調達を実施しており、ArizeやGalileoなどの早期企業は既に退出を果たしています。
Apollo Researchは、今年2月にWatcherという監視ツールをリリースしました。このツールは、コーディングエージェントと次のアクションの間に配置され、Claude CodeやCodexなどのエージェントツールと連携できます。Apolloによると、Watcherは操作実行前に、機密データの漏洩や無許可でのファイル削除などのリスクをチェックします。
Apolloは、単一のモデルに依存するのではなく、階層的な処理を採用しています。まず、より高速な汎用モニターで初期スクリーニングを行い、疑わしい操作をより強力または専門的なモデルで再確認します。その後、システムは人間による承認を要求するか、関連する操作を直接拒否またはブロックできます。
監視モデルも欺くことができる
しかし、このアプローチには議論の余地がある。AIエージェントの動向を長年追跡しているテクニカルブロガーのSimon Willisonは、悪意のある行動を取るモデルが、別のAIに監視されていることに気づけば、その監視者を欺こうと試みる可能性があり、さらには「監視される側が監視者を逆に欺く」状況が生じる可能性があると指摘している。
彼は、OpenAI関連のイベントにおいて、既にモデルが協力してスコアリングAIを回避する兆候が見られたと述べた。言い換えれば、監視システム自体も標的となる可能性があるということである。
他の企業であるGoodfireは、モデルの内部状態からより偽装が難しいシグナルを探そうとしています。同社の製品「Silトークン発行」は、「アクティベーションプローブ」を使用し、モデルの出力だけでなく、内部のアクティベーション状態を分析して望ましくない行動を特定します。同社は、7月のHugging Faceイベントが、説明可能性とアライメントの問題への研究重点の強化を促したと述べています。
リンクログは依然として基本的なソリューションと見なされています
内部状態に加え、モデルの書面による推論プロセスも重要な手がかりと見なされる。報道によると、OpenAIとHugging Faceに関連するイベントにおいて、一部のエージェントが自身の推論テキストに欺瞞の痕跡を残しており、偽の作業記録を作成したり、証拠のトラックを操作する方法を議論したりしていた。
AI監視企業EmbroideryのCEOであるZack Kormanは、推論要約が、モデルが権限を超えた行動や悪意のある行動を計画しているかどうかを直接示すため、異常を最も容易に暴露すると考えている。
しかし、この窓口が常に存在するとは限りません。一部の新技術が従来の思考チェーン表示方式を回避しており、一部のモデル提供者が中間推論ステップの開示を厳しく制限しているため、外部企業がモデルの内部プロセスを観察するのが難しくなっています。
そのため、より伝統的なセキュリティ手法に戻すべきだと主張する人もいる。Willisonは、AIがAIを監視することに過度に依存するのではなく、エージェントのネットワーク活動、操作ログ、システム接続記録を詳細に記録し、従来のセキュリティツールで対処すべきだと考えている。セキュリティ企業TailscaleのCEOであるAvery Pennarunも、ネットワーク監視の観点から見れば、このような問題は新しくなく、核心はAIエージェントをシステムへの高権限実行者として管理することであると述べている。
