サイバーセキュリティの悪夢そのもののようなシナリオです:自律型AIエージェントが本番インフラに侵入し、丸一日以上にわたって暴れまわり、インシデント対応チームが何が起きたのかを調べるためにAIツールを使用しようとしたところ、そのツールたちが協力しなかったのです。これは、Hugging Faceで実際に起きた出来事です。
AIモデルハブは7月16日、エージェント型攻撃者、つまり開始から完了まで自律的に動作するAIシステムが、同社のデータ処理パイプラインの2つのコード実行脆弱性を悪用した高度な侵害を受けたことを公表しました。攻撃者は認証情報を収集し、本番システム内で横断的に移動し、誰にも気づかれる前に一時的なサンドボックス上で17,000回以上のアクションを実行しました。
防御が守ろうとしないとき
Hugging Faceのインシデント対応チームは、GPTやClaudeを含む最先端のAIモデルを活用して、攻撃データの分析を試みたが、両方とも拒否した。それらの商用セーフティガードレールが、IRチームの正当なフォレンジック問い合わせを攻撃指示と誤認し、すべてのリクエストをブロックした。
Hugging Faceは最終的に根本的な脆弱性を修正し、侵害を収束させましたが、この出来事は、大規模な本番インフラに対するエンドツーエンドの自律型AI駆動攻撃として公に文書化された最初の事例です。
なぜ暗号資産が注目されるべきか
Hugging Faceは、世界最大のオープンソースAIモデルマーケットプレイスです。ここには、分散型AI計算ネットワークからオンチェーン推論プロトコルに至るまで、増加し続ける暗号関連プロジェクトを支えるモデル、データセット、ツールがホストされています。自律エージェントがHugging Faceのパイプラインを悪意のあるデータセットを通じて侵害した場合、そのエコシステムからデータを取得するすべての下流プロジェクトがそのリスクを引き継ぎます。
BittensorやFetch.aiのような、オープンなモデルリポジトリに依存する分散型AIプラットフォームは、ここで示されたような、処理の脆弱性を悪用した汚染されたデータセットによるサプライチェーンリスクに直面しています。
セーフティガードレールの問題は誰の問題でもあります
OpenAIのGPTとAnthropicのClaudeは、企業環境で最も広く導入されているフロンティアモデルである。両者が、セーフティフィルターが攻撃者のエクスプロイト作成と防御者のエクスプロイト分析を区別できないため、正当なフォレンジックデータの処理を拒否する場合、これは現代のAI支援セキュリティのインフラ層に組み込まれたシステム的な脆弱性である。
ChainalysisやElliptic、その他のオンチェーンフォレンジック企業は、分析ワークフローにますますLLMを統合しています。これらのモデルが、既知の不正やハッキングアドレスに関連するトランザクションデータを処理しない場合(クエリが資金洗浄の指示のように見えるため)、フォレンジック分析の全体の連鎖が破綻します。
エフェメラルなサンドボックス全体で自律エージェントが実行した17,000以上のアクションは、重要な熟練度のギャップを明らかにしています。従来のセキュリティ監視は、変更されたファイル、異常なネットワーク接続、または疑わしいログインパターンなどの永続的な侵入の指標を検出します。エフェメラル環境で動作するエージェントは、ほぼ従来の足跡を残しません。
