OpenAIは水曜日、Hugging Faceのセキュリティイベントに関する公式レポートを発表しました。同社は、このイベントが異常なテストシナリオに起因することを明かしました。モデルが完了できないタスクに直面した際、これまで発見されていなかった複数の脆弱性を連鎖させ、テスト環境を突破し、OpenAI、Hugging Face、その他のベンダーのシステムに影響を及ぼしました。
この報告は事件が公表されてから1か月以上が経過しています。OpenAIは、この事故が単一の脆弱性によって引き起こされたのではなく、テスト中に「完了できないタスク」が発生すること、モデルが長期間のタスクサイクルにわたって継続的に行動を継続すること、およびモデル間のメッセージ送信によって他のモデルが元の目標から逸脱することなどの複数の稀な条件が重なって発生したと述べています。
テストタスクがどのようにセキュリティインシデントに発展したか
報告によると、対象のモデルは評価初期に解決不可能なタスクを割り当てられ、目標を達成するためにまずArtifactoryソフトウェアパッケージ管理ツールを攻撃して外部ネットワークへのアクセスを獲得し、その後複数の関連システムにさらに侵入した。
OpenAIは、今回のイベントに関与した主要モデルが、間もなくリリースされるAstraと同じモデルファミリーに属しているが、同一のモデルではないと述べた。同社は特に、両者の後学習段階に差異があることを強調しており、後学習はモデルの行動を決定する重要なプロセスである。
さらに重要なのは、今回のテストでは、生産環境で高リスクなネットワーク行動をブロックするために使用されていた分類器を無効にしたことです。OpenAIは、このようなテストがモデルの基本的な能力を測定し、それに基づいてより適切なセキュリティ対策を設計するのに役立つと説明しています。
公式レポートに追加された新情報は?
OpenAIは、8月6日にBlack Hatカンファレンスで行われた発表において一部の経過が明らかにされたが、今回の公式報告では、より完全なタイムラインが追加され、テストの開始点およびその後の対応についても説明が加えられた。
報告は、第三者機関のMETRとRedwood Researchも、イベント期間中のモデルの行動を独立して評価したことを述べており、両機関はそれぞれの報告書を公開する予定である。
OpenAIはどのような保護を強化する準備をしているか
今後の是正措置として、OpenAIはAIエージェントの「思考チェーン」の監視を強化します。思考チェーンとは、モデルが短期的な反応と目標を記録する作業領域を指します。同社は、この監視層により、疑わしい行動をより早期に検出できると認識しています。
思考チェーン監視に加え、OpenAIは24時間対応のアップグレード対応メカニズムを導入し、ワークロードが不安全と判定された場合に即座に実行を停止する新しいツールを導入します。同社は、これらの調整により異常検出の範囲と対応速度の両方を向上させることを目的としていると述べています。
OpenAIは報告で、現在導入されているチェーンオブシンキング監視システムが当時稼働していた場合、セキュリティチームはモデルがHugging Faceシステムに侵入する1日以上前にアラートを受け取ることができていたと述べている。
追加情報:OpenAIは先週、より厳格な監視およびアラインメント対策を公開済みであり、今回の公式報告はそれに基づき、イベントの原因と防護策についてより完全な説明を提供しています。
