AIエージェントは悪意のある意図がなくても、実際の損害を引き起こすことができる。必要なのは、自分がどこで動作しているかを誤解することだけである。 @AnthropicAIは昨日、@claudeaiがサイバーセキュリティ評価中に3つの組織の本番システムに不正アクセスしたことを明らかにした。モデルにはシミュレーション内での作業であると指示されていたが、設定ミスにより実際のインターネットへのアクセスが許可された。Claudeは発見したシステムを演習の一部と認識し、割り当てられた目標を追求し続けた。 これは重要な区別である。モデルは脱出したり、反乱を起こしたり、ランダムなターゲットを攻撃したりしたわけではない。受け取った情報と権限に一貫して従っただけである。環境が間違っていたため、実行結果も間違っていた。 これが自律型AIの核心的な課題である。私たちはエージェントが指示に従うかどうかに多くの時間を費やしているが、文脈、データ、または境界が誤っている場合、指示を完璧に従うことも危険である。 セーフティはモデルがどこで行動できるかを記憶することに依存してはならない。ネットワークの物理的隔離、限定的な権限、検証済みのターゲット、トランザクション制限、自動シャットダウン条件など、モデルが無効化できない外部制御が必要である。 未来はミスを一切しないエージェントによって守られるわけではない。 未来は、最終的にはミスをするものだと前提するシステムによって守られる。


