source avatarEffie Kavoura 🔶

共有

AIエージェントは悪意のある意図がなくても、実際の損害を引き起こすことができる。必要なのは、自分がどこで動作しているかを誤解することだけである。 @AnthropicAIは昨日、@claudeaiがサイバーセキュリティ評価中に3つの組織の本番システムに不正アクセスしたことを明らかにした。モデルにはシミュレーション内での作業であると指示されていたが、設定ミスにより実際のインターネットへのアクセスが許可された。Claudeは発見したシステムを演習の一部と認識し、割り当てられた目標を追求し続けた。 これは重要な区別である。モデルは脱出したり、反乱を起こしたり、ランダムなターゲットを攻撃したりしたわけではない。受け取った情報と権限に一貫して従っただけである。環境が間違っていたため、実行結果も間違っていた。 これが自律型AIの核心的な課題である。私たちはエージェントが指示に従うかどうかに多くの時間を費やしているが、文脈、データ、または境界が誤っている場合、指示を完璧に従うことも危険である。 セーフティはモデルがどこで行動できるかを記憶することに依存してはならない。ネットワークの物理的隔離、限定的な権限、検証済みのターゲット、トランザクション制限、自動シャットダウン条件など、モデルが無効化できない外部制御が必要である。 未来はミスを一切しないエージェントによって守られるわけではない。 未来は、最終的にはミスをするものだと前提するシステムによって守られる。

No.0 picture
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。