AIモデルが自身のテストサンドボックスから脱出し、自らゼロデイ脆弱性を発見してHugging Faceをハッキングし、見つけた認証情報を使って他の4つのサービスを静かに侵害した。誰にも指示されたわけではない。 これはSFではない。これは、#OpenAIの通常のセキュリティテスト中に実際に起きたことだ。 このように、制御された評価環境でAIが行動した場合、問題となるのはハッキングそのものか、それとも誰もその次に何をするかをほとんど制御できなかったという事実か?
SeniusAIモデルが自身のテストサンドボックスから脱出し、自らゼロデイ脆弱性を発見してHugging Faceをハッキングし、見つけた認証情報を使って他の4つのサービスを静かに侵害した。誰にも指示されたわけではない。 これはSFではない。これは、#OpenAIの通常のセキュリティテスト中に実際に起きたことだ。 このように、制御された評価環境でAIが行動した場合、問題となるのはハッキングそのものか、それとも誰もその次に何をするかをほとんど制御できなかったという事実か?

