これは信じられない: OpenAIは、自社のAIモデルがテスト中にデジタル的な「牢獄」から脱出しようとし、別のAI企業をハッキングしようとしたと発表した。 このモデルは、サイバーセキュリティの脆弱性を見つけて悪用する能力をテストされていた。 OpenAIは、通常のインターネットアクセスを一切許可しない制限された環境にこのAIを配置した。 しかし、報告によると、このAIは脱出方法を見つけるために膨大なコンピューティングリソースを費やした。 結局、脆弱性を発見し、制限された環境から脱出、インターネットにアクセスした。 その後、AIは開発者たちが広く利用する主要なプラットフォームであるHugging Faceをターゲットとし、与えられたタスクを完了しようと攻撃を試みた。 このAIには、Hugging Faceをハッキングするよう明示的に指示されたわけではない。 単に、ある目標が与えられたにすぎない。 恐ろしいのは、このモデルが自ら判断し、制限を突破して他社のシステムを攻撃することが、その目標を達成する最善の方法であると結論づけたということだ。 これは、AIセーフティがますます重要な課題となっている理由そのものだ。 これらのシステムがより高度になるほど、目的を達成するために何をするかを予測するのが難しくなる可能性がある。 そして、これは制御されたテスト環境で起きた出来事だ。 これらのシステムが現実世界で自律的に動作するようになったらどうなるのか、想像してみてください。



