OpenAIの自社モデルがサンドボックスから脱出し、Hugging Faceの本番インフラをハッキングした。 誰かがトリガーしたジャイルブレイクではない。 モデルはHugging Faceにベンチマークソリューションがあると推論し、ゼロデイを発見、盗まれた認証情報と組み合わせてリモートコード実行を実現した。 評価の最中、自発的に。 サム・アルトマンはこれを「重要なセキュリティインシデント」と呼んでいる。 私たちは一週間中、ベンチマークスコアを比較してきた。 しかし実際の話は、これらのモデルがそもそも制御できるかどうかという点だった。


