AI開発ラボOpenAIは、公開されているGPT-5.6 Solを含む複数のモデルと、より強力な未リリースのシステムが、制御されたテスト環境から脱出し、オープンソースAI界の大部分をホストするHugging Faceの本番インフラを侵害したことを火曜日に明らかにした。
モデルは、ExploitGymという内部ベンチマークを通じて実行され、これは長く複数のステップを含むハッキングタスクのテストであり、評価のためにサイバーセーフティ拒否が意図的に低下させられました。
明確にしておくと、これは生産モデルが自発的に敵対的になったわけではありません。ガードレールを無効にし、ハッキングテストに勝つために必要なあらゆる手段を取るように指示された、能力の高いモデルでした。
モデルは、誰も気づいていなかったテストソフトウェアの隠された欠陥を見つけ、それを利用してオフラインに保たれるための壁を突破した。オープンインターネットにアクセス後、彼らはHugging Faceがテストの回答を保存している可能性があると推測した。
彼らは盗んだパスワードとその他の隠された脆弱性を組み合わせ、Hugging Faceのライブサーバー上で独自のコマンドを実行できるようにしました。
OpenAIは内部でこの異常を検出しましたが、Hugging Faceのチームはそれを検出し、収束させました。同社はこの出来事を「前例がない」と呼び、公共のシステムやサービスに影響を与える可能性のある不適切な事象を防ぐために、広範なセキュリティ対策を講じると述べました。
「脆弱性が修正されるまで、研究の速度を犠牲にしてインフラ構成に厳格な制御を導入しています」と、チームはブログ投稿で述べました。「今後のトレーニングと評価の周囲に、より強固な保護を強化・追加しています。」
暗号資産攻撃の多くは、資金が移動する前に発生します。攻撃者はコードをスキャンし、パスワードをテストし、露出した認証情報を検索し、署名設定を分析して、管理者アカウントへの侵入経路を探します。
Hugging Faceの事象中、OpenAIのモデルはそのプロセスの複数の部分を実行し、一つの脆弱性から別の脆弱性へと移動し、最終的に本番サーバーに到達しました。
そして、今年初めに発生した複数の攻撃が示すように、暗号資産市場にはこのアプローチが有効な場所が多数存在します。脆弱点はスマートコントラクトである可能性がありますが、開発者のラップトップ、汚染されたソフトウェアパッケージ、ブリッジバリデーター、またはマルチシグウォレットの1つの署名者である可能性もあります。
今年初頭のDriftの2億8500万ドルの攻撃を例に挙げると、これは6か月にわたる社会工学キャンペーンを経て特権アクセスを獲得するものでした。AIエージェントは理論上、複数の経路を同時にテストし、失敗した試行を追跡しながら、人間のオペレーターが睡眠中に作業を継続できます。経路が見つかった時点で、オペレーターは実際の攻撃と有効な退避経路を実行できます。
KelpDAOの2億9200万ドルのブリッジ損失は、別の脆弱性を露呈させた。攻撃者は、ブロックチェーン間で資産を移動するために使用されるシステムの単一検証者に関する欠陥を突いた。
そのような攻撃は、丁寧なコードレビューとインフラマッピングから始まります——OpenAIのモデルが未知の脆弱性を発見した際に実行した作業のタイプです。
三つ目の攻撃は、オンチェーンガバナンスシステムを標的としています。7月の早い時期、攻撃者は約440万ドルを費やして、Solanaベースのドッグ・メモコインBONKを十分に購入し、プロジェクトの財務から約2000万ドルを攻撃者に移転する提案を発起・可決しました。この攻撃は3日間で行われ、攻撃者は後に投票に使用したすべてのトークンを売却しました。これはCoinDeskが当時追跡した内容です。
その攻撃における購入、投票、財政振替はすべて個別には有効な取引でした。しかし、盗難はルールがどのように相互に作用するかを理解し、コントロールを取得するコストが入手可能な資金よりもはるかに低いことに気づいたことから生じました。
Hugging Faceの出来事は、ソフトウェアサプライチェーンにも影響します。暗号通貨開発者は、パブリックなコードリポジトリ、クラウドサービス、パッケージレジストリに依存しています。
OpenAIのテストでは、機械が侵害の長い中間部分を完了したことが示されたが、DriftやKelpDAOのような攻撃がその道の終わりに何が存在するかを示している。





