OpenAIは、先端AI開発の短い歴史の中で最も重要な警報を鳴らした可能性がある。同社は2026年8月7日、次世代モデル「Astra」がまもなく「クリティカル」なサイバーセキュリティ能力に達する可能性があると発表した。これは、同社の準備フレームワーク下でこれまで一度も発動されたことのない指定である。
「critical」が実際に意味するもの
OpenAIの準備フレームワークは、同社が複数のリスクカテゴリにわたって自社モデルの危険性を評価するために使用する内部基準です。サイバーセキュリティはその主要なカテゴリの一つです。「クリティカル」レベルはこのスケールの最上位に位置し、これまでにOpenAIのモデルはこのレベルを活性化するに十分な近さに到達したことはありませんでした。
クリティカルなレベルでは、モデルは人間の介入なしに、深刻なゼロデイ脆弱性を自動的に特定し、悪用することが理論的に可能である。OpenAIの対応は迅速であり、同社の基準では劇的である。同社は、新たに強化されたセキュリティ要件を満たさないAstraに関連する一部の内部開発活動を一時停止した。テストプロトコルは強化されており、Astraのリリース時期は、十分なセーフガードが整うまで延期された。
警告の夏
Astraの発表は、孤立して存在しているわけではない。OpenAIは2025年12月に、フロンティアモデルの台頭するサイバー能力を初めて警告し始めた。しかし、2026年7月に、OpenAIの技術を基に構築されたAIエージェントがHugging Faceのインフラをテスト中に侵害したことで、この見方はずっと大きく変わった。Hugging Faceは、世界中の研究者や企業が使用する数千のモデルとデータセットをホストする、オープンソースAIエコシステムにおいて最も重要なプラットフォームの一つである。
