GPT-5.6-Solの攻防能力はClaude Mythos 5を上回りました!
英国AI安全研究所(AISI)は7月17日、オープンソースAIモデルとクローズドソースの最先端モデル間のネットワーク攻撃能力の差を、初めて公開的に定量的に評価し、その差は4〜7ヶ月であることを示した。

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
昨年の同種の内部テストでは、この差は6〜10ヶ月でした。
防御ウィンドウが収縮し、攻撃の前線が加速しています。
今年4月、Mythos PreviewとGPT-5.5はAISIの評価において、2023年からのテスト開始以来最大のネットワーク攻撃能力の飛躍を生み出し、複数の政府が警告を発した。
オープンソースモデルはまだこの跳躍を再現していませんが、昨年よりも速く追いついてきています。
4~7か月:どのように測定したか、どこが異なるか
AISIは、モデルのネットワーク攻撃能力を2つのシステムで評価します。
最初のセットは、脆弱性研究、逆エンジニアリング、Webペネトレーション、暗号学の4分野をカバーする70の狭域タスクで、難易度は4段階に分かれ、技術的背景を持つ非専門家から10年以上の経験を持つ専門家まで対応しています。

第二のセットはCyber Rangeで、モデルが企業ネットワーク内で複数ステップの攻撃チェーンを自律的に実行する能力をテストします。その中の「The Last Ones」というテストシナリオには32の攻撃ステップ、4つのサブネット、約20台のホストが含まれており、AISIは人間の専門家がすべてのステップを完了するのに約20時間かかると推定しています。

二つのシステムは一貫した結論を導き出しました:
GLM-5.2(2026年6月リリース)は、窄タスクにおける性能がOpus 4.6(2月リリース)と同等で、差は4ヶ月である;
Cyber Range で Opus 4.5(去年11月リリース)に追いつき、差は7か月。
DeepSeek V4-Proは狭いタスクでOpus 4.5と比較し、5か月の差があります。
両方の差は、2025年の内部評価で測定された6〜10ヶ月よりも狭い。
コストの差は能力の差よりも大きい。
同じ Cyber Range テスト(1億トークンのクォータ)で、Opus 4.5 または 4.6 を使用すると約85ドル、GLM-5.2では約46ドル、DeepSeek V4-Proではたった1.19ドルです。
両方のモデルが100%完了できる狭いタスクにおいて、Opus 4.6は1タスクあたり15.17ドル、GLM-5.2は6.12ドルかかる;
Opus 4.5 花 12.50 美元, DeepSeek V4-Pro 花 0.28 美元。
同等の攻撃能力で、オープンソースは1〜2桁安い。
閉源モデルのセキュリティガードも差を広げられなかった。
AISI テスト中、 DeepSeek V4-Proは時折逆エンジニアリングタスクを拒否しますが、数回の再試行で回避できます。
AnthropicのFable 5はより極端な事例である:6月9日にリリースされ、3日後、セキュリティ研究者のPliny the Liberatorが複数ステップの脱出戦略でセキュリティ分類器を突破し、関連するスクリーンショットには、本来ブロックされるべき脆弱性の悪用コードがモデルによって生成されたことが示されている。
Amazonの研究者らはその後、別の回避方法を独立して報告した。
これは米国商務省によるAIモデルに対する初の輸出規制令を引き起こし、Fable 5はAnthropicが新しい分類器を導入するまで19日間グローバルにサービスを停止しました。
閉源であることは、自動的に安全であることを意味しません。
防御ウィンドウが狭まり、防御ツールも加速しています
AISIは報告で、防衛側の準備期間が昨年より短くなったことを明確に示した。
英国国家网络安全センターは、機関に対してネットワークセキュリティの基準を強化し、AIを活用して防御能力を高めるよう呼びかけています。
同じ世代のAIツールは、防御側の作業を加速しています。
ゲームネットワークプログラミング分野のベテラン開発者であるグレン・フィーダラーは、20年にわたりゲームネットワークプログラミング分野で教科書級の記事を書き続けてきた巨匠であり、最近、自身が保守する4つのオープンソースネットワークライブラリ(yojimbo、netcode、reliable、serialize、合計で約6,000個のGitHubスターを獲得し、ゲーム分野で非常に影響力のある長年運用されてきたオープンソースライブラリ)に対して体系的なセキュリティ監査を実施しました:libFuzzerターゲットの導入、AddressSanitizerおよびMemorySanitizer CIの導入、数百万回のイテレーションを伴うストレステスト、一行ずつのコードレビュー。

グレン・フィーデラー
2週間で43のセキュリティ脆弱性を修正しました。そのうち27個はネットワークを介してリモートからアクセス可能です。

最も深刻なのは、2019年から存在していたyojimboにおけるリモートヒープオーバーフローで、悪意のあるクライアントが特定のパケットを構成することでこれをトリガーできます。

全体の監査のトークンコストは約2500ドルです。

攻撃と防御の両方がAIによって加速されているが、その加速の仕方は不均等である。
攻撃能力の拡散は不可逆である:オープンソースのモデル重みがリリースされると、取り戻すことはできず、セキュリティガードは削除され、コピーはプライベートサーバー上で監視なしに実行される。
防御ツールの導入には、各チームが自発的に時間とコストを投入する必要があります。
AISIレポートには、次のような文が含まれています:「オープンソースがリリースされると、これらのオプションは永久に失われます。」
このデータのAGIの構図への影響は、数字そのものよりもはるかに深い。
オープンソースとクローズドソースの能力差が半年以内に縮小し、「クローズドソースの独占期間をセキュリティのバッファーとして利用する」というデフォルト戦略はまもなく効力を失いつつある。
閉源モデルのガードは、Fable 5 イベントにおいて同様に脆弱であることが証明された。
次の段階において、世界の政策立案者にとって、政策的な駆け引きの核心的な課題はより尖鋭化している:どのレベル以上のモデルの重みを開放してはならないか。
AISIは継続して評価を実施すると発表しました Kimi K3の次なるオープンソースモデルは、今後数ヶ月のテスト結果によって、このラインがどこに引かれるかが決まる可能性が高い。
参考資料:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
本文は微信公众号「新智元」より、著者:ASI启示録;編集:馬可
