GPT-5.6-Sol 在網路安全能力上優於 Mythos,開源模型逐漸縮小差距

icon MarsBit
分享
AI summary icon精華摘要
AI 與加密貨幣新聞於 2026 年 7 月 17 日爆發,英國 AI 安全研究所(AISI)發布報告顯示,GPT-5.6-Sol 在網路安全方面表現優於 Claude Mythos 5。能力差距已從 2025 年的 6 至 10 個月縮小至 4 至 7 個月。GLM-5.2 和 DeepSeek V4-Pro 等開源模型正在更快地縮小這一差距。評估採用了網路模擬環境與 70 項任務。開源模型在類似任務上也提供更低的成本。網路升級趨勢已十分明確。

GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!

英國 AI 安全研究所(AISI)於 7 月 17 日發布了一份評估報告,首次公開量化了開源 AI 模型與閉源前沿模型在網絡攻擊能力上的差距:4 到 7 個月。

開源模型

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

在去年的同類內部測試中,這個差距是 6 到 10 個月。

防禦窗口正在收縮,而攻擊前沿正在加速。

今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的評估中製造了自 2023 年開始測試以來最大的一次網絡攻擊能力飛躍,多國政府隨即發出警告。

開源模型尚未複現這次跳躍,但它們的追趕速度比去年更快了。

4 到 7 個月:怎麼測的,差在哪

AISI uses two sets of systems to evaluate the network attack capabilities of models.

第一套是 70 項窄任務,覆蓋漏洞研究、逆向工程、Web 渗透、密碼學四個方向,按難度分四級,從「有技術背景的非專業人士」到「十年以上經驗的專家」。

開源模型

第二套是 Cyber Range,在模擬企業網路中測試模型自主執行多步驟攻擊鏈的能力。其中一個名為「The Last Ones」的測試場景包含 32 個攻擊步驟、4 個子網、約 20 台主機,AISI 評估人類專家完成全部步驟需要約 20 小時。

開源模型

兩套體系給出了一致的結論:

GLM-5.2(2026 年 6 月發布)在窄任務上的表現與 Opus 4.6(2 月發布)相當,差距 4 個月;

在 Cyber Range 上追平 Opus 4.5(去年 11 月發布),差距 7 個月。

DeepSeek V4-Pro 在窄任務上對標 Opus 4.5,差距 5 個月。

兩個差距都比 2025 年內部評估中測到的 6 到 10 個月更窄。

成本差距比能力差距更大。

同一場 Cyber Range 測試(1 億 Token 額度),用 Opus 4.5 或 4.6 跑一次約 85 美元,用 GLM-5.2 約 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。

在兩個模型都能 100% 完成的窄任務上,Opus 4.6 每個任務花 15.17 美元,GLM-5.2 花 6.12 美元;

Opus 4.5 花費 12.50 美元, DeepSeek V4-Pro 花費 0.28 美元。

同等攻擊能力,開源便宜一到兩個數量級。

Closed-source models' safety safeguards also failed to create a gap.

AISI 測試中, DeepSeek V4-Pro 偶爾拒絕逆向工程類任務,但靠少量重試也能繞過。

Anthropic 的 Fable 5 是一個更極端的案例:6 月 9 日發布,三天後安全研究者 Pliny the Liberator 使用多步驟越獄策略突破了安全分類器,相關截圖顯示模型產出了本應被攔截的漏洞利用代碼。

Amazon 研究員隨後獨立報告了另一種繞過方法。

這直接觸發了美國商務部首個針對 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分類器才恢復上線。

Closed source does not automatically equal security.

防禦窗口收窄,防禦工具也在加速

AISI 在報告中明確了政策信號:防禦方的準備時間比去年更短。

英國國家網路安全中心已呼籲各機構加強網路安全基線,並利用 AI 增強防禦能力。

Same-generation AI tools are also accelerating work on the defense side.

遊戲網絡編程領域的資深開發者 Glenn Fiedler,是在該領域撰寫了二十年教科書級文章的大佬,最近使用 Claude Code 對其維護的四個開源網絡庫(yojimbo、netcode、reliable、serialize,合計約 6000 個 GitHub Star,在遊戲領域已屬相當有影響力的老牌開源大庫)進行了系統性安全審計:部署 libFuzzer 目標、上線 AddressSanitizer 和 MemorySanitizer CI、執行數百萬次迭代的壓力測試、逐行代碼審查。

開源模型

Glenn Fiedler

在兩週內修復了 43 個安全漏洞,其中 27 個可從網絡遠程觸達。

開源模型

最嚴重的是 yojimbo 中一個自 2019 年就存在的遠程堆溢出——惡意客戶端可以通過構造特定數據包觸發它。

開源模型

整個審計的 Token 成本約 2500 美元。

開源模型

攻防兩端都在被 AI 加速,但加速方式不對稱。

攻擊能力的擴散是不可逆的:開源模型權重一旦釋出,就無法收回,安全護欄可以被移除,副本可以在私有伺服器上不受監控地運行。

而防禦工具的部署需要每個團隊主動投入時間和成本。

The AISI report states: "Once the open source is released, these options are permanently lost."

The impact of this data on the AGI landscape is more profound than the numbers themselves.

開源與閉源的能力差距已縮小至半年以內,「以閉源獨佔期作為安全緩衝」的默認策略即將失效。

閉源模型的防護在 Fable 5 事件中同樣被證明脆弱。

下一階段對於全球的決策者而言,政策博弈的核心問題已經變得更尖銳:什麼能力級別以上的模型不應開放權重。

AISI 宣布將繼續評估 Kimi K3 的下一批開源模型——這條線畫在哪裡,很可能取決於未來幾個月的測試結果。

參考資料:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

本文來自微信公眾號「新智元」,作者:ASI啟示錄;編輯:馬可

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露