一個名為 Bitcoin Red Team 的志願者團隊剛剛完成了加密貨幣生態歷來最雄心勃勃的自動化安全審計之一。他們的首選工具是中國 Moonshot AI 開發的開源權重 AI 模型 Kimi K3。在約 108 小時內,該模型對 501 個與比特幣相關的開源項目進行了審查,發現了 7,958 個潛在的安全問題,其中 1,280 個被評為高或關鍵嚴重性。
Kimi K3 在標準化的漏洞檢測基準測試中,表現優於所有其他開放權重模型,包括智譜的 GLM-5.2。
審計實際發現的內容
在 Kimi K3 標示的 7,958 個潛在問題中,僅有 24.7% 可動態重現。報告時,29.4% 的發現已向上游通報給相關項目。
最具影響力的發現是 BTCPay Server 2.4.2 版本中存在一個關鍵的雙重驗證繞過漏洞。該漏洞在修補前已被利用,以提取 Lightning 錢包憑證,因此這是一起實際發生的安全事件,而非理論上的問題。
Kimi K3 的表現如何
英國的AI安全研究所及其對應機構CAISI於2026年7月對Kimi K3進行了初步評估,在ExploitBench上得分為32%。這是一個用於衡量AI模型識別和推理可利用軟體漏洞能力的基準測試。GLM-5.2在同項測試中得分為24%。
在開放權重模型中,即權重公開供任何人下載和運行的模型,Kimi K3 居於首位。該模型於 2026 年 7 月 16–27 日左右發布,隨後幾週,紅隊加強了審計工作。
開放權重模型與閉源模型之間的差距仍然顯著。OpenAI 和 Anthropic 的領先美國模型在 ExploitBench 上的平均分約為 76%,是 Kimi K3 分數的兩倍以上。
引發一切的 Coldcard 事件
紅隊的行動由2026年7月發生的一起涉及Coldcard Mk3的安全事件所催化。Mk3固件中的一個漏洞導致約594 BTC被盜,當時估計價值3800萬美元。此事件引發了廣泛猜測,認為攻擊者可能使用了AI來識別固件漏洞,但該說法尚未得到確鑿證實。
這對比特幣安全性意味著什麼
代碼審計的經濟模式即將改變。對單一比特幣項目進行專業安全審計的費用可達數萬美元,並需耗時數週。Kimi K3 僅用 108 小時就掃描了 501 個項目。
美國的AI公司雖然開發了最強大的模型,但普遍限制其工具用於漏洞研究,並以安全為由。與此同時,一款開源權重的中國模型正被自由部署,用於發現並報告關鍵金融基礎設施中的漏洞。在ExploitBench上,開源權重模型與閉源模型的表現差距為32%對76%,表明最強大的漏洞檢測能力仍被鎖在API付費牆後。

