撰文:小餅
16 人,27.5 小時,4962 個安全問題,85 個嚴重漏洞,635 個高危漏洞。
這組數字來自一個名為 Bitcoin Red Team 的志願者組織。過去兩天,他們利用 AI 模型對 390 個比特幣開源項目發起了一場地毯式安全審計,平均每小時提交 166 個發現,每人每小時鎖定一個嚴重級別的漏洞。
Calle,Cashu 協議的創始人,在 X 上公布了首份戰報,開頭四個字概括了局勢:「情況極其糟糕。」
但真正令人不安的,不是數字本身。
4 萬美元和一場消防演習
這場審計並非無端發起。
一周前,比特幣生態剛經歷了硬體錢包歷史上最大的安全事件。Coldcard 錢包因 2021 年一次固件更新中的隨機數生成器缺陷,導致私鑰可被離線推算。攻擊者從 7 月 30 日起分四波洗劫了超過 5200 個地址,Galaxy Research 的追蹤數據顯示損失約 1816 枚 BTC,按當時價格計算超過 1.16 億美元。
這個 Bug 在公開代碼中靜靜躺了五年,任何人都可以審計,但幾乎沒有人系統性地檢查過。
Coldcard 事件是導火線。Calle 和 AnchorWatch 執行長 Rob Hamilton 迅速組建了 Red Team,從 OpenSats 獲取資金,在 AI 算力上耗費了超過 4 萬美元。他們使用的模型包括月之暗面的 Kimi K3、OpenAI 的 GPT Sol、Anthropic 的 Fable 和 Opus,以及智譜的 GLM5.2。
在項目初期,OpenAI 和 Anthropic 的模型訪問受限,團隊主要依賴中國的開源模型。這個細節本身就頗為有趣:守護全球最大加密資產基礎設施安全的,竟是一群志願者手持中國開源 AI 通宵作戰。
27.5 小時後的數據拼圖如下:在 4962 個問題中,14.5% 屬於高危或嚴重級別,平均每個項目命中 1.85 個嚴重問題。隱私和 CoinJoin 類工具的嚴重發現占比最高,達 24%;其次是交易所和互換協議,21%;密碼學庫和 SDK 產出了最多的原始發現量(1101 個),但嚴重占比僅為 10%。91% 的發現通過自動化掃描提交,21% 已在本地環境中使用概念驗證代碼復現。
Among the 17 contributors, 14 are humans and 3 are automated systems.
瓶頸已經翻轉
Rob Hamilton 在 X 上寫了一句話,比所有數字都重要:「最困難的部分不是找到 Bug,是把它們送到對的人手裡。」
在傳統安全研究的世界裡,「發現」是最昂貴的環節。一個頂級安全研究員可能花上幾週時間逆向一段代碼,找到一個可利用的漏洞。AI 將這個成本壓至接近零。16 個人配合 AI 模型,一天的產出相當於一家審計公司幾個月的工作量。
問題出現在發現之後。截至戰報發布時,390 個被審計項目中只有 19 個(不到 5%)完成了上游披露。Calle 在推文中向維護者道歉,表示知道報告潮湧增加了他們的壓力,團隊仍在學習如何過濾噪音。8 個發現已被撤回為誤報。
這是一場結構性的變革:AI 已將「找 Bug」變成近乎免費的行為,整個安全流程的瓶頸從最上游的發現環節,瞬間轉移到了中下游:驗證、分類、路由至正確的維護者、修復、測試、部署補丁。這些環節仍高度依賴人工,仍顯緩慢,仍顯混亂。
這正是攻擊者所具備的結構性優勢。
不對稱的軍備競賽
防禦者需要完成一條完整的鏈路:發現漏洞 → 驗證 → 負責任披露 → 等待維護者確認 → 修復 → 推送補丁 → 用戶更新。每一步都存在摩擦與延遲。
攻擊者只需:發現漏洞→利用。
AI 讓鏈路的起點對雙方都變得廉價。但後續步驟的不對稱性,意味著這場軍備競賽天然有利於進攻方。Coldcard 的案例就是明證:一個 2021 年的 Bug 在程式碼庫中公開存放了五年,防禦者沒有系統性掃描,攻擊者用 AI 找到了可預測的密鑰空間,41 分鐘掃走 1083 枚 BTC。
更大的信號已經出現。今年 4 月,Anthropic 向外界展示了 Claude Mythos Preview,這是一個因安全風險過高而被拒絕公開發布的 AI 模型。根據 Anthropic 的說明,Mythos 僅需不到 50 美元的算力成本即可鎖定單一漏洞,其團隊利用它自主發現了 OpenBSD 操作系統中一個存在了 27 年的缺陷。OpenBSD 是全球公認安全性最高的操作系統之一,廣泛用於運行防火牆和關鍵基礎設施。因此,Anthropic 啟動了 Project Glasswing 計畫,聯合 AWS、蘋果、微軟、谷歌等約 40 家機構,利用該模型在攻擊者之前修補漏洞。
5 月,Google 威脅情報團隊公布另一個里程碑:他們截獲了一個犯罪團伙利用 AI 模型發現零日漏洞並編寫利用代碼的案例。該漏洞是一個雙因素認證繞過,嵌入在一個廣泛使用的開源管理工具中。Google 透過代碼中的 AI 特徵(虛構的 CVSS 評分、教科書式的 Python 註釋)識別了攻擊來源,並在犯罪團伙發起大規模利用之前與廠商合作完成修補。
Google 威脅情報首席分析師 John Hultquist 的話毫無餘地:「認為 AI 漏洞軍備競賽即將來臨的觀點是一種誤判。現實是,這場競賽已經開始了。」
開源並不等於已通過審計
Ledger 首席技術官 Charles Guillemet 在評價 Coldcard 事件時說了一句被廣泛引用的話:「開源和被審查過,是兩回事。」
這句話戳破了加密行業長期存在的認知泡沫。比特幣社區對開源懷有近乎宗教般的信仰,認為代碼公開意味著任何人都可以檢查,因此天然安全。Coldcard 的代碼確實公開了五年。Red Team 的審計涵蓋了 390 個項目。這兩個事實放在一起,畫面非常清晰:可審計並不等於已審計。
Red Team 的經驗也暴露了 AI 安全審計的局限。Calle 說,團隊的大部分工作仍然是「手動引導 AI」,讓每個人以自己偏好的方式提示模型,結果比統一方法覆蓋面更廣。這說明當前的 AI 安全審計更接近「人類專家駕駛 AI 工具」而非「AI 自主巡邏」。模型能快速掃描代碼模式,但判斷一個發現是否真正可利用、影響範圍有多大、該通知誰,仍然需要人類的經驗和判斷。
Hamilton 表示,團隊計劃將審計框架開源,讓比特幣公司可以對自己的閉源代碼運行相同的掃描。這是正確的方向,但也意味著同樣的工具必然會落入攻擊者手中。
這場審計真正揭示的,是一個正在形成的新等式:
AI 讓發現漏洞的成本趨近於零。但修復漏洞的成本(組織協調、人力投入、用戶遷移)依然昂貴且緩慢。
4 萬美元的 AI 算力,27.5 小時,就能把一個管理著數千億美元資產的開源生態翻個底朝天。Coldcard 五年無人關注的 Bug,被攻擊者找到後 41 分鐘捲走 1.16 億美元。
比特幣的安全敘事正在被重寫。
過去的邏輯是:「程式碼是開源的,所以是安全的。」新的邏輯更殘酷:「程式碼是開源的,所以攻擊者也在用 AI 掃描它。」
防禦者唯一的優勢是先手,在攻擊者之前找到並修補漏洞。Red Team 正在爭奪這個先手,但他們的戰報也說明,即使拿到了先手,後續的補丁分發鏈路仍然是生態最薄弱的環節。
比特幣面臨的困境,可能只是一場更大變局的預演。整個開源軟體世界都即將迎來同樣的拷問:當發現 Bug 不再需要專家,修復 Bug 仍然需要,這個落差要靠什麼來填?

