「Bitcoin Red Team」というボランティアグループが、暗号資産エコシステムでこれまでで最も野心的な自動セキュリティ監査を実施しました。彼らの選んだツールは、中国のMoonshot AIが開発したオープンウェイトのAIモデル「Kimi K3」です。約108時間の間に、このモデルはBitcoin関連の501のオープンソースプロジェクトにおいて7,958件の潜在的なセキュリティ問題を特定し、そのうち1,280件が高または重大な深刻度と評価されました。
Kimi K3は、ZhipuのGLM-5.2を含む、標準化された脆弱性検出ベンチマークで、他のすべてのオープンウェイトモデルを上回りました。
監査が実際に発見した内容
Kimi K3がフラグした7,958件の潜在的課題のうち、動的に再現できたのは24.7%に過ぎませんでした。報告時点では、発見された問題の29.4%が関連プロジェクトに上流で通知されています。
最も重要な発見は、BTCPay Serverバージョン2.4.2における重要な2要素認証のバイパス脆弱性でした。この脆弱性はパッチが適用される前に既に悪用され、Lightningウォレットの認証情報が抽出されており、理論上の懸念ではなく、実際に発生したセキュリティインシデントでした。
Kimi K3の比較
2026年7月、英国のAI安全研究所とその対応機関CAISIは、Kimi K3の予備評価を実施し、ExploitBenchで32%のスコアを記録しました。これは、AIモデルが悪用可能なソフトウェア脆弱性を特定し、その理由を論じる能力を測定するために設計されたベンチマークです。GLM-5.2は同じテストで24%のスコアを獲得しました。
オープンウェイトモデル、つまりその重みが誰でもダウンロードして実行できるように公開されているモデルの中で、Kimi K3は最上位に位置しています。このモデルは2026年7月16日〜27日頃にリリースされ、その後数週間でRed Teamは監査活動を強化しました。
オープンウェイトモデルとクローズドソースモデルの間の差は依然として大きい。OpenAIおよびAnthropicが開発する米国トップモデルのExploitBenchでの平均スコアは約76%であり、これはKimi K3のスコアの2倍以上である。
すべての始まりとなったColdcardの出来事
2026年7月のColdcard Mk3に関するセキュリティインシデントが、レッドチームの活動を促進した。Mk3のファームウェアに存在した脆弱性により、当時約3800万ドルと評価された594 BTCが盗まれた。このインシデントを受けて、攻撃者がAIを用いてファームウェアの脆弱性を特定したという広範な推測が広まったが、その主張は未だ決定的に証明されていない。
これがBitcoinのセキュリティに与える意味
コード監査の経済性が変わろうとしています。1つのBitcoinプロジェクトのプロフェッショナルなセキュリティ監査には数万ドルの費用と数週間の時間がかかります。Kimi K3は501のプロジェクトを108時間でスキャンしました。
最も能力の高いモデルを構築する米国のAI企業は、安全性の懸念を理由に、自社のツールが脆弱性研究に使用されることを一般的に制限している。一方で、オープンウェイトの中国製モデルは、重要な金融インフラのバグを発見・報告するために自由に展開されている。ExploitBenchにおけるオープンウェイトモデルとクローズドソースモデルの性能差(32%対76%)は、最も優れた脆弱性検出機能が依然としてAPIの有料アクセス制限の背後にあることを示唆している。

