Un groupe de bénévoles appelé le Bitcoin Red Team vient de mener l’une des audits de sécurité automatisés les plus ambitieux que l’écosystème crypto ait jamais vus. Leur arme de prédilection : Kimi K3, un modèle d’IA à poids ouvert développé par Moonshot AI en Chine. Sur environ 108 heures, le modèle a recensé 7 958 potentialités de failles de sécurité réparties sur 501 projets open source liés au bitcoin, dont 1 280 ont été classées comme ayant une gravité élevée ou critique.
Kimi K3 a surpassé tous les autres modèles à poids ouvert testés, y compris GLM-5.2 de Zhipu, dans les benchmarks standardisés de détection de vulnérabilités.
Ce que l'audit a réellement découvert
Sur les 7 958 problèmes potentiels signalés par Kimi K3, seulement 24,7 % ont pu être reproduits dynamiquement. Au moment du rapport, 29,4 % des constatations avaient été communiquées en amont aux projets concernés.
La découverte la plus importante était une contournement critique de l'authentification à deux facteurs dans la version 2.4.2 de BTCPay Server. La vulnérabilité avait déjà été exploitée pour extraire les identifiants du wallet Lightning avant d'être corrigée, ce qui en fait un incident de sécurité réel et actif, et non une préoccupation théorique.
Comment Kimi K3 se compare
L'Institut britannique de la sécurité de l'IA et son homologue CAISI ont mené une évaluation préliminaire de Kimi K3 en juillet 2026, lui attribuant un score de 32 % sur ExploitBench. Il s'agit d'un benchmark conçu pour mesurer la capacité d'un modèle d'IA à identifier et à raisonner sur les vulnérabilités logicielles exploitables. GLM-5.2 a obtenu 24 % au même test.
Parmi les modèles à poids ouverts, c’est-à-dire dont les poids sont disponibles publiquement pour que quiconque puisse les télécharger et les exécuter, Kimi K3 se place en tête. Le modèle a été publié vers les 16 au 27 juillet 2026, et l’équipe Red Team a intensifié ses efforts d’audit dans les semaines qui ont suivi.
L'écart entre les modèles à poids ouverts et les modèles propriétaires reste important. Les principaux modèles américains d'OpenAI et d'Anthropic ont obtenu en moyenne environ 76 % sur ExploitBench. C'est plus du double du score de Kimi K3.
L'incident Coldcard qui a tout déclenché
Les efforts de l'équipe Rouge ont été catalysés par un incident de sécurité en juillet 2026 impliquant le Coldcard Mk3. Une faille dans le micrologiciel Mk3 a conduit au vol d'environ 594 BTC, estimés à 38 millions de dollars à l'époque. L'incident a suscité de nombreuses spéculations selon lesquelles les attaquants avaient utilisé l'IA pour identifier la vulnérabilité du micrologiciel, bien que cette affirmation n'ait pas été définitivement prouvée.
Ce que cela signifie pour la sécurité du bitcoin
L'économie de l'audit de code est sur le point de changer. Un audit de sécurité professionnel d'un seul projet bitcoin peut coûter des dizaines de milliers de dollars et prendre des semaines. Kimi K3 a analysé 501 projets en 108 heures.
Les entreprises américaines d’IA, qui développent les modèles les plus performants, ont généralement restreint l’utilisation de leurs outils pour la recherche de vulnérabilités, invoquant des préoccupations de sécurité. Parallèlement, un modèle chinois à poids ouvert est déployé librement pour identifier et signaler des bogues dans les infrastructures financières critiques. L’écart de performance entre les modèles à poids ouvert et les modèles propriétaires sur ExploitBench — 32 % contre 76 % — suggère que la détection de vulnérabilités la plus performante reste encore derrière des pare-feux payants.

