Um grupo de voluntários chamado Bitcoin Red Team realizou recentemente uma das auditorias de segurança automatizadas mais ambiciosas já vistas no ecossistema cripto. Sua arma escolhida: o Kimi K3, um modelo de IA de peso aberto desenvolvido pela Moonshot AI da China. Ao longo de aproximadamente 108 horas, o modelo catalogou 7.958 possíveis vulnerabilidades de segurança em 501 projetos de código aberto relacionados ao bitcoin, sendo 1.280 classificadas como gravidade alta ou crítica.
O Kimi K3 superou todos os outros modelos de peso aberto testados, incluindo o GLM-5.2 da Zhipu, em benchmarks padronizados de detecção de vulnerabilidades.
O que a auditoria realmente encontrou
Das 7.958 possíveis falhas sinalizadas pelo Kimi K3, apenas 24,7% puderam ser reproduzidas dinamicamente. No momento do relatório, 29,4% das descobertas haviam sido comunicadas aos projetos afetados.
A descoberta mais significativa foi uma vulnerabilidade crítica de contorno da autenticação de dois fatores na versão 2.4.2 do BTCPay Server. A vulnerabilidade já havia sido explorada para extrair credenciais de carteira Lightning antes de ser corrigida, tornando-a um incidente de segurança real e ativo, e não apenas uma preocupação teórica.
Como o Kimi K3 se compara
O Instituto de Segurança da IA do Reino Unido e seu homólogo CAISI realizaram uma avaliação preliminar do Kimi K3 em julho de 2026, atribuindo-lhe 32% no ExploitBench. Esse é um benchmark projetado para medir a capacidade de um modelo de IA de identificar e raciocinar sobre vulnerabilidades exploráveis em software. O GLM-5.2 obteve 24% no mesmo teste.
Entre modelos de peso aberto, aqueles cujos pesos estão disponíveis publicamente para qualquer um baixar e executar, o Kimi K3 está no topo. O modelo foi lançado por volta de 16 a 27 de julho de 2026, e a Red Team intensificou seus esforços de auditoria nas semanas seguintes.
A lacuna entre modelos de código aberto e de código fechado permanece significativa. Os principais modelos dos EUA da OpenAI e da Anthropic obtiveram uma média de cerca de 76% no ExploitBench. Isso é mais do que o dobro da pontuação do Kimi K3.
O incidente do Coldcard que iniciou tudo
O esforço da Equipe Vermelha foi catalisado por um incidente de segurança em julho de 2026 envolvendo o Coldcard Mk3. Uma falha no firmware do Mk3 levou ao roubo de aproximadamente 594 BTC, estimados em US$ 38 milhões na época. O incidente gerou especulações generalizadas de que os atacantes haviam usado IA para identificar a vulnerabilidade no firmware, embora essa afirmação não tenha sido definitivamente comprovada.
O que isso significa para a segurança do bitcoin
A economia da auditoria de código está prestes a mudar. Uma auditoria de segurança profissional de um único projeto de bitcoin pode custar dezenas de milhares de dólares e levar semanas. O Kimi K3 escaneou 501 projetos em 108 horas.
Empresas de IA dos EUA, que desenvolvem os modelos mais capazes, geralmente restringiram o uso de suas ferramentas para pesquisa de vulnerabilidades, citando preocupações de segurança. Enquanto isso, um modelo chinês de peso aberto está sendo amplamente implantado para encontrar e relatar falhas na infraestrutura financeira crítica. A lacuna entre o desempenho de modelos de peso aberto e fechado no ExploitBench — 32% contra 76% — sugere que a detecção de vulnerabilidades mais capaz ainda permanece atrás de paredes de pagamento por API.

