Un grupo de voluntarios llamado Bitcoin Red Team acaba de realizar una de las auditorías de seguridad automatizadas más ambiciosas que el ecosistema cripto haya visto nunca. Su arma preferida: Kimi K3, un modelo de IA de peso abierto desarrollado por Moonshot AI de China. Durante aproximadamente 108 horas, el modelo catalogó 7.958 hallazgos de seguridad potenciales en 501 proyectos de código abierto relacionados con bitcoin, de los cuales 1.280 se clasificaron como gravedad alta o crítica.
Kimi K3 superó a todos los demás modelos de peso abierto evaluados, incluido el GLM-5.2 de Zhipu, en pruebas estandarizadas de detección de vulnerabilidades.
Lo que realmente encontró la auditoría
De las 7.958 posibles incidencias detectadas por Kimi K3, solo el 24,7% se pudieron reproducir dinámicamente. Al momento del informe, el 29,4% de los hallazgos se habían comunicado aguas arriba a los proyectos afectados.
El descubrimiento más importante fue una vulnerabilidad crítica que permitía eludir la autenticación de dos factores en BTCPay Server versión 2.4.2. La vulnerabilidad ya había sido explotada para extraer credenciales de monederos Lightning antes de que se aplicara el parche, convirtiéndola en un incidente de seguridad real y activo, no solo una preocupación teórica.
Cómo se compara Kimi K3
El Instituto de Seguridad de la IA del Reino Unido y su contraparte CAISI realizaron una evaluación preliminar de Kimi K3 en julio de 2026, otorgándole una puntuación del 32% en ExploitBench. Este es un punto de referencia diseñado para medir la capacidad de un modelo de IA para identificar y razonar sobre vulnerabilidades explotables en software. GLM-5.2 obtuvo un 24% en la misma prueba.
Entre los modelos de peso abierto, aquellos cuyos pesos están disponibles públicamente para que cualquiera los descargue y ejecute, Kimi K3 se encuentra en la cima. El modelo se lanzó alrededor del 16 al 27 de julio de 2026, y el Red Team intensificó sus esfuerzos de auditoría en las semanas siguientes.
La brecha entre los modelos de código abierto y los de código cerrado sigue siendo significativa. Los principales modelos estadounidenses de OpenAI y Anthropic obtuvieron un promedio de alrededor del 76% en ExploitBench. Eso es más del doble de la puntuación de Kimi K3.
El incidente de Coldcard que lo inició todo
El esfuerzo del Equipo Rojo fue catalizado por un incidente de seguridad en julio de 2026 que involucró al Coldcard Mk3. Una falla en el firmware del Mk3 llevó al robo de aproximadamente 594 BTC, valorados en $38 millones en ese momento. El incidente generó especulaciones generalizadas de que los atacantes habían utilizado IA para identificar la vulnerabilidad del firmware, aunque ese reclamo no ha sido probado definitivamente.
Qué significa esto para la seguridad del bitcoin
La economía de la auditoría de código está a punto de cambiar. Una auditoría de seguridad profesional de un solo proyecto de bitcoin puede costar decenas de miles de dólares y llevar semanas. Kimi K3 escaneó 501 proyectos en 108 horas.
Las empresas estadounidenses de IA, que desarrollan los modelos más capaces, han restringido generalmente el uso de sus herramientas para investigación de vulnerabilidades, citando preocupaciones de seguridad. Mientras tanto, un modelo chino de pesos abiertos se está implementando libremente para encontrar y reportar errores en infraestructuras financieras críticas. La brecha en el rendimiento entre modelos de pesos abiertos y de código cerrado en ExploitBench—32% frente a 76%—sugiere que la detección de vulnerabilidades más capaz aún se encuentra detrás de paredes de pago por API.

