El gobierno de EE. UU. sometió al modelo de IA más reciente de China a una prueba de hacking. Descubrió que Kimi K3 de Moonshot AI está muy por debajo de los mejores modelos estadounidenses.
El Centro de Normas e Innovación en IA (CAISI), una agencia estadounidense, realizó las pruebas con un socio británico. Los resultados se conocieron un día después de que Washington acusara a Moonshot de haber desarrollado Kimi K3 con tecnología estadounidense robada.
Kimi K3 no cumple con los estándares cibernéticos de EE. UU.
El Departamento de Comercio compartió los resultados el jueves. Dijo que Kimi K3 se ubicó mucho por debajo de los modelos estadounidenses principales, citando una prueba conjunta test con expertos británicos.
Moonshot lanzó Kimi K3 el 16 de julio. La demanda fue tan alta que tuvo que pausar los nuevos registros en dos días.
El lanzamiento también afectó las acciones de chips de EE.UU. y generó nuevas dudas sobre el liderazgo de EE.UU. en IA.
Una prueba, llamada ExploitBench, utiliza errores reales del navegador Chrome desarrollados por la Universidad Carnegie Mellon. Kimi K3 obtuvo un 32%. Esto superó al GLM-5.2 de China, que obtuvo un 24%. Pero quedó por detrás de los mejores modelos estadounidenses, que alcanzaron aproximadamente un 76%.

El paso más difícil es tomar el control total de una máquina objetivo. Kimi K3 falló en ese paso en las 41 pruebas. Los mejores modelos estadounidenses lo lograron en 20.
Otra prueba, llamada The Last Ones, es un ataque simulado a una red empresarial con 32 pasos. Un experto humano necesita aproximadamente 20 horas para completarla. Kimi K3 alcanzó el paso 17 en promedio. Los mejores modelos de EE. UU. alcanzaron el paso 28.5. Kimi K3 completó toda la prueba solo una vez en 10 intentos.
Los mejores sistemas estadounidenses supuestamente lo hicieron seis o siete veces.
Pero la brecha puede parecer más grande de lo que es
Pero los números no cuentan toda la historia. Las cláusulas pequeñas del informe contienen varias condiciones.
Primero, se probaron los modelos estadounidenses con sus filtros de seguridad desactivados. Esa configuración muestra su pleno poder. Las versiones públicas mantienen esos filtros activados. Por lo tanto, los puntajes estadounidenses representan un escenario óptimo, no la realidad.
El equipo también finalizó el trabajo temprano y de forma limitada. Evaluó a Kimi K3 en solo una prueba y ejecutó solo parte del conjunto completo. Por lo tanto, su calificación es insegura. Algunas pruebas son privadas, por lo que los externos no pueden verificar el trabajo.
También existe una discrepancia básica. Kimi K3 es un modelo abierto que cualquiera puede descargar. Los modelos estadounidenses son sistemas cerrados y privados. El instituto del Reino Unido encontró que los modelos abiertos generalmente van de cuatro a siete meses rezagados respecto a los mejores cerrados. Solo le dará a Kimi K3 la prueba completa después de que Moonshot lo libere al público.
Estas pruebas tampoco son ataques reales. La red falsa no tenía defensores humanos ni alarmas que activar. Aun así, Kimi K3 superó al último modelo abierto líder. Y sí completó el ataque completo una vez.
El horario y la fuente también generan preguntas. CAISI solía ser el Instituto de Seguridad de la IA de EE.UU. La administración Trump lo renombró en junio de 2025. Se encuentra en el mismo departamento que limita las ventas de chips de EE.UU. a China. Y su informe sobre un competidor chino llegó justo un día después de la acusación de robo.
Protecciones débiles aún aumentan las apuestas
Sin embargo, puntajes bajos no significan que Kimi K3 sea seguro. La prueba encontró que sus límites no impidieron que intentara construir exploits o atacar sistemas.
Eso importa por lo que viene a continuación. Moonshot planea lanzar el modelo completo el 27 de julio. Una vez que esté disponible, no se podrá retirar. Cualquiera puede descargarlo y eliminar los filtros de seguridad.
La prueba también llega tras una acusación de robo. Washington afirma que Moonshot construyó Kimi K3 sobre tecnología estadounidense de IA robada. El jefe tecnológico de la Casa Blanca, Michael Kratsios, dijo que la empresa copió en secreto el Claude Fable 5 de Anthropic. El truco, llamado destilación, entrena un nuevo modelo con las respuestas de uno más potente.
Anthropic respalda la afirmación. En febrero, rastreó más de 3,4 millones de chats de Claude a Moonshot a través de cientos de cuentas falsas. Advertió que los modelos copiados pierden los controles de seguridad del original. Ese es el mismo punto débil que esta prueba acaba de encontrar.
EE.UU. aún gasta 23 veces más en IA que China. Sin embargo, los laboratorios chinos siguen reduciendo la brecha. La verdadera prueba llegará cuando Kimi K3 se haga pública y expertos externos puedan verificar las afirmaciones por sí mismos.
