O governo dos EUA submeteu o mais novo modelo de IA da China a um teste de hacking. Descobriu-se que o Kimi K3 da Moonshot AI está bem abaixo dos melhores modelos americanos.
O Centro de Padrões e Inovação em IA (CAISI), uma agência dos EUA, realizou os testes com um parceiro britânico. Os resultados foram divulgados apenas um dia depois que Washington acusou a Moonshot de construir o Kimi K3 com tecnologia dos EUA roubada.
Kimi K3 não atende aos padrões cibernéticos dos EUA
O Departamento de Comércio compartilhou os resultados na quinta-feira. Disse que o Kimi K3 ficou bem abaixo dos principais modelos dos EUA, citando um teste conjunto com especialistas britânicos.
Moonshot lançou o Kimi K3 em 16 de julho. A demanda foi tão alta que teve que pausar novas inscrições em dois dias.
O lançamento também abalou as ações de chips dos EUA e gerou novas dúvidas sobre a liderança dos EUA em IA.
Um teste, chamado ExploitBench, utiliza falhas reais do navegador Chrome criadas pela Universidade Carnegie Mellon. O Kimi K3 obteve 32%. Isso superou o GLM-5.2 da China, que atingiu 24%. Mas ficou atrás dos principais modelos dos EUA, que atingiram cerca de 76%.

O passo mais difícil é assumir o controle total de uma máquina-alvo. O Kimi K3 falhou nesse passo em todos os 41 testes. Os melhores modelos dos EUA conseguiram realizar isso em 20.
Outro teste, chamado The Last Ones, é um ataque à rede de uma empresa falsa com 32 etapas. Um especialista humano leva cerca de 20 horas para concluí-lo. O Kimi K3 alcançou, em média, a etapa 17. Os melhores modelos dos EUA alcançaram a etapa 28,5. O Kimi K3 concluiu todo o teste apenas uma vez em 10 tentativas.
Os melhores sistemas dos EUA supostamente o fizeram seis ou sete vezes.
Mas a lacuna pode parecer maior do que é
Mas os números não contam toda a história. O pequeno texto do próprio relatório contém várias armadilhas.
Primeiro, os modelos dos EUA foram testados com seus filtros de segurança desativados. Essa configuração mostra seu pleno poder. As versões públicas mantêm esses filtros ativados. Portanto, os resultados dos EUA representam um cenário ideal, não a realidade.
A equipe também encerrou o trabalho cedo e limitado. Ela avaliou o Kimi K3 em apenas um teste e executou apenas parte do conjunto completo. Portanto, sua classificação é instável. Alguns testes também são privados, então terceiros não podem verificar o trabalho.
Também há uma discrepância básica. O Kimi K3 é um modelo aberto que qualquer um pode baixar. Os modelos dos EUA são sistemas fechados e privados. O instituto do Reino Unido descobriu que modelos abertos geralmente ficam de quatro a sete meses atrás dos melhores modelos fechados. Só fará o teste completo no Kimi K3 após a Moonshot liberá-lo ao público.
Esses testes também não são ataques reais. A rede falsa não tinha defensores humanos nem alarmes para disparar. Mesmo assim, o Kimi K3 superou o último melhor modelo aberto. E ele concluiu o ataque completo uma vez.
O horário e a fonte também levantam questões. O CAISI era anteriormente o Instituto de Segurança da IA dos EUA. A administração Trump renomeou o instituto em junho de 2025. Ele está situado no mesmo departamento que limita as vendas de chips dos EUA à China. E seu relatório sobre um concorrente chinês foi publicado apenas um dia após a alegação de roubo.
Proteções fracas ainda aumentam as apostas
Mesmo assim, pontuações baixas não significam que o Kimi K3 é seguro. O teste descobriu que suas barreiras de segurança não o impediram de tentar criar hacks ou atacar sistemas.
Isso importa por causa do que vem a seguir. A Moonshot planeja lançar o modelo completo em 27 de julho. Uma vez lançado, não poderá ser retirado. Qualquer pessoa pode baixá-lo e remover os filtros de segurança.
O teste também vem após uma alegação de roubo. Washington afirma que a Moonshot construiu o Kimi K3 em tecnologia de IA dos EUA roubada. O chefe de tecnologia da Casa Branca, Michael Kratsios, disse que a empresa copiou secretamente o Claude Fable 5 da Anthropic. O truque, chamado de destilação, treina um novo modelo com as respostas de um modelo mais forte.
A Anthropic sustenta a afirmação. Em fevereiro, ela rastreou mais de 3,4 milhões de conversas do Claude até a Moonshot por meio de centenas de contas falsas. Ela alertou que modelos copiados perdem os controles de segurança do original. Essa é a mesma fraqueza que este teste acabou de identificar.
Os EUA ainda gastam 23 vezes mais em IA do que a China. No entanto, laboratórios chineses continuam reduzindo a lacuna. O verdadeiro teste virá quando o Kimi K3 for lançado e especialistas externos puderem verificar as afirmações por si mesmos.
