Teste cibernético dos EUA mostra que o Kimi K3 está atrasado em relação aos principais modelos de IA americanos

iconBeInCrypto
Compartilhar
AI summary iconResumo
Uma avaliação do governo dos EUA revelou que o Kimi K3, desenvolvido pela Moonshot AI, apresenta desempenho inferior aos principais modelos de IA americanos em capacidades cibernéticas. O teste realizado pelo Center for AI Standards and Innovation (CAISI) com um parceiro britânico mostrou que o Kimi K3 obteve 32% no teste ExploitBench, contra 76% dos principais modelos norte-americanos. Ele não conseguiu controlar totalmente uma máquina-alvo em nenhum dos 41 testes, enquanto os melhores modelos norte-americanos tiveram sucesso em 20. Os resultados surgiram após autoridades dos EUA acusarem a Moonshot de usar tecnologia roubada dos EUA para o Kimi K3. Os resultados podem impactar os esforços de CFT e alinhar-se ao foco do MiCA na transparência tecnológica.

O governo dos EUA submeteu o mais novo modelo de IA da China a um teste de hacking. Descobriu-se que o Kimi K3 da Moonshot AI está bem abaixo dos melhores modelos americanos.

O Centro de Padrões e Inovação em IA (CAISI), uma agência dos EUA, realizou os testes com um parceiro britânico. Os resultados foram divulgados apenas um dia depois que Washington acusou a Moonshot de construir o Kimi K3 com tecnologia dos EUA roubada.

Patrocinado
Patrocinado

Kimi K3 não atende aos padrões cibernéticos dos EUA

O Departamento de Comércio compartilhou os resultados na quinta-feira. Disse que o Kimi K3 ficou bem abaixo dos principais modelos dos EUA, citando um teste conjunto com especialistas britânicos.

Moonshot lançou o Kimi K3 em 16 de julho. A demanda foi tão alta que teve que pausar novas inscrições em dois dias.

O lançamento também abalou as ações de chips dos EUA e gerou novas dúvidas sobre a liderança dos EUA em IA.

Um teste, chamado ExploitBench, utiliza falhas reais do navegador Chrome criadas pela Universidade Carnegie Mellon. O Kimi K3 obteve 32%. Isso superou o GLM-5.2 da China, que atingiu 24%. Mas ficou atrás dos principais modelos dos EUA, que atingiram cerca de 76%.

Capacidade de Desenvolvimento de Exploração
Teste das métricas de capacidade de desenvolvimento de exploração. Fonte: NIST
Patrocinado
Patrocinado

O passo mais difícil é assumir o controle total de uma máquina-alvo. O Kimi K3 falhou nesse passo em todos os 41 testes. Os melhores modelos dos EUA conseguiram realizar isso em 20.

Outro teste, chamado The Last Ones, é um ataque à rede de uma empresa falsa com 32 etapas. Um especialista humano leva cerca de 20 horas para concluí-lo. O Kimi K3 alcançou, em média, a etapa 17. Os melhores modelos dos EUA alcançaram a etapa 28,5. O Kimi K3 concluiu todo o teste apenas uma vez em 10 tentativas.

Os melhores sistemas dos EUA supostamente o fizeram seis ou sete vezes.

Mas a lacuna pode parecer maior do que é

Mas os números não contam toda a história. O pequeno texto do próprio relatório contém várias armadilhas.

Primeiro, os modelos dos EUA foram testados com seus filtros de segurança desativados. Essa configuração mostra seu pleno poder. As versões públicas mantêm esses filtros ativados. Portanto, os resultados dos EUA representam um cenário ideal, não a realidade.

A equipe também encerrou o trabalho cedo e limitado. Ela avaliou o Kimi K3 em apenas um teste e executou apenas parte do conjunto completo. Portanto, sua classificação é instável. Alguns testes também são privados, então terceiros não podem verificar o trabalho.

Também há uma discrepância básica. O Kimi K3 é um modelo aberto que qualquer um pode baixar. Os modelos dos EUA são sistemas fechados e privados. O instituto do Reino Unido descobriu que modelos abertos geralmente ficam de quatro a sete meses atrás dos melhores modelos fechados. Só fará o teste completo no Kimi K3 após a Moonshot liberá-lo ao público.

Esses testes também não são ataques reais. A rede falsa não tinha defensores humanos nem alarmes para disparar. Mesmo assim, o Kimi K3 superou o último melhor modelo aberto. E ele concluiu o ataque completo uma vez.

O horário e a fonte também levantam questões. O CAISI era anteriormente o Instituto de Segurança da IA dos EUA. A administração Trump renomeou o instituto em junho de 2025. Ele está situado no mesmo departamento que limita as vendas de chips dos EUA à China. E seu relatório sobre um concorrente chinês foi publicado apenas um dia após a alegação de roubo.

Proteções fracas ainda aumentam as apostas

Mesmo assim, pontuações baixas não significam que o Kimi K3 é seguro. O teste descobriu que suas barreiras de segurança não o impediram de tentar criar hacks ou atacar sistemas.

Isso importa por causa do que vem a seguir. A Moonshot planeja lançar o modelo completo em 27 de julho. Uma vez lançado, não poderá ser retirado. Qualquer pessoa pode baixá-lo e remover os filtros de segurança.

O teste também vem após uma alegação de roubo. Washington afirma que a Moonshot construiu o Kimi K3 em tecnologia de IA dos EUA roubada. O chefe de tecnologia da Casa Branca, Michael Kratsios, disse que a empresa copiou secretamente o Claude Fable 5 da Anthropic. O truque, chamado de destilação, treina um novo modelo com as respostas de um modelo mais forte.

A Anthropic sustenta a afirmação. Em fevereiro, ela rastreou mais de 3,4 milhões de conversas do Claude até a Moonshot por meio de centenas de contas falsas. Ela alertou que modelos copiados perdem os controles de segurança do original. Essa é a mesma fraqueza que este teste acabou de identificar.

Os EUA ainda gastam 23 vezes mais em IA do que a China. No entanto, laboratórios chineses continuam reduzindo a lacuna. O verdadeiro teste virá quando o Kimi K3 for lançado e especialistas externos puderem verificar as afirmações por si mesmos.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.