Pesquisadores de cibersegurança descobriram vulnerabilidades significativas em modelos da Anthropic e da OpenAI, e os efeitos já chegaram aos níveis mais altos do governo dos EUA.
Um relatório da FAR.AI testou diversos modelos de ponta, incluindo o Claude Opus 4.8 da Anthropic, o Fable 5 e o GPT 5.5 e 5.6 da OpenAI, e constatou que eles são suscetíveis a ataques de jailbreak projetados para extrair saídas genuinamente perigosas, incluindo código exploratório, informações sobre armas químicas e detalhes sobre armas biológicas.
Os números contam uma história condenatória
Os modelos da Anthropic e da OpenAI não foram os piores desempenhos. Essa distinção pertence aos modelos Grok da xAI, que registraram 448 instâncias de jailbreaks automatizados bem-sucedidos. Os modelos Gemini da Google vieram em segundo lugar com 249 instâncias. Os modelos Claude, Fable e da série GPT mostraram resistência comparativamente maior ao jailbreak.
Em junho de 2026, o Departamento de Comércio restringiu o acesso estrangeiro aos modelos Fable 5 e Mythos 5 da Anthropic após a aparição de uma técnica de jailbreak relatada. A Casa Branca também solicitou que a OpenAI e a Anthropic adiem o lançamento de certos modelos futuros para que o governo possa avaliar adequadamente os riscos de cibersegurança.
Exploração ligada à China aumenta a urgência
Relatórios indicam que entidades ligadas à China já exploraram os modelos da Anthropic para automatizar ataques cibernéticos contra mais de 30 alvos. A técnica envolve prompts elaborados projetados para contornar as barreiras existentes.
O governo dos EUA citou explicitamente esses riscos à segurança nacional, apontando para o potencial de modelos de IA gerarem explorações de software e informações relacionadas a armas quando suas barreiras de segurança falham. A resposta da Anthropic foi rotular as vulnerabilidades como “estreitas”, sugerindo que representam casos extremos em vez de falhas sistêmicas.
O que isso significa para investidores e o mercado de IA
Controles de exportação, atrasos obrigatórios na liberação e críticas públicas do governo representam um ambiente operacional fundamentalmente diferente para empresas de IA de ponta. A segurança está se tornando um pré-requisito para permitir a implantação de modelos, traduzindo-se diretamente em custos operacionais mais altos, prazos de desenvolvimento mais longos e potencialmente mercados-alvo menores, se certos modelos não puderem ser vendidos internacionalmente.
Os números significativamente piores de jailbreak do Grok — 448 instâncias em comparação com os valores comparativamente mais baixos para as variantes de Claude e GPT — sugerem que a xAI pode enfrentar obstáculos regulatórios mais intensos. O Google Gemini, com 249 instâncias, encontra-se em uma posição intermediária desconfortável.
Modelos de IA estão cada vez mais integrados em sistemas de negociação, auditoria de contratos inteligentes e infraestrutura DeFi. Um modelo de IA jailbroken incorporado em ferramentas financeiras representa um vetor de risco sistêmico que pode se propagar por mercados digitais interconectados de maneiras que os reguladores estão apenas começando a compreender.
