As capacidades de ataque e defesa do GPT-5.6-Sol superam o Claude Mythos 5!
O British AI Safety Institute (AISI) publicou em 17 de julho um relatório de avaliação que, pela primeira vez, quantificou publicamente a lacuna de capacidade de ataque cibernético entre modelos de IA de código aberto e modelos avançados fechados: 4 a 7 meses.

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
No teste interno equivalente do ano passado, essa lacuna era de 6 a 10 meses.
A janela de defesa está se contraindo, enquanto a frente de ataque está acelerando.
Em abril deste ano, o Mythos Preview e o GPT-5.5 causaram o maior salto na capacidade de ataque cibernético desde o início dos testes em 2023, segundo avaliação da AISI, levando governos de vários países a emitirem alertas.
Os modelos de código aberto ainda não replicaram este salto, mas seu ritmo de追赶 é mais rápido do que no ano passado.
4 a 7 meses: Como foi medido, qual a diferença
AISI avalia a capacidade de ataque de rede usando dois sistemas.
O primeiro conjunto consiste em 70 tarefas específicas, abrangendo quatro áreas: pesquisa de vulnerabilidades, engenharia reversa, penetração web e criptografia, classificadas em quatro níveis de dificuldade, desde "não profissionais com fundamento técnico" até "especialistas com mais de dez anos de experiência".

O segundo conjunto é o Cyber Range, que testa a capacidade do modelo de executar automaticamente cadeias de ataque de múltiplos passos em uma rede empresarial simulada. Um cenário de teste chamado «The Last Ones» inclui 32 etapas de ataque, 4 sub-redes e cerca de 20 hosts; a AISI estima que um especialista humano levaria cerca de 20 horas para concluir todas as etapas.

Os dois sistemas chegaram a uma conclusão consistente:
GLM-5.2 (lançado em junho de 2026) apresenta desempenho equivalente ao Opus 4.6 (lançado em fevereiro), com uma diferença de 4 meses;
Empatado com o Opus 4.5 (lançado em novembro do ano passado) no Cyber Range, com uma diferença de 7 meses.
DeepSeek V4-Pro é comparável ao Opus 4.5 em tarefas estreitas, com uma diferença de 5 meses.
Ambas as lacunas são mais estreitas do que os 6 a 10 meses medidos na avaliação interna de 2025.
A diferença de custo é maior do que a diferença de capacidade.
Na mesma teste de Cyber Range (orçamento de 100 milhões de tokens), executar com Opus 4.5 ou 4.6 custa cerca de 85 dólares, com GLM-5.2 cerca de 46 dólares, e com DeepSeek V4-Pro, apenas 1,19 dólares.
Em tarefas estreitas onde ambos os modelos conseguem completar 100%, o Opus 4.6 custa US$ 15,17 por tarefa, enquanto o GLM-5.2 custa US$ 6,12;
Opus 4.5 custa US$12,50, DeepSeek V4-Pro custa US$ 0,28.
Mesma capacidade de ataque, open source é de uma a duas ordens de grandeza mais barato.
As barreiras de segurança dos modelos fechados também não conseguiram criar uma diferença.
No teste AISI, DeepSeek O V4-Pro às vezes recusa tarefas de engenharia reversa, mas pode ser contornado com poucas tentativas.
O Fable 5 da Anthropic é um caso ainda mais extremo: lançado em 9 de junho, três dias depois, o pesquisador de segurança Pliny the Liberator contornou o classificador de segurança com uma estratégia de jailbreak em múltiplos passos; capturas de tela relacionadas mostram que o modelo produziu código de exploração que deveria ter sido bloqueado.
Pesquisadores da Amazon relataram posteriormente independentemente outro método de contorno.
Isso desencadeou diretamente a primeira ordem de controle de exportação do Departamento de Comércio dos EUA voltada para modelos de IA; o Fable 5 ficou offline globalmente por 19 dias, até que a Anthropic implantasse um novo classificador e o serviço fosse restabelecido.
Closed source does not automatically equal security.
O window de defesa está se estreitando e as ferramentas de defesa também estão acelerando
AISI deixou claro no relatório que o tempo de preparação para a defesa foi mais curto do que no ano passado.
O Centro Nacional de Segurança Cibernética do Reino Unido já solicitou que as instituições fortaleçam a base de segurança cibernética e utilizem IA para aprimorar as defesas.
A mesma ferramenta de IA também está acelerando o trabalho de defesa.
O experiente desenvolvedor de programação de rede para jogos, Glenn Fiedler, que escreveu artigos de nível didático por duas décadas na área de programação de rede para jogos, realizou recentemente uma auditoria de segurança sistemática em quatro bibliotecas de código aberto que mantém (yojimbo, netcode, reliable, serialize, com um total de cerca de 6.000 estrelas no GitHub, sendo bibliotecas antigas e bastante influentes no campo dos jogos): implantou objetivos libFuzzer, ativou CI com AddressSanitizer e MemorySanitizer, executou testes de pressão com milhões de iterações e revisou linha por linha do código.

Glenn Fiedler
Foram corrigidas 43 vulnerabilidades de segurança em duas semanas, das quais 27 são acessíveis remotamente pela rede.

O mais grave é um transbordamento de heap remoto no yojimbo que existe desde 2019 — um cliente malicioso pode ativá-lo enviando pacotes especificamente construídos.

O custo total do token da auditoria é de aproximadamente 2500 dólares.

Ambos os lados do ataque e da defesa estão sendo acelerados pela IA, mas de forma assimétrica.
A disseminação da capacidade de ataque é irreversível: uma vez liberados, os pesos de modelos abertos não podem ser recuperados, os guardas de segurança podem ser removidos e cópias podem ser executadas em servidores privados sem supervisão.
A implementação de ferramentas de defesa exige que cada equipe investa ativamente tempo e custos.
Um trecho no relatório da AISI esclarece essa estrutura: "Assim que o código-fonte for liberado, essas opções serão perdidas permanentemente."
The impact of this data on the AGI landscape is more profound than the numbers themselves.
A lacuna de capacidade entre código aberto e código fechado reduziu-se para menos de seis meses; a estratégia padrão de usar o período de exclusividade do código fechado como amortecedor de segurança está prestes a deixar de funcionar.
As barreiras do modelo fechado provaram-se igualmente frágeis no evento Fable 5.
Na próxima fase, a questão central do jogo político para tomadores de decisão globais tornou-se mais aguda: quais níveis de capacidade de modelo não devem ter pesos abertos.
AISI anunciou que continuará avaliando Kimi K3 aguarda o próximo conjunto de modelos de código aberto — onde traçar essa linha depende muito dos resultados dos testes nos próximos meses.
Referências:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI; editor: Marco
