GPT-5.6-Sol supera o Mythos em capacidades de cibersegurança, modelos de código aberto reduzem a lacuna

icon MarsBit
Compartilhar
AI summary iconResumo
Notícias de IA + criptomoeda se espalharam quando o Instituto de Segurança da IA do Reino Unido (AISI) divulgou um relatório em 17 de julho de 2026, mostrando que o GPT-5.6-Sol superou o Claude Mythos 5 em cibersegurança. A lacuna de capacidade agora está entre 4 e 7 meses, reduzida de 6 a 10 meses em 2025. Modelos de código aberto, como GLM-5.2 e DeepSeek V4-Pro, estão fechando essa lacuna mais rapidamente. Uma simulação Cyber Range e 70 tarefas foram utilizadas na avaliação. Modelos de código aberto também oferecem custos mais baixos para tarefas semelhantes. A tendência de atualização da rede é clara.

As capacidades de ataque e defesa do GPT-5.6-Sol superam o Claude Mythos 5!

O British AI Safety Institute (AISI) publicou em 17 de julho um relatório de avaliação que, pela primeira vez, quantificou publicamente a lacuna de capacidade de ataque cibernético entre modelos de IA de código aberto e modelos avançados fechados: 4 a 7 meses.

Modelo de código aberto

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

No teste interno equivalente do ano passado, essa lacuna era de 6 a 10 meses.

A janela de defesa está se contraindo, enquanto a frente de ataque está acelerando.

Em abril deste ano, o Mythos Preview e o GPT-5.5 causaram o maior salto na capacidade de ataque cibernético desde o início dos testes em 2023, segundo avaliação da AISI, levando governos de vários países a emitirem alertas.

Os modelos de código aberto ainda não replicaram este salto, mas seu ritmo de追赶 é mais rápido do que no ano passado.

4 a 7 meses: Como foi medido, qual a diferença

AISI avalia a capacidade de ataque de rede usando dois sistemas.

O primeiro conjunto consiste em 70 tarefas específicas, abrangendo quatro áreas: pesquisa de vulnerabilidades, engenharia reversa, penetração web e criptografia, classificadas em quatro níveis de dificuldade, desde "não profissionais com fundamento técnico" até "especialistas com mais de dez anos de experiência".

Modelo de código aberto

O segundo conjunto é o Cyber Range, que testa a capacidade do modelo de executar automaticamente cadeias de ataque de múltiplos passos em uma rede empresarial simulada. Um cenário de teste chamado «The Last Ones» inclui 32 etapas de ataque, 4 sub-redes e cerca de 20 hosts; a AISI estima que um especialista humano levaria cerca de 20 horas para concluir todas as etapas.

Modelo de código aberto

Os dois sistemas chegaram a uma conclusão consistente:

GLM-5.2 (lançado em junho de 2026) apresenta desempenho equivalente ao Opus 4.6 (lançado em fevereiro), com uma diferença de 4 meses;

Empatado com o Opus 4.5 (lançado em novembro do ano passado) no Cyber Range, com uma diferença de 7 meses.

DeepSeek V4-Pro é comparável ao Opus 4.5 em tarefas estreitas, com uma diferença de 5 meses.

Ambas as lacunas são mais estreitas do que os 6 a 10 meses medidos na avaliação interna de 2025.

A diferença de custo é maior do que a diferença de capacidade.

Na mesma teste de Cyber Range (orçamento de 100 milhões de tokens), executar com Opus 4.5 ou 4.6 custa cerca de 85 dólares, com GLM-5.2 cerca de 46 dólares, e com DeepSeek V4-Pro, apenas 1,19 dólares.

Em tarefas estreitas onde ambos os modelos conseguem completar 100%, o Opus 4.6 custa US$ 15,17 por tarefa, enquanto o GLM-5.2 custa US$ 6,12;

Opus 4.5 custa US$12,50, DeepSeek V4-Pro custa US$ 0,28.

Mesma capacidade de ataque, open source é de uma a duas ordens de grandeza mais barato.

As barreiras de segurança dos modelos fechados também não conseguiram criar uma diferença.

No teste AISI, DeepSeek O V4-Pro às vezes recusa tarefas de engenharia reversa, mas pode ser contornado com poucas tentativas.

O Fable 5 da Anthropic é um caso ainda mais extremo: lançado em 9 de junho, três dias depois, o pesquisador de segurança Pliny the Liberator contornou o classificador de segurança com uma estratégia de jailbreak em múltiplos passos; capturas de tela relacionadas mostram que o modelo produziu código de exploração que deveria ter sido bloqueado.

Pesquisadores da Amazon relataram posteriormente independentemente outro método de contorno.

Isso desencadeou diretamente a primeira ordem de controle de exportação do Departamento de Comércio dos EUA voltada para modelos de IA; o Fable 5 ficou offline globalmente por 19 dias, até que a Anthropic implantasse um novo classificador e o serviço fosse restabelecido.

Closed source does not automatically equal security.

O window de defesa está se estreitando e as ferramentas de defesa também estão acelerando

AISI deixou claro no relatório que o tempo de preparação para a defesa foi mais curto do que no ano passado.

O Centro Nacional de Segurança Cibernética do Reino Unido já solicitou que as instituições fortaleçam a base de segurança cibernética e utilizem IA para aprimorar as defesas.

A mesma ferramenta de IA também está acelerando o trabalho de defesa.

O experiente desenvolvedor de programação de rede para jogos, Glenn Fiedler, que escreveu artigos de nível didático por duas décadas na área de programação de rede para jogos, realizou recentemente uma auditoria de segurança sistemática em quatro bibliotecas de código aberto que mantém (yojimbo, netcode, reliable, serialize, com um total de cerca de 6.000 estrelas no GitHub, sendo bibliotecas antigas e bastante influentes no campo dos jogos): implantou objetivos libFuzzer, ativou CI com AddressSanitizer e MemorySanitizer, executou testes de pressão com milhões de iterações e revisou linha por linha do código.

Modelo de código aberto

Glenn Fiedler

Foram corrigidas 43 vulnerabilidades de segurança em duas semanas, das quais 27 são acessíveis remotamente pela rede.

Modelo de código aberto

O mais grave é um transbordamento de heap remoto no yojimbo que existe desde 2019 — um cliente malicioso pode ativá-lo enviando pacotes especificamente construídos.

Modelo de código aberto

O custo total do token da auditoria é de aproximadamente 2500 dólares.

Modelo de código aberto

Ambos os lados do ataque e da defesa estão sendo acelerados pela IA, mas de forma assimétrica.

A disseminação da capacidade de ataque é irreversível: uma vez liberados, os pesos de modelos abertos não podem ser recuperados, os guardas de segurança podem ser removidos e cópias podem ser executadas em servidores privados sem supervisão.

A implementação de ferramentas de defesa exige que cada equipe investa ativamente tempo e custos.

Um trecho no relatório da AISI esclarece essa estrutura: "Assim que o código-fonte for liberado, essas opções serão perdidas permanentemente."

The impact of this data on the AGI landscape is more profound than the numbers themselves.

A lacuna de capacidade entre código aberto e código fechado reduziu-se para menos de seis meses; a estratégia padrão de usar o período de exclusividade do código fechado como amortecedor de segurança está prestes a deixar de funcionar.

As barreiras do modelo fechado provaram-se igualmente frágeis no evento Fable 5.

Na próxima fase, a questão central do jogo político para tomadores de decisão globais tornou-se mais aguda: quais níveis de capacidade de modelo não devem ter pesos abertos.

AISI anunciou que continuará avaliando Kimi K3 aguarda o próximo conjunto de modelos de código aberto — onde traçar essa linha depende muito dos resultados dos testes nos próximos meses.

Referências:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI; editor: Marco

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.