GPT-5.6-Sol supera a Mythos en capacidades de ciberseguridad, los modelos de código abierto reducen la brecha

icon MarsBit
Compartir
AI summary iconResumen
Las noticias de IA + cripto se volvieron virales cuando el Instituto de Seguridad de la IA del Reino Unido (AISI) publicó un informe el 17 de julio de 2026, mostrando que GPT-5.6-Sol superó a Claude Mythos 5 en ciberseguridad. La brecha de capacidad ahora es de 4 a 7 meses, frente a 6 a 10 meses en 2025. Modelos de código abierto como GLM-5.2 y DeepSeek V4-Pro están cerrando esta brecha más rápidamente. Se utilizaron una simulación de Cyber Range y 70 tareas en la evaluación. Los modelos de código abierto también ofrecen costos más bajos para tareas similares. La tendencia hacia la actualización de la red es clara.

Las capacidades ofensivas y defensivas de GPT-5.6-Sol superan a las de Claude Mythos 5.

El British AI Safety Institute (AISI) publicó el 17 de julio un informe de evaluación que, por primera vez, cuantificó públicamente la brecha en capacidades de ataque cibernético entre modelos de IA de código abierto y modelos de vanguardia cerrados: de 4 a 7 meses.

Modelo de código abierto

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

En las pruebas internas similares del año pasado, esta brecha fue de 6 a 10 meses.

La ventana de defensa se está reduciendo, mientras que la línea de ataque se acelera.

En abril de este año, Mythos Preview y GPT-5.5 lograron el mayor salto en capacidad de ataque cibernético desde que comenzaron las pruebas en 2023, según la evaluación de AISI, lo que llevó a gobiernos de varios países a emitir advertencias.

Los modelos de código abierto aún no han replicado este salto, pero su ritmo de追赶 es más rápido que el año pasado.

4 a 7 meses: ¿Cómo se midió, en qué difiere?

AISI utiliza dos sistemas para evaluar la capacidad de ataque de red de los modelos.

El primer conjunto consta de 70 tareas específicas que cubren cuatro áreas: investigación de vulnerabilidades, ingeniería inversa, penetración web y criptografía, clasificadas en cuatro niveles de dificultad, desde "no profesionales con antecedentes técnicos" hasta "expertos con más de diez años de experiencia".

Modelo de código abierto

El segundo conjunto es Cyber Range, que prueba la capacidad del modelo para ejecutar automáticamente cadenas de ataques de múltiples pasos en una red empresarial simulada. Uno de los escenarios de prueba, denominado «The Last Ones», incluye 32 pasos de ataque, 4 subredes y aproximadamente 20 hosts; AISI estima que un experto humano necesitaría unas 20 horas para completar todos los pasos.

Modelo de código abierto

Ambos sistemas arrojaron una conclusión consistente:

GLM-5.2 (lanzado en junio de 2026) tiene un rendimiento comparable al de Opus 4.6 (lanzado en febrero), con una diferencia de 4 meses;

Empatar con Opus 4.5 en Cyber Range (lanzado en noviembre del año pasado), con una diferencia de 7 meses.

DeepSeek V4-Pro se alinea con Opus 4.5 en tareas estrechas, con una diferencia de 5 meses.

Ambas brechas son más estrechas que los 6 a 10 meses medidos en la evaluación interna de 2025.

La brecha de costos es mayor que la brecha de habilidades.

La misma prueba de Cyber Range (cuota de 100 millones de tokens) cuesta aproximadamente 85 dólares ejecutándola con Opus 4.5 o 4.6, unos 46 dólares con GLM-5.2, y solo 1.19 dólares con DeepSeek V4-Pro.

En tareas estrechas que ambos modelos pueden completar al 100%, Opus 4.6 cuesta $15.17 por tarea, mientras que GLM-5.2 cuesta $6.12;

Opus 4.5 cuesta 12.50 dólares, DeepSeek V4-Pro cuesta 0.28 dólares.

Misma capacidad de ataque, de uno a dos órdenes de magnitud más barato y de código abierto.

Las barreras de seguridad de los modelos cerrados tampoco lograron crear una diferencia.

En la prueba AISI, DeepSeek V4-Pro a veces rechaza tareas de ingeniería inversa, pero se pueden omitir con unos pocos reintentos.

Fable 5 de Anthropic es un caso aún más extremo: lanzado el 9 de junio, tres días después, el investigador de seguridad Pliny the Liberator superó el clasificador de seguridad con una estrategia de escape en múltiples pasos; las capturas de pantalla relacionadas muestran que el modelo generó código de explotación que debería haber sido interceptado.

Los investigadores de Amazon luego informaron independientemente otro método de elusión.

Esto desencadenó directamente la primera orden de control de exportación del Departamento de Comercio de EE.UU. contra un modelo de IA; Fable 5 se desconectó globalmente durante 19 días hasta que Anthropic implementó un nuevo clasificador.

Closed source does not automatically equal security.

La ventana de defensa se está estrechando y las herramientas de defensa también se están acelerando

AISI especificó en el informe la señal política: el tiempo de preparación para la defensa es más corto que el año pasado.

El Centro Nacional de Seguridad Cibernética del Reino Unido ha instado a las instituciones a fortalecer la línea base de seguridad cibernética y utilizar la IA para mejorar las capacidades de defensa.

Las mismas herramientas de IA también están acelerando el trabajo en el lado de la defensa.

El experimentado desarrollador de programación de redes para juegos, Glenn Fiedler, quien ha escrito durante dos décadas artículos de nivel textbook en el campo de la programación de redes para juegos, realizó recientemente una auditoría de seguridad sistemática de cuatro bibliotecas de código abierto que mantiene (yojimbo, netcode, reliable, serialize, con un total de aproximadamente 6.000 estrellas en GitHub, consideradas bibliotecas de código abierto consolidadas y bastante influyentes en el ámbito de los juegos): implementó objetivos libFuzzer, activó CI con AddressSanitizer y MemorySanitizer, ejecutó pruebas de presión con millones de iteraciones y realizó una revisión línea por línea del código.

Modelo de código abierto

Glenn Fiedler

Se corrigieron 43 vulnerabilidades de seguridad en dos semanas, de las cuales 27 son accesibles remotamente a través de la red.

Modelo de código abierto

Lo más grave es un desbordamiento de heap remoto en yojimbo que existe desde 2019: un cliente malicioso puede activarlo enviando paquetes específicamente diseñados.

Modelo de código abierto

El costo total del token de auditoría es de aproximadamente 2500 dólares.

Modelo de código abierto

Ambos lados, ataque y defensa, se están acelerando con IA, pero de manera asimétrica.

La difusión de la capacidad de ataque es irreversible: una vez que se liberan los pesos del modelo de código abierto, no se pueden recuperar; los controles de seguridad pueden ser eliminados, y las copias pueden ejecutarse sin supervisión en servidores privados.

Sin embargo, la implementación de herramientas de defensa requiere que cada equipo invierta activamente tiempo y recursos.

Un comentario en el informe de AISI señala esta estructura: «Una vez que se libere el código abierto, estas opciones se perderán permanentemente.»

The impact of this data on the AGI landscape is more profound than the numbers themselves.

La brecha de capacidad entre código abierto y código cerrado se ha reducido a menos de seis meses; la estrategia predeterminada de utilizar el período exclusivo de código cerrado como amortiguador de seguridad está a punto de dejar de ser válida.

Los controles del modelo cerrado resultaron igual de frágiles en el evento Fable 5.

En la próxima fase, la cuestión central del juego político para los tomadores de decisiones globales se ha vuelto más aguda: ¿qué nivel de capacidad de modelo no debería tener sus pesos abiertos?

AISI anunció que continuará evaluando Kimi K3 espera el próximo conjunto de modelos de código abierto: la ubicación de esta línea superior dependerá muy probablemente de los resultados de las pruebas en los próximos meses.

Referencias:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Este artículo proviene del canal de WeChat "Nuevas Inteligencias", autor: Apocalipsis ASI; editor: Marco

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.