Los investigadores de ciberseguridad han encontrado vulnerabilidades significativas en modelos de Anthropic y OpenAI, y sus consecuencias ya han llegado a los niveles más altos del gobierno de EE. UU.
Un informe de FAR.AI evaluó múltiples modelos de vanguardia, incluyendo Claude Opus 4.8 de Anthropic, Fable 5 y GPT 5.5 y 5.6 de OpenAI, y encontró que son vulnerables a ataques de jailbreak diseñados para extraer salidas verdaderamente peligrosas, incluyendo código explotable, información sobre armas químicas y detalles sobre armas biológicas.
Los números cuentan una historia contundente
Los modelos de Anthropic y OpenAI no fueron los peores desempeñados. Ese honor le corresponde a los modelos Grok de xAI, que registraron 448 intentos exitosos de jailbreak automatizado. Los modelos Gemini de Google quedaron en segundo lugar con 249 intentos. Los modelos Claude, Fable y de la serie GPT mostraron una resistencia comparativamente mayor al jailbreak.
En junio de 2026, el Departamento de Comercio restringió el acceso extranjero a los modelos Fable 5 y Mythos 5 de Anthropic tras surgir una técnica de jailbreak reportada. La Casa Blanca también ha solicitado a OpenAI y Anthropic que retrasen el lanzamiento de ciertos modelos próximos para que el gobierno pueda evaluar adecuadamente los riesgos de ciberseguridad.
La explotación vinculada a China aumenta la urgencia
Los informes indican que entidades vinculadas a China ya han aprovechado los modelos de Anthropic para automatizar ciberataques contra más de 30 objetivos. La técnica implica prompts elaborados diseñados para eludir las barreras de seguridad existentes.
El gobierno de EE. UU. citó explícitamente estos riesgos para la seguridad nacional, señalando la posibilidad de que los modelos de IA generen exploits de software e información relacionada con armas cuando fallan sus mecanismos de protección. La respuesta de Anthropic ha sido etiquetar las vulnerabilidades como “estrechas”, sugiriendo que representan casos extremos en lugar de fallas sistémicas.
Qué significa esto para los inversores y el mercado de la IA
Las restricciones de exportación, los retrasos obligatorios en el lanzamiento y las críticas públicas del gobierno representan un entorno operativo fundamentalmente diferente para las empresas de IA de vanguardia. La seguridad se está convirtiendo en un requisito previo para poder desplegar modelos en absoluto, lo que se traduce directamente en mayores costos operativos, plazos de desarrollo más largos y posiblemente mercados abordables más pequeños si ciertos modelos no pueden venderse internacionalmente.
Los números significativamente peores de jailbreak de Grok — 448 instancias frente a las cifras comparativamente más bajas para Claude y las variantes de GPT — sugieren que xAI podría enfrentar vientos regulatorios más fuertes. Gemini de Google, con 249 instancias, se sitúa en un punto intermedio incómodo.
Los modelos de IA se integran cada vez más en sistemas de negociación, auditoría de contratos inteligentes e infraestructura DeFi. Un modelo de IA jailbreakado incrustado en herramientas financieras representa un vector de riesgo sistémico que podría propagarse por los mercados digitales interconectados de maneras que los reguladores apenas están comenzando a comprender.
