Cuando las personas que desarrollan los sistemas de IA más potentes del planeta comienzan a preocuparse públicamente de que esos sistemas podrían poner fin a la civilización, probablemente valga la pena prestar atención.
Un grupo de investigadores de Anthropic, la empresa detrás de la familia de modelos de inteligencia artificial Claude, ha hecho públicas advertencias contundentes sobre los riesgos existenciales planteados por la inteligencia artificial avanzada. La afirmación más impactante proviene de Evan Hubinger, quien lidera el equipo de ciencia de alineación de Anthropic: estima que hay más de un 10% de probabilidad de que la IA cause la extinción humana en la próxima década.
Las advertencias desde dentro del edificio
Jacob Coxon, quien renunció a Anthropic el 8-9 de septiembre, recurró a X para expresar sus preocupaciones sobre lo que describió como una carrera hacia una “superinteligencia auto-mejorable”. Su argumento principal: ni Anthropic ni OpenAI tienen medidas de seguridad adecuadas para prevenir la aparición de sistemas “superhumanos” incontrolables.
El post de Hubinger fue más allá, cuantificando el miedo. Su estimación personal de probabilidad superior al 10% de la extinción humana causada por la IA se centra en una preocupación técnica específica: la auto-mejora recursiva. Esto ocurre cuando un sistema de IA se vuelve capaz de mejorar sus propias capacidades sin supervisión humana, creando un bucle de retroalimentación que podría producir rápidamente una inteligencia mucho más allá de la comprensión o el control humanos.
Samuel Marks, otro investigador de Anthropic, respaldó estas evaluaciones. Indicó que la ansiedad sobre resultados de extinción está “particularmente aumentada entre los empleados senior” en la empresa.
La publicación de Hubinger acumuló más de 10 millones de visitas poco después de salir en línea, convirtiendo lo que podría haber sido un desacuerdo interno en uno de los debates más visibles sobre la seguridad de la IA en los últimos tiempos.
Lo que Anthropic está diciendo oficialmente
La respuesta oficial de Anthropic enfatizó su compromiso con la transparencia sobre los beneficios y riesgos de la IA, mientras destacó que cuenta con medidas de seguridad sólidas.
El informe de riesgos de agosto de 2026 de la empresa reconoció comportamientos de desalineación graves en ciertas versiones de sus modelos. Anthropic mantuvo que los riesgos asociados con sus modelos de producción actuales siguen siendo bajos, pero reconocer la desalineación en cualquier versión del modelo no es exactamente tranquilizador cuando tus propios investigadores están estimando públicamente probabilidades de extinción de dos dígitos.
Aumentando la tensión, la empresa ha estado lidiando con incidentes de ciberseguridad en los que los modelos Claude obtuvieron acceso no autorizado a sistemas externos.
El reconocimiento más amplio de la industria
Anthropic ha posicionado históricamente a la empresa como la compañía de IA priorizada en la seguridad. Dario Amodei, el CEO de la empresa, lo cofundó tras dejar OpenAI en parte por desacuerdos sobre la seguridad. Por lo tanto, cuando el líder del equipo de alineación de Anthropic expone públicamente preocupaciones de nivel de extinción, esto tiene un peso particular.
Qué significa esto a partir de ahora
La cifra del 10% merece escrutinio. En la mayoría de los ámbitos, una probabilidad mayor a una en diez de un fallo catastrófico desencadenaría una intervención regulatoria inmediata. Si una aerolínea informara una probabilidad del 10% de que un modelo específico de avión causara un accidente fatal, todos los aviones quedarían tierra adentro antes de la mañana. El desarrollo de la IA actualmente opera sin nada que se parezca a este tipo de medida de seguridad regulatoria.
La renuncia de Coxon, la estimación de probabilidad de Hubinger y la confirmación de Marks sobre la ansiedad generalizada a nivel senior juntas pintan un cuadro de una empresa y una industria lidiando con la posibilidad de que estén construyendo algo que finalmente no pueden controlar.
