Anthropic, la empresa de inteligencia artificial que desarrolló el chatbot Claude,anunció el viernesuna serie de nuevas medidas de integridad electoral destinadas a evitar que su inteligencia artificial sea utilizada para difundir desinformación o manipular a los votantes antes de las elecciones legislativas estadounidenses de 2026 y otras elecciones importantes en todo el mundo este año.
La empresa con sede en San Francisco detalló un enfoque multifacético que incluye sistemas de detección automática, pruebas de estrés dirigidas a acciones impactantes y colaboración con organizaciones de recursos de votantes independientes — medidas que reflejan la creciente presión sobre los desarrolladores de inteligencia artificial para regular el uso de sus herramientas durante la temporada electoral.
Las políticas de uso de Anthropic prohíben utilizar a Claude para actividades políticas engañosas, generar contenido digital falso destinado a influir en la opinión política, llevar a cabo fraude electoral, interferir con la infraestructura de votación o difundir información engañosa sobre el proceso de votación.
Para garantizar el cumplimiento de estas normas, la empresa indicó que realizó una serie de pruebas en sus modelos más recientes de robots. Anthropic utilizó 600 prompts — 300 solicitudes dañinas emparejadas con 300 solicitudes legítimas — para medir la tasa de respuestas precisas de Claude ante solicitudes razonables y la tasa de rechazos precisos ante solicitudes inapropiadas. Las tasas de respuestas correctas de Claude Opus 4.7 y Claude Sonnet 4.6 fueron del 100% y del 99,8%, respectivamente.
La empresa también probó la capacidad de sus modelos para responder a estrategias de manipulación más complejas. Al simular diálogos en múltiples rondas que representan el enfoque progresivo que podrían adoptar actores maliciosos, Sonnet 4.6 y Opus 4.7 lograron una precisión del 90% y 94%, respectivamente, al responder adecuadamente a escenarios de manipulación de influencia.
Anthropic también probó si sus modelos podían ejecutar acciones de influencia de forma autónoma: planificar y llevar a cabo acciones multipaso desde el principio hasta el fin sin intervención humana. La empresa afirmó que, tras implementar medidas de seguridad, su modelo más reciente rechazó casi todas las tareas.
En cuanto a la neutralidad política, la empresa evalúa cada modelo antes de su lanzamiento para medir la consistencia y la imparcialidad de Claude al responder a prompts que presentan perspectivas de diferentes espectros políticos. Opus 4.7 y Sonnet 4.6 obtuvieron puntajes del 95% y 96%, respectivamente.
Para los usuarios que buscan información sobre votación, Claude mostrará una banderola electoral que los dirigirá a TurboVote. TurboVote es una plataforma de recursos no partidista operada por Democracy Works, que proporciona información confiable y en tiempo real sobre el registro de votantes, lugares de votación, fechas de elecciones y detalles de las boletas. Se planea implementar banderolas similares para las elecciones presidenciales brasileñas que se llevarán a cabo a finales de este año.
Anthropic dijo que, a medida que avanza el ciclo electoral, planea seguir monitoreando sus sistemas y perfeccionando sus medidas de defensa.DecryptHemos contactado a Anthropic para obtener su comentario sobre los hallazgos de la investigación, pero aún no hemos recibido respuesta.
