Pillar Security publicó una investigación el 3 de agosto de 2026, detallando un ataque novedoso contra el Kit de Desarrollo de Agentes de código abierto de Google para Python, dirigido específicamente a flujos de trabajo dentro del repositorio GitHub gemini-cli. La explotación funciona inyectando instrucciones maliciosas en un agente de IA con bajos privilegios, que luego activa un agente más potente, disponible solo para los mantenedores, llevando a cabo lo que los investigadores denominan el primer caso del mundo real en el que un agente de IA compromete a otro con privilegios elevados.
El repositorio gemini-cli ha registrado más de 90 millones de descargas.
Cómo funciona realmente el ataque
La cadena de ataque comienza con un problema o solicitud de extracción público en GitHub que contiene una carga de inyección de instrucciones. Gemini-cli utiliza agentes de IA para tareas rutinarias como la clasificación de problemas y la revisión de solicitudes de extracción, y estos agentes operan en diferentes niveles de privilegio. El agente de bajo privilegio, al que cualquiera puede interactuar presentando un problema, es manipulado primero. Luego, ese agente activa inadvertidamente al agente de nivel mantenedor, que posee mucho más poder.
Esas acciones incluyen exfiltrar tokens de GitHub que tienen permisos de escritura para pull requests. Con esos tokens, un atacante podría enviar solicitudes de extracción engañosas que parezcan llevar aprobaciones legítimas de revisión de IA, un escenario de envenenamiento de la cadena de suministro que sería extremadamente difícil de detectar en pipelines de CI/CD de rápido movimiento.
Pillar Security publicó esta investigación como parte de una serie que llama la “Semana de Escape de Sandbox”. Google actuó rápidamente para corregir el error subyacente, pero rechazó otorgar una recompensa por errores, citando que el ataque dependía de ingeniería social como razón por la que no cumplía con los criterios de recompensa.
Por qué esto es más importante que un solo error corregido
Lo nuevo aquí es la escalada de agente a agente: un sistema de IA utilizado como paso intermedio para comprometer uno con mayores privilegios. Las jerarquías de confianza entre agentes pueden ser explotadas, al igual que las jerarquías de confianza entre usuarios humanos en ataques tradicionales de escalada de privilegios.
El caso de gemini-cli apunta a una canalización CI/CD, la infraestructura automatizada que construye, prueba y despliega software. Comprometer esta capa no solo afecta un solo repositorio, sino todos los proyectos y usuarios aguas abajo que dependen del software construido a partir de código contaminado.
Lo que los inversores y desarrolladores deben vigilar
Los investigadores de Pillar Security pidieron específicamente a las organizaciones que replanteen sus arquitecturas de seguridad para incluir identidades de agentes distintas, controles de acceso más estrictos y modelos de amenazas que tengan en cuenta las interacciones entre agentes.
Los agentes que operan en repositorios compartidos interactúan con contenido enviado por el público, lo que es funcionalmente equivalente a permitir que entradas no confiables fluyan directamente en sistemas privilegiados. Corregir esto requiere repensar cómo se despliegan los agentes, no solo parchear vulnerabilidades individuales.
