Agentes de IA diseñados para detectar código malicioso pueden ser engañados para ejecutarlo

Un experimento publicado por el AI Now Institute, denominado 'Friendly Fire', demuestra que agentes de inteligencia artificial como Claude Code (de Anthropic) y Codex (de OpenAI) pueden ser engañados para ejecutar código malicioso. La vulnerabilidad explota la función autónoma de estos asistentes, diseñada para revisar código de terceros en busca de problemas de seguridad.

Los investigadores Boyan Milanov y Heidy Khlaaf probaron configuraciones estándar de Claude Code (versiones 2.1.116 a 2.1.199) y OpenAI Codex (versión 0.142.4) con sus respectivos modos autónomos activados. El ataque no requiere una versión específica, sino que aprovecha un fallo de diseño: la incapacidad de distinguir entre instrucciones del repositorio y comandos ejecutables.

El método consiste en modificar un archivo README.md de una biblioteca de código abierto como geopy, incluyendo una sugerencia de ejecutar un script de seguridad. Este script lanza un binario oculto disfrazado como compilación legítima. Al solicitar al agente que realice pruebas de seguridad, este sigue las instrucciones del README y ejecuta el binario sin alertar al usuario.

El ataque evita las protecciones existentes: no requiere archivos de configuración como .mcp.json, que activan advertencias de confianza. Al esconderse en un README, un archivo de texto común, el agente no muestra ninguna alerta. Las defensas actuales de Claude Code y Codex no detectan esta maniobra, y modelos como GPT-5.5 y Claude Sonnet 4.6 ejecutaron el payload sin objeciones.

AI Now Institute señala que este ataque no se puede solucionar con una simple actualización de modelo, ya que la falla es fundamental: los agentes no pueden distinguir entre código legítimo e instrucciones maliciosas. Recomiendan no entregar código no confiable a agentes con capacidad de ejecución de comandos, aunque esto contradice el uso principal de estas herramientas.

No entregue código no confiable a un agente que pueda ejecutar comandos y acceder a sus claves, secretos o sistema.

El informe compara este ataque con otros previos como 'TrustFall' y 'Agentjacking', y destaca que la amenaza no es un archivo o canal específico, sino la condición subyacente: texto externo no confiable que llega a un agente capaz de ejecutar comandos. El sandboxing no es una solución completa, ya que Claude Code ha tenido vulnerabilidades de escape como CVE-2026-39861.

  • Claude Code (CLI 2.1.116, 2.1.196, 2.1.198, 2.1.199) con Claude Sonnet 4.6, Sonnet 5 u Opus 4.8
  • OpenAI Codex (CLI 0.142.4) con GPT-5.5
  • geopy, biblioteca Python de coordenadas, como vector de ataque
  • El payload funcionó en los cuatro modelos sin cambios
Cybersecurity
Cybersecurity
Cybersecurity
Cybersecurity

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *