Adversa AI ha revelado una técnica de ataque que, según afirma, puede hacer que el chatbot Grok de xAI envíe el nombre del usuario, su ubicación aproximada, su nivel de suscripción y las indicaciones de la conversación en curso a un servidor controlado por el atacante después de que el usuario le pida resumir una página web ordinaria. La empresa de seguridad de IA, que ha bautizado la técnica como 'Cryptographic Context Injection', indicó que la transferencia se completó sin un paso de confirmación y sin ninguna advertencia visible en su demostración de prueba de concepto.
No hay parche, ni identificador CVE, ni solución disponible para el usuario, y el informe no reporta explotación en la naturaleza. Preguntado sobre qué versión se probó, Adversa dijo a The Hacker News que el objetivo era el chat web de Grok en grok.com con Grok 4.5 Fast, y que el ataque se reprodujo una vez el 19 de agosto de 2026. El informe no da una tasa de éxito. La compañía dijo que ha intentado el ataque 20 veces desde junio con una tasa de éxito del 40%, y que los fallos provinieron de que Grok tenía dificultades con el descifrado, no de una solicitud o respuesta marcada.
La técnica envía las instrucciones del atacante como texto cifrado en lugar de texto legible, con la página que contiene un objeto JSON cifrado, el material clave y una instrucción para descifrarlo, que Grok ejecuta en su propio entorno de ejecución de código Python. Recuperar el texto plano requiere ejecutar PBKDF2 y AES-256-GCM, que un clasificador de contenido no realiza en el momento de la inspección. Por lo tanto, las instrucciones llegan al contexto del modelo como resultado del código que el modelo acaba de ejecutar, en lugar de como contenido web obtenido.
'El cifrado fuerte no puede ser leído por un clasificador de contenido y no puede ser eludido en los pesos, por lo que fuerza la recuperación a través del entorno de ejecución del que depende el ataque. Si un cifrado más débil también podría eludir los filtros específicos de un objetivo determinado es una cuestión empírica', dijo Rony Utevsky, investigador principal de Adversa AI.
Las instrucciones descifradas luego dirigen al agente a resolver su contexto de sesión privado e incrustarlo en una URL que se le indica abrir para 'obtener contexto adicional'. Un elemento de la cadena hace que el modelo construya una 'clave de descifrado' adicional que no es material clave en absoluto, y cuyo valor es una cadena de plantilla que interpola el nombre, la ubicación, el nivel y el historial de chat. Grok luego invoca su propia herramienta de navegación para cargar esa URL, llevando los datos en los parámetros de consulta de la solicitud.
Utevsky dijo que los prompts tomados en el escenario probado se limitaron a la conversación en curso, y que todo lo extraído ya estaba en el contexto del modelo. El alcance del agente, dijo, se extiende a 'lo que tenga en contexto o pueda obtener con sus herramientas', y la compañía no probó si podría acceder a otros chats, memoria del agente u otro contenido.
'El marco construido por xAI permite que las instrucciones y los datos analizados de una página externa no confiable impulsen la invocación de una herramienta privilegiada conectada a Internet; permite que los metadatos de sesión privados y el historial de conversación se resuelvan en las entradas de esa herramienta saliente; y no aplica ningún límite efectivo de salida ni compuerta de consentimiento en esta ruta, ni separación de procedencia que pudiéramos observar. Las instrucciones lavadas y controladas por el atacante llegan a una acción de salida privilegiada sin obstáculos', dijo Adversa.
La compañía dijo que informó por primera vez el problema a xAI el 3 de junio de 2026, y al programa de recompensas por errores de HackerOne de xAI el mismo día; que xAI reconoció el informe sin proporcionar detalles ni un cronograma de mitigación, y que los intentos de contacto adicionales el 4 y 10 de agosto no recibieron respuesta. Adversa es la única fuente del hallazgo de Grok, dijo que retiene los payloads operativos para evitar la explotación, y xAI no ha publicado una declaración o aviso sobre la investigación hasta el 20 de agosto de 2026.
Demostración adicional contra Gemini
Una segunda demostración en el mismo informe apunta a Google Gemini en modo Deep Thinking, donde un solo prompt hace que el modelo descifre un payload que se resuelve en un traceback de Python falso que lleva una devolución de llamada falsa de desactivación de política de seguridad y un prefijo de razonamiento en primera persona que lo precompromete a la salida restringida. Adversa dijo que el vector produjo contenido restringido y reprodujo las instrucciones del sistema de Gemini, que identificó como Gemini 3 Flash (Web) en el nivel de pago.
Google no fue notificado, dijo Adversa, porque los jailbreaks están fuera del alcance de su programa de divulgación, y la tasa de éxito contra los agentes de la compañía 'había disminuido significativamente para agosto', sin que se atribuyera la causa entre actualizaciones de filtros y cambios de versión del modelo. La demostración de Gemini se publicó en forma sustancialmente similar cinco meses antes. Utevsky describió la misma cadena en su sitio de investigación personal el 11 de marzo de 2026, bajo el nombre Cryptographic Payload Injection, reportando cinco de cinco reproducciones independientes y resultados entre modelos en los que OpenAI GPT-5 no pudo analizar las instrucciones de descifrado y Claude Sonnet 4.5 de Anthropic marcó el payload como inyección de prompts después de descifrarlo.
'La parte relacionada con Gemini de la investigación se realizó en marzo y no ha sufrido cambios sustanciales. Hoy, estamos agregando una generalización de la técnica y su aplicación a Grok', dijo Utevsky a The Hacker News.
Adversa aconseja a los equipos que ejecutan agentes realizar los siguientes pasos:
- Aislar contenido no confiable en un contexto sin herramientas ni credenciales, devolviendo solo datos estructurados al contexto privilegiado.
- Bloquear acciones irreversibles y salientes, confirmando nuevos destinos de red, empujes, fusiones, publicaciones y escrituras fuera del espacio de trabajo con argumentos completamente resueltos en lugar de plantillas, y aplicando una denegación estricta donde no haya presencia humana.
- Capturar trazas de herramientas por sesión con argumentos resueltos, sin las cuales no hay detección ni forense.
- Alertar sobre la secuencia en lugar de cualquier payload individual, tratando un blob opaco acompañado de instrucciones para descifrarlo como una señal de revisión y nunca como un filtro de bloqueo.
- Hacer que la procedencia del contexto sea un requisito de adquisición y preguntar a los proveedores si la salida de la herramienta está separada del canal de instrucciones.
El desarrollo se produce cuando Alexander Panfilov y siete coautores informaron en un preprint publicado el 10 de agosto de 2026 que los bloques de cadena de pensamiento cifrados que Anthropic, OpenAI y Google devuelven a los clientes de API son intercambiables entre sesiones, usuarios y modelos dentro del ecosistema de un proveedor, y que los atacantes pueden usar la falla para 'ejecutar inyecciones de prompts invisibles, incrustando payloads maliciosos dentro de bloques cifrados para envenenar despliegues agénticos públicos'.
Por separado, investigadores de UC Berkeley, la Fundación Ethereum y NYU Shanghai encontraron en un trabajo presentado en USENIX Security 2026 que un ataque de dos turnos en el que el modelo decodifica un cifrado de sustitución y luego se le pide actuar sobre el texto decodificado tuvo éxito contra Grok 3 en los 12 intentos maliciosos probados, mientras que el mismo cifrado sin ese segundo turno de activación falló en los 12. El manejo por parte de xAI de los informes de inyección de prompts contra Grok ha sido criticado antes. En diciembre de 2024, Johann Rehberger demostró una cadena de exfiltración de datos de extremo a extremo contra Grok en la aplicación X iOS, en la que una inyección indirecta de prompts hizo que el asistente enviara información de chat anterior a un servidor de terceros, y dijo que todos los problemas que informó se cerraron como 'Informativos'.
'xAI afirma que no hay impacto práctico con la vulnerabilidad reportada. No estoy seguro de cómo la fuga de los mensajes de chat y la dirección IP del usuario no es una vulnerabilidad; la cuestión es más sobre la gravedad', dijo Rehberger.
Actualizado el 20 de agosto de 2026 con respuestas de Adversa AI sobre la versión probada, la tasa de éxito y el alcance de los datos extraídos.



















Deja una respuesta