Falla en APIs de IA permitió extraer razonamiento y secretos de usuarios
Una vulnerabilidad recientemente divulgada en la forma en que OpenAI, Anthropic y Google ocultaban el razonamiento de la IA entre llamadas a sus APIs permitió a investigadores recuperar el razonamiento interno y secretos de los registros de sesión, incluidas claves de API y contraseñas. La debilidad afectaba a los objetos de razonamiento encriptados utilizados por las APIs de razonamiento de estos proveedores. Un bloque creado en una sesión podía reproducirse en otra y, durante las pruebas, incluso entregarse a un modelo más débil de la misma familia para que revelara el contenido oculto.
El equipo detrás del artículo 'Stealing Reasoning Traces from Proprietary LLM APIs' demostró cuatro vías de abuso: robar razonamiento propietario para destilación de modelos, extraer datos privados de trazas publicadas por otros usuarios, recuperar contenido dañino oculto detrás de una respuesta visible segura y ocultar inyecciones de instrucciones dentro de bloques de razonamiento opacos.
En 6.708 trayectorias públicas de agentes, el equipo decodificó 315.320 bloques de razonamiento. Tras excluir fuentes de referencia, contaron 704 artefactos de privacidad distintos de sesiones genuinas de usuarios, incluyendo 62 claves de API, 33 contraseñas, 24 tokens de acceso y siete claves privadas. El ataque entre usuarios no proporcionaba acceso arbitrario a chats privados. Requería obtener un bloque de razonamiento encriptado, como uno publicado en un registro de agente, y acceso a la API de un modelo compatible del mismo proveedor.
Los investigadores notificaron el hallazgo a los proveedores de modelos afectados, Microsoft y Hugging Face, y afirman que los ataques demostrados dejaron de funcionar tras las mitigaciones. Su declaración de reproducibilidad indica que el ataque de extracción principal ya no es reproducible desde agosto de 2026. El informe no documenta explotación maliciosa en la naturaleza. Se aconseja a los desarrolladores eliminar los bloques de razonamiento y los campos de razonamiento opacos de las trazas compartidas y evitar comprometer transcripciones completas de API incluso cuando el texto visible se haya sanitizado.
Origen del problema: diseño para preservar razonamiento entre llamadas
El problema comienza con un diseño destinado a preservar el razonamiento entre llamadas a la API cuando el estado de la conversación se gestiona manualmente o sin estado. OpenAI puede devolver elementos de razonamiento encriptados que las aplicaciones reproducen con un historial gestionado manualmente; Anthropic lleva el razonamiento completo en una firma encriptada; y Google utiliza firmas de pensamiento encriptadas. Estos objetos preservan el estado del razonamiento sin exponer el texto plano subyacente directamente al cliente.
El cifrado en sí no fue descifrado, y el ataque no requirió obtener una clave de cifrado. Se basaba en que los bloques opacos intactos fueran aceptados y procesados por el proveedor. Durante las pruebas, el artículo encontró que esos objetos eran portátiles entre sesiones, usuarios y modelos, lo que permitía que un modelo compatible más débil actuara como lo que los autores llaman un 'decodificador difuso': Claude Haiku 4.5 para trazas de Claude, GPT-5.6 Luna para trazas de GPT y Gemini Robotics ER-1.6 para trazas de Gemini. Se incitaba al decodificador a transcribir el razonamiento producido por un modelo más fuerte.
Ese comportamiento entre usuarios convierte los registros de agentes publicados en el problema de seguridad más agudo. De los 704 artefactos no de referencia recuperados, 64 aparecían solo en el razonamiento oculto y no en ninguna parte de la traza visible. Sanitizar la conversación legible podría, por tanto, dejar secretos en un bloque opaco que otra cuenta podía reproducir. La exposición que muestra el estudio está acotada: afecta a desarrolladores que publicaron registros de agentes con los objetos de razonamiento intactos, un grupo identificable más que todos los usuarios de la API, y no necesariamente el único en riesgo.
Inyección de instrucciones invisible y hallazgos en repositorios públicos
La misma portabilidad también permitió una prueba de concepto de inyección de instrucciones invisible. El equipo creó un bloque de razonamiento opaco que llevaba una instrucción maliciosa y luego lo reprodujo en una tarea no relacionada, lo que provocó que el modelo receptor añadiera una acción de subida dirigida por el atacante sin poner la instrucción inyectada en el texto visible.
Los autores advierten que no tienen el texto plano de referencia del razonamiento propietario, por lo que no pueden garantizar que cada traza reconstruida sea una copia exacta. Sus comprobaciones de fidelidad se basaron en recuentos de tokens de razonamiento y comparaciones cualitativas, con longitudes extraídas que generalmente seguían los recuentos de tokens de pensamiento informados por los proveedores.
La documentación actual de los proveedores muestra que el razonamiento encriptado sigue formando parte de estas APIs, pero el manejo ha cambiado. OpenAI todavía indica a los desarrolladores que reproduzcan elementos de razonamiento encriptado cuando gestionan manualmente el historial sin estado, mientras que Google dice que su backend gestiona la compatibilidad del pensamiento cuando una sesión cambia de modelo. Anthropic ahora dice que los bloques de pensamiento están vinculados al modelo que los produjo y deben eliminarse al cambiar de modelo porque otros modelos los ignoran.
Respuesta de los proveedores y preguntas abiertas
Varias preguntas que plantea la divulgación quedan abiertas en el registro público. No ha surgido ningún reconocimiento público de la falla por parte de ninguno de los tres proveedores, y ninguno ha vinculado su documentación actual con esta investigación, por lo que la afirmación de que los ataques demostrados ya no funcionan se basa en la propia declaración de reproducibilidad de los investigadores, no en la confirmación del proveedor.
El mismo registro muestra que el equipo decodificó cientos de miles de bloques de razonamiento que ya estaban en repositorios públicos, pero no aborda si esos bloques ya publicados siguen siendo decodificables, una cuestión separada de si los ataques nuevos aún tienen éxito. El trabajo se basa en una investigación de mayo del criptógrafo de Johns Hopkins, Matthew Green, que demostró que los bloques de razonamiento encriptado podían reproducirse entre sesiones y cuentas, pero no llegó a una técnica fiable de extracción de secretos.
Green dice que informó del comportamiento de reproducción a OpenAI y Anthropic a través de sus programas de recompensas por errores; en su relato, OpenAI calificó el informe de no reproducible y Anthropic dijo que no veía implicaciones de seguridad en el comportamiento de reproducción o canal lateral. El nuevo artículo convierte ese comportamiento de reproducción en un método de extracción más amplio y documenta las consecuencias de privacidad a gran escala.




















Deja una respuesta