OpenAI desmantela una campaña de extracción de razonamiento vinculada a asociados de Moonshot AI

OpenAI informó el miércoles que identificó y desarticuló una campaña coordinada de destilación diseñada para extraer de manera ilícita el razonamiento protegido de sus modelos de inteligencia artificial.

Un "núcleo central de la actividad", que se remonta a la primera semana de julio, ha sido atribuido a individuos asociados con Moonshot AI, una empresa china de IA con sede en Pekín. No se citaron pruebas técnicas que respalden esta evaluación, probablemente por razones de seguridad.

"Los operadores no rompieron nuestro cifrado, ni comprometieron una base de datos, ni obtuvieron acceso directo a conversaciones de usuarios almacenadas", declaró OpenAI. "En su lugar, manipularon las interacciones con el modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante de manera coordinada y a escala, lo que violó nuestros términos de servicio".

Se dice que la actividad comenzó el 1 de julio de 2026, inicialmente con un volumen bajo, antes de dispararse los días 24 y 25 de julio de 2026 hasta las 16.000 solicitudes intentadas utilizando un patrón de extracción relevante por parte de más de 4.000 usuarios. Tras una investigación más exhaustiva, la compañía afirmó haber identificado una "actividad de patrón de prompts" relacionada en más de 15.000 usuarios. La campaña fue completamente desarticulada el 28 de julio de 2026.

La empresa emergente de IA calificó la actividad como destilación adversarial, que implica el uso sistemático y no autorizado de las salidas de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. OpenAI dijo que desde entonces ha desplegado mitigaciones adicionales para combatir este ataque y ha prohibido las cuentas fraudulentas involucradas en la actividad.

Además, OpenAI afirmó haber cerrado una "vía" que permitía a algunos que ya poseían el razonamiento cifrado de otro usuario reproducirlo y recuperar su contenido, junto con la incorporación de comprobaciones para detectar y retener la salida transmitida que pudiera exponer el razonamiento.

En un estudio publicado en agosto de 2026, un grupo de investigadores encontró una vulnerabilidad arquitectónica que hacía que los rastros de razonamiento cifrados fueran "completamente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un proveedor", lo que un atacante podría explotar para desarrollar un jailbreak de descifrado escalable y eludir los mecanismos anti-destilación.

"Al inyectar un rastro de razonamiento cifrado de un modelo dado en un modelo más débil y menos protegido del mismo proveedor, lo obligamos a decodificar y emitir el rastro textualmente en texto plano, sin necesidad de hacer jailbreak directamente al modelo más capaz", señalaron investigadores de MATS Research, el Instituto ELLIS de Tubinga y Synk.

Además, esto permite la extracción de datos privados a gran escala, abre la puerta a inyecciones de prompts invisibles mediante la incorporación de cargas maliciosas completamente dentro de bloques cifrados y revela inadvertidamente información peligrosa oculta en el proceso de razonamiento, incluso si la salida final visible del modelo rechaza una solicitud dañina.

Dado que el razonamiento protegido ofrece información sobre cómo un modelo aborda una tarea, extraer esta información puede revelar datos sensibles y ayudar a otros a reproducir las capacidades del modelo, añadió OpenAI.

"La destilación adversarial plantea riesgos de seguridad y de seguridad nacional", afirmó la compañía. "El razonamiento extraído podría utilizarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a las salidas originales orientadas al usuario. A escala, la destilación también puede acelerar la transferencia de capacidades avanzadas sin requerir la misma inversión en seguridad. Estas preocupaciones se intensifican a medida que los modelos adquieren capacidades en dominios de doble uso".

No es la primera vez que Moonshot AI enfrenta acusaciones de destilación. El mes pasado, su rival Anthropic acusó a Moonshot AI de reenviar encubiertamente solicitudes de clientes a Claude en lugar de procesarlas con Kimi, y luego mostrar las respuestas de Claude a los usuarios.

También se alega que la empresa retuvo un subconjunto de estos intercambios para entrenar su modelo de cadena de pensamiento (CoT). La actividad ha sido rastreada bajo el nombre GTG-16002.

Cybersecurity
Cybersecurity
Cybersecurity
Cybersecurity

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *