Tres investigadores de la firma de seguridad Hacktron emplearon Claude Opus 5, el modelo de Anthropic, para encadenar dos vulnerabilidades y tomar el control de las cuentas de ChatGPT y Codex de varios empleados de OpenAI, alcanzando después un repositorio interno de código de la compañía. La cadena de ataques comenzó con un error en el software que gestiona el foro de ayuda público de OpenAI y continuó a través de una debilidad en el propio sistema de inicio de sesión de la empresa.
Se trató de una investigación de seguridad, no de un ataque real: el equipo informó de los fallos a OpenAI, demostró el acceso con una solicitud de extracción inofensiva y luego se detuvo. Desde el primer vistazo, el acceso interno se logró en menos de 72 horas. OpenAI confirmó la corrección aproximadamente 14 horas después del informe, según Hacktron, y el 1 de septiembre pagó al equipo una recompensa de 6.500 dólares. OpenAI señaló que el pago 'reconoce el hallazgo del lado de OpenAI, no las acciones contra Discourse', el software de código abierto que ejecuta el foro. Probar el foro en sí quedaba fuera de su programa de recompensas por errores.
OpenAI no ha descrito públicamente el fallo de inicio de sesión y confirmó el hallazgo mediante esa corrección y el pago, en lugar de detallar las tomas de control de cuentas. Hacktron, que se define como una firma de investigación de seguridad asistida por IA, fue cuidadosa con lo que hizo y lo que no. Cuando se abrió un enlace de Codex de un empleado al código de OpenAI en GitHub, se generó una única solicitud de extracción en el repositorio interno. No leyó ningún código fuente, no fusionó ni publicó nada, ni tocó datos de clientes.
El alcance potencial de la cadena era mucho mayor. Dado que el personal conecta otros servicios a ChatGPT y Codex, el equipo afirmó que el mismo acceso podría haberse extendido en teoría a herramientas como GitHub, Slack y el correo electrónico. Ese alcance más amplio era posible, pero no se utilizó.
Por qué un fallo del foro llegó a las cuentas del personal
La razón por la que un error en un foro público pudo alcanzar cuentas del personal radica en el sistema de inicio de sesión de OpenAI, no en el software del foro. El foro de OpenAI ofrece una opción de 'Iniciar sesión con OpenAI', el mismo inicio de sesión único (SSO) que el personal utiliza en otros lugares.
Una vez que los investigadores tomaron el control del servidor del foro, el inicio de sesión compartido les permitió hacerse con las cuentas de ChatGPT y Codex de los miembros del foro que trabajaban en OpenAI. Las víctimas no tuvieron que hacer nada. Hacktron afirmó que se trataba de un problema de identidad de OpenAI, no de un fallo en el software del foro: cualquier servicio de primera o tercera parte que utilizara el mismo inicio de sesión podría haber otorgado el mismo acceso.
La vía de entrada fue un error de imagen. El foro funciona con Discourse, y Discourse pasa las imágenes HEIC y HEIF subidas a una herramienta llamada ImageMagick, que utiliza la biblioteca libheif para leerlas. Un fallo en libheif permitía que una imagen especialmente diseñada corrompiera la memoria del servidor del foro. El aviso de Discourse califica el resultado como ejecución remota de código, con una puntuación de 8,8 sobre 10, y lo registra como CVE-2026-32882. El registro público del fallo en sí es más limitado. En el aviso propio de libheif y en las bases de datos nacionales de vulnerabilidades, CVE-2026-32882 es una lectura fuera de límites que puede bloquear el software o filtrar memoria cercana, no un error de ejecución de código directo.
Esa memoria filtrada ayuda a eludir una protección común llamada ASLR. Los investigadores dicen que combinaron los errores de memoria de libheif, con la ayuda de la IA, para convertir el bloqueo en una ejecución de código funcional en el servidor del foro. Aguas arriba, el fallo se corrigió en libheif 1.22.0 en mayo de 2026.
Esa corrección existía meses antes de la prueba. Pero la imagen del servidor del foro, basada en la distribución Linux Debian 12, todavía incluía la antigua libheif sin parchear, versión 1.19.7, cuando los investigadores la examinaron en julio. La corrección y su CVE ya eran públicos, pero Debian aún no los había incluido en la versión empaquetada que usaba el foro.
Si ejecuta su propio servidor Discourse, esta parte le afecta directamente. Reconstruya sobre la última imagen para obtener la libheif parcheada, porque una actualización solo de la interfaz web puede no reemplazar la biblioteca antigua. Los sitios alojados por Discourse ya estaban parcheados, y las versiones autoalojadas corregidas son 2026.7.0, 2026.6.1, 2026.5.2 y 2026.1.6.
Cómo utilizaron la IA los investigadores
Los investigadores usaron IA para hacer la parte difícil. Primero probaron Claude Opus 4.8, que tuvo dificultades durante varias sesiones para construir un exploit funcional una vez habilitada una defensa de memoria estándar, ASLR. Anthropic lanzó su siguiente modelo, Claude Opus 5, la noche del 24 de julio, y en una sesión nueva produjo un exploit funcional en cuestión de horas.
Opus 5 venía con salvaguardas destinadas a impedir que escribiera código de exploit para objetivos reales. Los investigadores las sortearon apuntando el modelo a su propio servidor de pruebas, disfrazado de objetivo de práctica de tipo capture-the-flag, y luego dejándolo ejecutarse en un bucle automatizado. Aun así, dicen que el trabajo no fue sin intervención humana: la dirección experta de personas siguió siendo importante, y no se trató de hackeo automatizado sin nadie a los controles.
El caso encaja con lo que investigadores y empresas de IA han descrito este año: los modelos de IA capaces están reduciendo drásticamente el tiempo y la habilidad que antes requería el trabajo ofensivo serio. Anthropic ha informado de que grupos criminales y respaldados por Estados ya están usando sus modelos Claude para llevar a cabo intrusiones reales, no solo para responder preguntas.
OpenAI fue un objetivo dentro de un proyecto más amplio que Hacktron llama HEIF Heist. Durante aproximadamente dos meses, según el equipo, encontró la misma clase de fallos de decodificación de imágenes en software utilizado por otras grandes empresas, con un coste total inferior a 3.000 dólares en uso de IA. Vincula la campaña con errores reportados en Slack, productos de Meta, GitHub Enterprise y marcos web como Next.js.
Esas afirmaciones más amplias están respaldadas de forma desigual. El fallo de Next.js está confirmado en el aviso propio de Vercel, y los mantenedores de libheif confirmaron un exploit funcional de ejecución de código para el error relacionado con Meta. La afirmación más amplia de ejecución de código en muchas aplicaciones no ha sido confirmada de forma independiente, un límite que The Hacker News señaló cuando cubrió por primera vez el fallo de Next.js en agosto.
La campaña más amplia utilizó un modelo diferente, GPT-5.6 Sol de OpenAI, para casos en los que el equipo no sabía nada del objetivo de antemano. Solo una empresa, Shopify, parece haber notado la actividad, según los investigadores, aunque sus procesadores de imágenes se bloquearon repetidamente bajo miles de cargas de prueba. The Hacker News se ha puesto en contacto con Hacktron para preguntar cómo se logró la ejecución de código en el foro y sobre el alcance del acceso a las cuentas.
Qué hacer
Las lecciones más importantes van más allá de Discourse. Si su servicio acepta imágenes de usuario y lee archivos HEIC, HEIF o AVIF a través de libheif, una compilación antigua podría estar expuesta. Y si un servicio público de menor confianza comparte su inicio de sesión único con herramientas internas, una intrusión en ese servicio puede convertirse en una intrusión en todos los lugares a los que llega el mismo inicio de sesión.
- Actualice libheif a la última versión de seguridad (1.23.4 a principios de septiembre de 2026) o a la compilación parcheada de su distribución.
- Donde no lo necesite, desactive la decodificación de imágenes HEIF y AVIF no confiables, o ejecute el procesamiento de imágenes dentro de un entorno aislado y restringido.
- Limite qué servicios confía su inicio de sesión único y exija una verificación de identidad nueva antes de acciones sensibles en lugar de confiar en una sesión existente.
No hay indicios de que el fallo de OpenAI se haya utilizado contra nadie en el mundo real. A mediados de septiembre de 2026, no estaba en la lista del gobierno de Estados Unidos de vulnerabilidades conocidas como explotadas, aunque esa lista no es prueba ni de una cosa ni de la otra. Lo que los informes disponibles no aclaran es si una organización que ya ha parcheado debería comprobar igualmente accesos anteriores; sobre ese punto, las fuentes guardan silencio.





















Deja una respuesta