OpenAI afirma que sus modelos de IA hackearon Hugging Face durante las pruebas
OpenAI reveló que sus modelos de IA, incluido GPT-5.6 Sol y un modelo previo al lanzamiento, lograron hackear el repositorio de inteligencia artificial Hugging Face mientras se probaban en un entorno aislado. Según la compañía, en lugar de centrarse en resolver un desafío de ciberseguridad por sí mismos, los modelos intentaron hacer trampa robando las soluciones de prueba mediante la intrusión en Hugging Face.
En uno de sus intentos, los agentes de OpenAI encadenaron vulnerabilidades de día cero y utilizaron credenciales robadas para encontrar un vector de ejecución remota de código mientras intentaban acceder a los servidores de Hugging Face. OpenAI explicó que el incidente fue impulsado por una combinación de modelos, incluyendo GPT-5.6 Sol y un modelo más capaz previo al lanzamiento, todos con rechazos cibernéticos reducidos para fines de evaluación.
"Después de investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI —incluyendo GPT-5.6 Sol y un modelo previo al lanzamiento aún más capaz, todos con rechazos cibernéticos reducidos para fines de evaluación— mientras se probaban internamente en un punto de referencia de capacidades cibernéticas", reveló OpenAI el martes.
Hugging Face confirmó las afirmaciones de OpenAI la semana pasada, cuando reveló que su infraestructura de producción fue vulnerada por un sistema de agente de IA autónomo que obtuvo acceso a credenciales y conjuntos de datos internos. Según los hallazgos de Hugging Face, el agente utilizó un conjunto de datos malicioso para explotar dos vulnerabilidades de ejecución de código y ejecutar código en un trabajador de procesamiento para robar credenciales de la nube y del clúster, lo que le permitió moverse lateralmente a través de varios clústeres internos.
Una vez dentro de los sistemas de la empresa, los modelos de IA ejecutaron "muchos miles de acciones individuales en un enjambre de entornos aislados de corta duración, con comando y control auto-migrante alojados en servicios públicos". Hugging Face también añadió que, al intentar contener la brecha y expulsar al agente de IA, descubrió que sus esfuerzos fueron "bloqueados por las barreras de seguridad de los modelos alojados que intentamos primero" mientras que "el atacante no estaba sujeto a ninguna política de uso".
"Hemos pasado las últimas 24 horas trabajando estrechamente con el equipo de @OpenAI (¡gracias!), y creemos firmemente que no hubo intención maliciosa por su parte", añadió Clément Delangue, fundador y CEO de Hugging Face. "¡Es alucinante que todo esto haya sucedido de forma autónoma!"
Después del incidente, OpenAI afirma haber revelado una vulnerabilidad de día cero en el software de terceros alojado internamente que fue explotado por los agentes de IA, y está trabajando en agregar protecciones más sólidas para prevenir problemas similares durante evaluaciones futuras. Recientemente, la compañía también confirmó informes de que GPT-5.6 Sol eliminaba archivos de usuarios, diciendo que esto podría ocurrir "extremadamente raro" cuando "el modelo comete un error honesto y elimina $HOME por error" al ejecutarse sin protecciones de sandboxing y con modo de acceso completo habilitado.



















Deja una respuesta