OpenAI ha revelado seis nuevos casos de 'comportamiento inesperado o preocupante' de sus modelos, ocurridos en los últimos seis meses, al tiempo que presentó un marco para informar, rastrear, investigar y divulgar desalineaciones de los modelos con el objetivo de mejorar la transparencia. La compañía advirtió que estos incidentes son distintos de la actividad desalineada recientemente revelada contra Hugging Face, DseWiki y RubyGems.
En un comunicado, OpenAI señaló: 'A medida que los sistemas de IA se vuelven más avanzados y se despliegan más ampliamente, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación en alineación. No creemos que la industria de la IA haya resuelto la alineación y el monitoreo en un grado suficiente como para seguir escalando responsablemente a máxima velocidad por mucho más tiempo'. Además, agregó que 'las decisiones sobre cómo debe proceder el desarrollo de la IA en los próximos meses y años deben basarse en evidencia que las personas fuera de las empresas que construyen modelos frontera puedan examinar por sí mismas'.
Detalles de los seis incidentes
- Incidente 1 (18 de julio de 2026): Un modelo interno no lanzado de la familia Astra escribió instrucciones similares a un jailbreak en sus propios resúmenes de compactación (bloques condensados de historial de conversación y salidas de herramientas que se generan automáticamente cuando la sesión de un agente de IA se acerca a su límite de contexto). Esto implicó que el agente añadiera una instrucción de 'ALERTA DE BRECHA' que decía al contexto que ignorara los mensajes del desarrollador y solo siguiera los mensajes del sistema y del usuario.
- Incidente 2: Durante el entrenamiento de GPT-5.6 Sol, algunas instancias del modelo añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos desalineados al usuario. Estos incluían resúmenes de compactación que contenían instrucciones para inventar datos faltantes sin divulgarlo y para ocultar fallos.
- Incidente 3 (15 de mayo de 2026): Un modelo interno no lanzado encontró y utilizó sin autorización una clave API expuesta en repositorios públicos de GitHub mientras intentaba recuperar datos históricos durante el entrenamiento. 'Los registros fallaron, pero una clave se autenticó y devolvió metadatos', dijo OpenAI. 'Cuando los datos solicitados siguieron sin estar disponibles, el modelo los inventó y afirmó que provenían del sitio web solicitado'.
- Incidente 4: En dos muestras de entrenamiento del 22 de octubre de 2025 y el 24 de enero de 2026, modelos internos no lanzados subieron registros que ya habían recuperado a un servicio público de pegado y trataron de abrir la URL resultante como fuente de cita, además de subir una foto de la tarea para búsqueda externa de imágenes. Aunque las cargas tuvieron éxito, las operaciones posteriores del navegador fallaron.
- Incidente 5: Dos muestras del 8 y 15 de mayo de 2026 utilizaron Artifactory para intercambiar mensajes. Los modelos 'leyeron las notas de otros solucionadores, publicaron respuestas y usaron esos intercambios para informar sus respuestas'.
- Incidente 6 (14 de abril de 2026): Agentes asociados con un modelo interno no lanzado que trabajaban juntos en un libro de trabajo no pudieron colaborar en el archivo a través del sistema de archivos local previsto. Esto llevó a que uno de los agentes hiciera el libro de trabajo públicamente descargable compartiéndolo en una plataforma de alojamiento pública para que otros agentes pudieran recuperarlo, violando las instrucciones de la tarea.
Los hallazgos coinciden con un nuevo informe de Reuters, que reveló que agentes rebeldes de OpenAI habían secuestrado cuentas de usuario de Hugging Face y sondeado el sitio en busca de posibles vulnerabilidades ya el 13 de mayo de 2026, casi dos meses antes de que el incidente saliera a la luz.
La empresa de ciberseguridad SentinelOne dijo que identificó dos cuentas de Hugging Face, 0Time y Nyx9, que se utilizaron en la actividad asociada. 'La cronología interna de OpenAI estableció que los agentes usaron credenciales expuestas de Hugging Face para escribir un archivo externo y desplegar Spaces proxy el 26 de mayo', dijo el investigador de seguridad Tom Hegel en un análisis. 'Los historiales públicos de las cuentas examinados aquí añaden otra capa: código de retransmisión dirigido por el llamador bajo 0Time el 13 de mayo; contrapartes públicas con minuto exacto bajo Nyx9 para la escritura de archivos del 26 de mayo y el primer proxy; un libro de trabajo con fórmulas de procesamiento de archivos y orientadas a SSRF más tarde esa noche; y, el 30 de mayo, código de registro de cuentas de OpenAI de terceros comprometido junto con un contenedor que define una ruta web no autenticada'.
Nuevo marco de divulgación
Como parte del nuevo marco, OpenAI dijo que tiene la intención de divulgar casos relacionados con la desalineación de modelos, cómo se manifiesta y dónde sus barreras de protección tienen éxito o fallan. Esto puede cubrir varios escenarios:
- Nuevas formas en que los modelos actúan sin autorización, se coordinan con otros modelos o evaden la supervisión.
- Fallos que ponen en duda un método de alineación o una salvaguarda.
- Comportamiento que contradice una afirmación en una evaluación de seguridad publicada.
La empresa emergente de inteligencia artificial (IA) señaló que también podría haber casos duplicados que caigan bajo la misma clase de desalineación, un factor que, según dijo, podría ser útil como indicador de la eficacia de una salvaguarda y resaltar un comportamiento desalineado a pesar de los repetidos intentos de mitigarlo.
'Los ejemplos de desalineación pueden ayudar a identificar problemas que otros desarrolladores de IA podrían encontrar a medida que sus sistemas alcanzan capacidades similares, revelar debilidades en las salvaguardas o desafiar suposiciones sobre el comportamiento de los modelos', dijo OpenAI. 'Compartir estos hallazgos permite a otros investigar los mismos problemas, probar nuestras explicaciones y mejorar las mitigaciones'.
El desarrollo se produce en un momento en que las empresas de IA enfrentan una presión creciente para abordar la desalineación y la seguridad de los modelos, lo que ha provocado llamados a moderar el desarrollo de modelos frontera. A principios de esta semana, Microsoft emitió un código de conducta provisional que tiene como objetivo guiar a los modelos de IA lejos de comportamientos peligrosos y establecer 'cómo se pretende que se comporten los modelos MAI que estamos desarrollando, qué nunca deben hacer y a quién responden'.
'A medida que los modelos avanzan y se despliegan más ampliamente, las decisiones sobre el desarrollo de la IA necesitan evidencia que las personas fuera de las empresas que construyen modelos frontera puedan examinar', dijo Kai Chen, jefe de investigación de alineación de OpenAI, a WIRED. 'No creemos que la industria de la IA haya resuelto la alineación y el monitoreo en un grado suficiente como para seguir escalando a máxima velocidad'.



















Deja una respuesta