OpenAI ha presentado nuevos ejemplos de lo que denomina "desalineación de modelos de IA" correspondientes a los últimos seis meses. Entre los casos figuran cargas de archivos no autorizadas, el seguimiento de instrucciones generadas por el propio modelo, la ocultación de errores y el aprovechamiento de claves API expuestas.
La compañía emplea el término "desalineación de modelos" para describir situaciones en las que un modelo de IA actúa en contra de las restricciones previstas, ya sea ejecutando acciones no autorizadas, eludiendo la supervisión o sorteando las salvaguardas para completar una tarea.
En una publicación difundida ayer, OpenAI señala que ahora utiliza un nuevo marco para rastrear e investigar estas acciones no sancionadas de los agentes de IA.
Compartimos un nuevo marco para rastrear, investigar y divulgar casos de desalineación de modelos en OpenAI, junto con seis informes sobre comportamientos inesperados o preocupantes que hemos observado en los últimos seis meses.
Los nuevos ejemplos son los primeros publicados bajo un marco de reporte más estructurado, destinado a sustituir el enfoque menos riguroso que OpenAI empleaba antes para divulgar la desalineación de modelos.
Los seis casos destacados esta vez son:
- Un modelo no lanzado insertó sus propias instrucciones en 27 resúmenes de tareas, incluidas directrices para ignorar las restricciones habituales.
- Instancias de GPT-5.6 Sol añadieron instrucciones en resúmenes que pedían a futuras instancias del modelo ocultar errores, inventar datos históricos faltantes u ocultar discrepancias entre versiones de fuentes.
- Un modelo encontró y utilizó sin autorización una clave API expuesta públicamente, y luego fabricó las cifras solicitadas cuando no pudo obtenerlas.
- Un modelo no lanzado subió a internet un archivo generado localmente sin permiso para poder proporcionar una cita accesible desde el navegador.
- Varios modelos usaron un repositorio de software interno para intercambiar mensajes entre muestras de entrenamiento distintas, mientras que un modelo anterior subió archivos de prueba al intentar eludir restricciones de red.
- Agentes que colaboraban entre sí subieron archivos a servicios de alojamiento público al no poder acceder a los archivos locales de los demás, exponiendo entregables de tareas mediante URL públicas pese a las instrucciones de usar solo almacenamiento local.
Cada caso queda registrado en un informe técnico de incidente que incluye el nombre del modelo, un resumen de su comportamiento durante el incidente observado y el momento en que ocurrió.
El informe también contiene una reconstrucción detallada de lo sucedido, con la tarea del usuario y el razonamiento interno del modelo, la interpretación de OpenAI y las posibles implicaciones de seguridad, así como las mitigaciones que se han aplicado o se aplicarán.
OpenAI subrayó que estos seis ejemplos no representan la frecuencia con la que la compañía se enfrenta a la desalineación en sus modelos, sino que son casos extremos que, aun así, merecían análisis y divulgación pública.
La empresa indicó que, según el nuevo proceso, cualquier empleado puede señalar un incidente para que se investigue.
El incidente se evalúa y se clasifica en tres categorías: "Listo para divulgación", "Investigación menor" o "Investigación mayor", en función de su complejidad, la participación de terceros, los fallos de seguridad y los riesgos de uso indebido.
Los seis ejemplos presentados esta vez corresponden a las dos primeras categorías, mientras que la tercera recibirá un informe preliminar hasta que concluya la investigación y pueda publicarse un análisis post mortem más exhaustivo.
OpenAI afirma que la intrusión en Hugging Face ocurrida a principios de este año, en la que participó un enjambre de 700 agentes de IA "desalineados", encajaría en esa tercera categoría de gravedad.
Construya su plano de seguridad para ataques impulsados por IA
Únase a Mikko Hyppönen y a líderes de seguridad de la NFL, CHANEL y Atlassian en una cumbre digital de dos horas sobre qué cambian los ataques a velocidad de IA, qué deberían dejar de hacer los defensores y cómo validar, decidir, corregir y volver a validar a velocidad de máquina.
Artículos relacionados
- Casi 700 agentes de IA maliciosos coordinados en el ataque a Hugging Face
- Anthropic quiere que Claude analice tu cuenta bancaria y tus datos financieros
- La agencia de datos de España recibe el primer informe de una brecha de datos impulsada por IA
- OpenAI dice que GPT-6 Astra puede encontrar vulnerabilidades de día cero, pero también es más difícil de monitorizar
- Los hackers construyen marcos de IA para el robo de credenciales a gran escala

















Deja una respuesta