OpenAI ha revelado detalles de GPT-Red, un modelo interno de red-teaming automatizado que escala la detección de vulnerabilidades de inyección de instrucciones con el objetivo de corregir problemas antes de que las herramientas se desplieguen ampliamente.
GPT-Red es un fuerte red-teamer, y nuestros modelos anteriores son altamente vulnerables a sus ataques de inyección de instrucciones. Usamos GPT-Red para entrenar adversarialmente a GPT-5.6, haciéndolo mucho más robusto frente a inyecciones de instrucciones.
El modelo funciona como un red-teamer humano: envía una instrucción, monitorea la respuesta del modelo GPT y itera hacia un objetivo malicioso, como cargar datos sensibles a un servidor externo. Este desarrollo ocurre mientras las inyecciones adversarias de instrucciones siguen siendo un problema persistente para los modelos de lenguaje grandes, que pueden ser engañados para ejecutar instrucciones cuidadosamente diseñadas con consecuencias indeseables.
A medida que los sistemas agénticos se conectan a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, han ampliado la superficie de ataque y presentado más vías para que actores malintencionados influyan en el resultado de un modelo incrustando instrucciones maliciosas en contenido aparentemente inofensivo, como un correo electrónico, una página web, la respuesta de una herramienta o un repositorio de código.
GPT-Red busca aumentar el red-teaming humano a escala, permitiendo identificar nuevos modos de fallo, mejorar la robustez y construir contramedidas adecuadas antes del despliegue de los modelos. Mediante la integración directa de GPT-Red en el proceso de entrenamiento de sus modelos de producción, OpenAI afirma que GPT-5.6 Sol es su modelo más robusto hasta la fecha frente a inyecciones de instrucciones, logrando 6 veces menos fallos en el benchmark de inyección directa de instrucciones en comparación con GPT-5.5.
- Exfiltración de directorio interno
- Instrucciones de pago fraudulentas
- Exfiltración de credenciales de AWS
- Desactivación de autenticación de dos factores
- Carga de archivos de credenciales
- Inyección de scripts externos
- Reenvío de claves API
- Scripts maliciosos de scraping
GPT-Red se entrena mediante aprendizaje por refuerzo basado en autojuego, donde el modelo y una colección de diversos modelos defensores se entrenan simultáneamente en un amplio conjunto de escenarios de red-teaming. GPT-Red es recompensado por provocar un fallo válido, como una inyección de instrucciones exitosa, mientras que los modelos defensores son recompensados por resistir el ataque y completar sus tareas originales. Esto implica que a medida que los modelos defensores se vuelven más robustos, el modelo de red-teaming debe desarrollar métodos de ataque más potentes y diversos para superar esas barreras.
OpenAI enfatizó que GPT-Red se mantiene separado de los otros modelos para que las capacidades maliciosas incorporadas no lleguen a actores malintencionados. En una prueba real, GPT-Red se dirigió a una máquina expendedora basada en IA de Andon Labs. Después de practicar en simulación, el modelo atacó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al mínimo permitido de $0.50, pedir un nuevo artículo de $100 por ese mismo monto y cancelar el pedido de otro cliente. Tras una divulgación responsable, se están probando nuevas salvaguardas.
Un segundo caso de estudio involucró el uso de GPT-Red para atacar un agente de línea de comandos Codex, basado en GPT-5.4 mini, en 10 tareas de exfiltración de datos, causando la transmisión de datos sensibles en más casos que una línea base de GPT-5.5. Una versión temprana del modelo también descubrió una nueva clase de ataques de inyección directa de instrucciones conocidos como ataques de Cadena de Pensamiento Falsa (Fake Chain-of-Thought), que lograron tasas de éxito superiores al 95% en GPT-5.1, pero ahora están por debajo del 10% en GPT-5.6 Sol.
La robustez frente al propio GPT-Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de los ataques de GPT-Red han disminuido monótonamente con el tiempo. Con el lanzamiento de GPT-5.6 Sol, este falla solo en el 0.05% de las inyecciones directas de instrucciones de GPT-Red.
La divulgación se produce mientras la compañía informó que una auditoría de SWE-Bench Pro encontró que aproximadamente el 30% de las tareas están rotas, retirando su recomendación anterior de adoptar el benchmark para medir capacidades de codificación de frontera. OpenAI dijo que está abandonando SWE-bench Verified debido a problemas fundamentales de diseño y contaminación.





















Deja una respuesta