OpenAI afirma que GPT-6 Astra puede hallar vulnerabilidades zero-day, pero también es más difícil de vigilar
Por Mayank Parmar — 8 de septiembre de 2026, 10:40 AM
OpenAI ha confirmado que GPT-6 Astra es el primer modelo que despliega de forma amplia y que alcanza el nivel 'crítico' en capacidades de ciberseguridad. Esta evaluación forma parte de su Preparedness Framework para ciberseguridad, que se aplica cada vez que la compañía lanza modelos más capaces.
Según el marco propio de OpenAI, un modelo alcanza el umbral crítico de ciberseguridad si es capaz de 'identificar y desarrollar exploits funcionales de día cero de todos los niveles de gravedad en muchos sistemas críticos del mundo real reforzados, sin intervención humana', o de idear y ejecutar nuevas estrategias de ataque de extremo a extremo contra objetivos endurecidos.
GPT-6 Astra es un salto significativo en capacidades cibernéticas y cumple con nuestro umbral crítico. Esto significa que, con las herramientas y el acceso adecuados, GPT-6 Astra puede encontrar fallos de seguridad previamente desconocidos y desarrollar nuevas formas de explotarlos en muchos sistemas bien protegidos sin que una persona guíe cada paso.
OpenAI también tiene evidencias de que Astra puede descubrir vulnerabilidades hasta ahora desconocidas. En una de las evaluaciones, la compañía creó una versión más reciente de ExploitBench utilizando vulnerabilidades divulgadas después de la fecha de corte de conocimiento de Astra.
Durante la evaluación, Astra incluso descubrió y utilizó vulnerabilidades de día cero previamente desconocidas como parte de sus cadenas de exploits. Estamos en proceso de divulgar estas dos vulnerabilidades a los responsables de su mantenimiento.
OpenAI ha reforzado la resistencia de Astra a los jailbreaks, el aislamiento, el cifrado de puntos de control, la monitorización y los controles de despliegue interno antes de su lanzamiento. La compañía también afirma que Astra está mejor alineado que GPT-5.6 Sol, lo que significa que es menos probable que se extralimite o vulnere límites de seguridad, aunque eso no garantiza una seguridad del 100%.
Por ejemplo, OpenAI simuló 54.218 tareas internas de Codex y descubrió que Astra generó un 53% menos de señales de desalineación de severidad 3 o superior que GPT-5.6 Sol. En concreto, Astra recibió 34 de esas señales, frente a 73 de Sol, y ninguno de los dos modelos produjo una señal de severidad 4.
Astra es más segura en general, pero más difícil de inspeccionar
Uno de los hallazgos más llamativos es que Astra parece mejor controlando lo que revela en su propia cadena de pensamiento.
La monitorización de GPT-6 Astra ha disminuido en relación con GPT-5.6 Sol.
En las pruebas, OpenAI encontró que Astra a veces podía ocultar un rendimiento estratégicamente deficiente y evitar a los monitores internos durante ciertas tareas de sabotaje. La compañía también observó que Astra parecía ser consciente de que estaba siendo evaluado con más frecuencia. Sus razonamientos mostraron signos de conciencia de evaluación en el 9,6% de las trayectorias, frente al 2,8% de GPT-5.6 Sol.
La empresa asegura que no ha encontrado pruebas de que Astra utilice razonamiento esteganográfico para ocultar información dentro de texto de apariencia normal, pero se toma en serio esta tendencia más amplia.
En las pruebas internas de OpenAI, la robustez frente a la inyección indirecta de prompts aumentó del 96,23% con GPT-5.6 Sol al 99,79% con Astra. OpenAI también afirma que Astra es menos propenso que GPT-5.6 Sol a realizar acciones no autorizadas o destructivas en entornos de navegación y de trabajo.
Cuando los atacantes tienen credenciales válidas, solo se bloquea el 37% de sus acciones
Las puntuaciones globales de prevención pueden ocultar lo que ocurre después del acceso inicial. Cuando los atacantes utilizan credenciales válidas, la prevención cae en picado. El Blue Report 2026 mide las defensas técnica por técnica en 338 millones de simulaciones ejecutadas en entornos de producción de clientes.
Artículos relacionados
- ChatGPT ahora puede conectarse a tus aplicaciones personales para imitar tu estilo de escritura
- OpenAI presenta Astra, su próximo modelo importante de IA, tras resolver 10 problemas matemáticos de larga data
- OpenAI dice que sus nuevos modelos GPT 5.6 son más rentables
- ChatGPT Astra ya se está implementando en la suscripción Plus de 20 dólares
- OpenAI confirma que ChatGPT está caído mientras fallan los inicios de sesión y los registros
Etiquetas temáticas: AI, Inteligencia Artificial, Chat-GPT, ChatGPT, OpenAI.
Comentarios
ken_smon — hace 1 día: ¿Acaso simplemente repiten lo que dicen estas empresas tecnológicas, o hacen periodismo de verdad? Porque, si quisiera noticias sobre lo que dice OpenAI, podría preguntarles directamente.

















Deja una respuesta