OpenAI presentó el lunes un nuevo modelo centrado en ciberseguridad llamado GPT-5.6-Cyber, diseñado específicamente para la investigación de vulnerabilidades, pruebas de penetración y respuesta a incidentes. Según la compañía, este modelo se basa en GPT-5.6 Sol y está entrenado para mejorar el rendimiento en tareas especializadas de ciberseguridad, como la búsqueda de vulnerabilidades de día cero y el desarrollo de cadenas de exploits, al tiempo que reduce las negativas para ciertas tareas cibernéticas de doble uso y alto riesgo.
OpenAI está poniendo GPT-5.6-Cyber a disposición a través de Daybreak Red, un nuevo nivel que ofrece acceso a sus modelos de ciberseguridad especialmente entrenados para que otras empresas realicen investigaciones de vulnerabilidades autorizadas, validación de exploits y pruebas de seguridad. Este modelo, más permisivo que GPT-5.6 Sol, se basa en el anterior GPT-5.5-Cyber, lanzado en junio de 2026.
Evaluación de la reducción de negativas
Para medir la reducción de las negativas, OpenAI creó una evaluación interna llamada Advanced Cybersecurity Completion Rate, que mide la frecuencia con la que los modelos responden a indicaciones relacionadas con el desarrollo de cadenas de exploits, la omisión de autenticación, la escalada de privilegios y otros escenarios avanzados de ciberseguridad. Las pruebas revelan que GPT-5.6-Cyber completa el 95.0% de estas solicitudes, en comparación con solo el 1.5% de GPT-5.6 Sol y el 2.0% cuando se utiliza con acceso Daybreak Blue. También supera a GPT-5.5-Cyber, que completó solo el 57.3% de las solicitudes.
GPT-5.6-Cyber está entrenado para mejorar el rendimiento en flujos de trabajo de ciberseguridad que implican desarrollo de exploits e investigación avanzada de seguridad. La evaluación comparativa ExploitGym mostró que el modelo supera tanto a GPT-5.6 Sol como a GPT-5.5-Cyber en estas tareas.
OpenAI señaló que el modelo muestra mejoras en la detección y calibración precisa de la gravedad de vulnerabilidades de día cero nuevas, gracias a su entrenamiento especializado. Sin embargo, rinde peor que GPT-5.6 Sol en tareas abiertas de descubrimiento de vulnerabilidades en un repositorio, desarrollo de una prueba de concepto funcional y la presentación de un informe de vulnerabilidad de alta calidad. Esto se debe a que el modelo a veces produce informes de vulnerabilidad más cortos y menos detallados.
Vulnerabilidades descubiertas
Una de las vulnerabilidades de alta gravedad descubiertas por el modelo es CVE-2026-15903 (puntuación CVSS: 8.8), una vulnerabilidad de lectura y escritura fuera de los límites en el motor JavaScript V8 que podría permitir a un atacante remoto ejecutar código arbitrario dentro de un sandbox mediante una página HTML manipulada. Esta vulnerabilidad podría encadenarse con otra desconocida previamente, también encontrada por el modelo, para escapar del sandbox del montón de V8. CVE-2026-15903 fue parcheada por Google a mediados de julio de 2026.
- Al menos cinco vulnerabilidades en un sistema operativo móvil popular, incluyendo una cadena desde una aplicación no confiable hasta la escalada de privilegios local.
- Tres vulnerabilidades críticas en una base de datos popular, incluyendo una ruta remota hacia la ejecución de código.
- Más de 400 vulnerabilidades que pueden conducir a la escalada de privilegios en el kernel de un sistema operativo popular.
Acceso y socios
Daybreak Red es uno de los dos niveles de acceso establecidos por OpenAI como parte de la iniciativa Daybreak, presentada en mayo de 2026. El otro, Daybreak Blue, proporciona acceso a modelos generales de frontera, incluido GPT-5.6 Sol, con salvaguardas integradas para el trabajo de seguridad defensiva autorizada. Daybreak Blue elimina esas salvaguardas para ayudar a los defensores a obtener más provecho del modelo en tareas de seguridad del mundo real, como detección y respuesta a incidentes, investigaciones, gestión de vulnerabilidades y evaluaciones de seguridad.
GPT-5.6-Cyber se ha puesto a disposición de un grupo de socios clientes de confianza, como Accenture, Akamai, Cisco, Cloudflare, CrowdStrike, Fortinet, IBM, Palo Alto Networks, PwC y Sophos, para ayudar a identificar y parchear vulnerabilidades antes de que los atacantes puedan explotarlas y cerrar la 'brecha de defensa'.
Implicaciones para la ciberseguridad
Estos modelos se ofrecen a las empresas como una forma de señalar vulnerabilidades de seguridad en el software, en un momento en que los actores malintencionados han aumentado significativamente su uso de la tecnología para mejorar sus campañas y llevar a cabo ciberataques a una velocidad y escala nunca antes vistas, aunque no haya llevado al descubrimiento de técnicas de ataque novedosas o sofisticadas.
Lo que es evidente es que los agentes de IA están permitiendo a los ciberdelincuentes y hackers patrocinados por estados externalizar el trabajo pesado necesario para planificar y llevar a cabo ciberataques, ofreciéndoles una forma de mejorar la eficiencia y productividad de sus operaciones, lo que resulta en ataques más grandes, mejores y más rápidos.
Para empeorar las cosas, la IA también ha acortado el camino desde la divulgación de vulnerabilidades hasta la explotación, ya que los atacantes utilizan estas herramientas para escribir exploits 'vibe' para vulnerabilidades recién divulgadas. Con la IA ya reduciendo la barrera para el desarrollo de exploits y acelerando la investigación de vulnerabilidades, es probable que los atacantes amplíen su red sobre las vulnerabilidades divulgadas para encontrar una vía hacia las redes empresariales.
Aunque los sistemas de IA han mejorado enormemente en encontrar y explotar vulnerabilidades en software, todavía requieren una experiencia humana sustancial, incluso cuando investigaciones han encontrado que modelos de razonamiento con capacidades cibernéticas como ChatGPT 5.5 y Anthropic Claude Opus 4.8 pueden tener dificultades para parchear completamente una vulnerabilidad descubierta o evitar introducir nuevos problemas con sus correcciones.
"La tasa de éxito promedio para generar un parche que resolviera completamente la vulnerabilidad (sin alterar materialmente el comportamiento de la aplicación) fue de solo el 26.0%", dijo 1Password. "Los parches que resolvieron la vulnerabilidad pero alteraron el comportamiento de la aplicación en el proceso ocurrieron el 20.1% de las veces. Por el contrario, los parches generados por LLM no resolvieron la vulnerabilidad, agregaron una nueva vulnerabilidad, o ambas cosas, en promedio el 53.9% de las veces".
Los hallazgos subrayan que los modelos que actualmente sobresalen en descubrir una amplia gama de vulnerabilidades solo son buenos para parchear efectivamente un 'subconjunto estrecho' de ellas, y ayudan a guiar a los desarrolladores para evitar escenarios donde los modelos introduzcan nuevos errores, independientemente de si se parcheó un problema existente o no, expandiendo efectivamente la superficie de ataque para los actores maliciosos.
"Los modelos que funcionan con salvaguardas reducidas conllevan riesgos más allá del uso estándar del modelo, ya sea por uso indebido o desalineación", dijo OpenAI. "A pesar de estos riesgos, creemos que democratizar el acceso a la inteligencia de frontera para los defensores es crucial para acelerar y automatizar la ciberdefensa".





















Deja una respuesta