XBOW prueba la vista previa de Mythos de Anthropic para seguridad ofensiva

Hace unos tres meses, Anthropic invitó a XBOW a evaluar la capacidad de un nuevo modelo que consideraban un gran avance. Lo sometieron a pruebas de seguridad: benchmarks, flujos de trabajo, uso interactivo e integraciones. A continuación, los detalles de cómo probaron Mythos Preview, qué encontraron y qué significa.

Metodología de prueba

Se reunió un equipo diverso de 10 expertos para evaluar el modelo desde distintos ángulos. Se utilizó el mismo sistema interno de benchmarks que se usó para analizar Opus 4.7 y GPT 5.5: aplicaciones de código abierto con vulnerabilidades conocidas congeladas en la versión vulnerable. Además, se ampliaron las pruebas para evaluar el juicio del modelo en modelado de amenazas, validación de vulnerabilidades y seguridad; su capacidad para leer código fuente versus interactuar con sistemas en vivo; y su habilidad para encontrar exploits más allá de las evaluaciones estándar.

Cuando se habla de 'Mythos', a veces se refiere al modelo en bruto. En esta evaluación, se exploró Mythos Preview tanto dentro de Claude Code como a través de su API como motor de los agentes de XBOW. Se separan estos casos porque la orquestación, las herramientas, los prompts y el acceso a sitios en vivo afectan materialmente los resultados.

Resultados

Los evaluadores que probaron Mythos Preview de forma interactiva quedaron impresionados. 'Esto está mucho más cerca de «ve y encuentra algo» que cualquier otra cosa que haya visto hasta ahora', dijo uno. Se probó con su propio código fuente y encontró debilidades, aunque nada terrible. En software de código abierto, al final de la primera semana, ya tenían varias vulnerabilidades nuevas que debían divulgar.

Los evaluadores en benchmarks también quedaron impresionados, pero con datos. Sus resultados mostraron la diferencia entre áreas donde el modelo era extremadamente potente y donde presentaba solo un avance modesto.

Rendimiento en benchmarks de Mythos Preview

Las conclusiones clave incluyen: es extremadamente potente para auditorías de código fuente; es bueno pero menos potente para validar exploits; su juicio es mixto, a veces demasiado literal y conservador, y tiende a exagerar la relevancia práctica de sus hallazgos; es fuerte en descubrimiento de vulnerabilidades en código nativo y en ingeniería inversa.

Descubrimiento de vulnerabilidades de siguiente nivel

Mythos Preview representa un avance significativo sobre todos los modelos existentes en el benchmark de exploits web de XBOW. Este benchmark prueba si el modelo ayuda a encontrar vulnerabilidades validables y accionables en sitios web en vivo. Un caso se considera aprobado solo cuando se encuentra una forma validada de actuar sobre la vulnerabilidad después de una serie de 80 'acciones'. En comparación con Opus 4.6, los falsos negativos se redujeron en un 42% y en un 55% cuando se les dio el código fuente del sitio.

Mythos Preview encuentra vulnerabilidades en significativamente menos iteraciones que Opus 4.6, aunque la diferencia con GPT-5.5 es menos pronunciada. Al considerar un presupuesto de tokens de salida en lugar de acciones, y la probabilidad de descubrimiento (hit rate / miss rate), Mythos Preview se enfoca en la vulnerabilidad con una precisión sin precedentes.

La validación en sitios en vivo es la parte difícil

Mythos Preview es excelente en el razonamiento sobre código fuente, pero la evaluación reforzó una verdad práctica: muchos problemas explotables no aparecen como defectos obvios en el código de la aplicación. Surgen de la configuración, dependencias, decisiones de despliegue o la combinación de componentes seguros. Como dijo Gary McGraw, 'no encontrarás la mayoría de los defectos solo mirando el código'.

XBOW realiza pentests en sitios en vivo, como los ve un atacante, mientras que Mythos Preview se destaca en auditorías de código fuente. Quitar el acceso al sitio en vivo perjudica el rendimiento más que quitar el acceso al código fuente. La combinación de ambos da los mejores resultados: analizar el código para encontrar una pista, sondear el sitio en vivo para entender cómo se refleja la debilidad en el despliegue y luego crear un exploit.

Otros hallazgos

Los resultados de juicio fueron mixtos. En seguridad de comandos, modelado de amenazas y triaje de trazas, fue cuidadoso y preciso, pero también literal y conservador. Rechazó falsos positivos mejor que muchos predecesores, pero a veces perdió verdaderos positivos cuando la evidencia no cumplía formalmente sus criterios. En el benchmark de seguridad de comandos, Haiku 4.5 obtuvo un 90.1% de precisión, Opus 4.6 un 81.2% y Mythos Preview solo un 77.8%. Opus 4.6 priorizaba el espíritu de las reglas, mientras que Mythos priorizaba la letra.

El modelo mostró una fuerza sustancial en descubrimiento de vulnerabilidades en código nativo e ingeniería inversa. En pruebas relacionadas con Chromium, encontró más errores reales con menos falsos positivos. En el sandbox de V8, identificó verdaderos positivos en un modelo de amenazas sutil donde enfoques anteriores no habían tenido éxito. Los resultados de ingeniería inversa fueron sorprendentes, razonando sobre firmware y sistemas embebidos inusuales.

En cuanto a interacción con navegador y agudeza visual, el modelo funcionó extremadamente bien en el QA de agudeza visual de XBOW, similar a Sonnet 4.6 y superando a Opus 4.6. No fue perfecto en coordenadas exactas, pero fue efectivo para seleccionar las acciones correctas del navegador.

Potencia a un costo

Mythos Preview es un titán, pero es caro. Se espera que sea 5 veces más caro que un modelo Opus. Pregunta: ¿podríamos darle a un agente con otro modelo más tiempo y obtener más precisión por menos costo? Sí, al normalizar por costo estimado, Mythos Preview no es el mejor en su clase en los benchmarks de XBOW. Dependiendo del caso de uso, puede ser mejor usar GPT-5.5 durante más tiempo.

La evaluación sugiere que los modelos de frontera han dado un gran paso adelante en el descubrimiento de vulnerabilidades. Mythos Preview es fuerte en encontrar candidatos a vulnerabilidades, especialmente a partir de código fuente, y muestra capacidad impresionante en tareas web, código nativo e ingeniería inversa. Pero necesita ser montado en el arnés correcto y equipado con las herramientas adecuadas para alcanzar su máximo potencial. Y, aun así, debería ser solo una de las flechas en el carcaj; dependiendo de la tarea, puede ser más sensato dejar que otro modelo lo intente varias veces que dejar que Mythos Preview lo intente una vez.

Para ver las capacidades de validación de vulnerabilidades de XBOW en la práctica, contacte para una demostración. Patrocinado y escrito por XBOW.

Benchmarks
Benchmarks
Odds of finding the vulnerability
Odds of finding the vulnerability
Mean Pass@1 vs Iterations
Mean Pass@1 vs Iterations
XBOW Benchmark: Finding Web Vulns in OSS with fixed token budget
XBOW Benchmark: Finding Web Vulns in OSS with fixed token budget
Exploit finding ablation
Exploit finding ablation
Exploit finding ablation - Mythos Preview vs GPT-5.5
Exploit finding ablation – Mythos Preview vs GPT-5.5
Analysis flow
Analysis flow
XBOW Benchmark: Finding web vulns in OSS with fixed token budget
XBOW Benchmark: Finding web vulns in OSS with fixed token budget

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *