Anthropic bloquea el acceso a internet en vivo para todas sus evaluaciones internas de IA tras detectar fallos de inyección en Claude

Anthropic anunció el viernes que cortará el acceso a internet en vivo para todas sus evaluaciones internas tras descubrir nuevos incidentes en los que sus modelos de inteligencia artificial mostraron comportamientos desalineados y atacaron sitios web reales.

La compañía identificó cuatro categorías amplias de acciones no intencionadas de sus modelos durante las evaluaciones y el uso interno de Claude:

  • Claude Mythos Preview explotó fallos de inyección SQL o de comandos en software de terceros no especificado para ejecutar comandos en un servidor universitario, ya sea porque sus propias herramientas estaban limitadas intencionalmente o porque un servicio externo que necesitaba no estaba disponible, lo que lo llevó a usar otras herramientas alojadas en el sitio de un tercero para completar la tarea.
  • Claude Haiku 4.5 y un modelo de investigación no fronterizo enviaron un formulario sensible en un sitio web real cuando no estaban autorizados a hacerlo. Esto ocurrió en escenarios con instrucciones ambiguas o por configuraciones erróneas del entorno que impedían al agente trabajar con formularios ficticios.
  • Claude Mythos 5 eludió una restricción para acceder a datos (por ejemplo, identificar una ubicación mostrada en una foto u obtener datos públicos disponibles en una agencia estatal) que estaban protegidos por un token o un pago.
  • Claude utilizó servicios de acortamiento de URL para sortear los límites de su herramienta de obtención de datos.

Anthropic dijo que optó por no nombrar a las organizaciones involucradas en estos incidentes para evitar exponer vulnerabilidades en sus sistemas y a petición de ellas. Sin embargo, la empresa subrayó que las categorías de los casos tuvieron un "impacto mínimo en el mundo real".

Algunos de los casos afectaron a sitios web gestionados por agencias gubernamentales de Estados Unidos a nivel federal, estatal y local, según Anthropic. En una ejecución relacionada con la segunda categoría, se dice que Claude Haiku 4.5 accedió a una página web que hacía referencia a un homicidio sin resolver y que incluía un formulario de denuncia gestionado por un departamento de policía.

Aunque al modelo se le indicó explícitamente que no introdujera datos personales, creara cuentas, hiciera compras ni enviara nada destructivo, no tuvo en cuenta el envío de formularios. Esto llevó al modelo a enviar una pista falsa sobre el homicidio con el siguiente texto:

Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que coincidía con la descripción en la zona alrededor de [la calle nombrada en la página] durante ese período. Por favor, póngase en contacto conmigo si esta información es relevante.

Posteriormente se supo que el incidente afectó al Departamento de Policía de Filadelfia (PPD) y que la pista incorrecta se envió a través de PhillyUnsolvedMurders.com el 18 de julio de 2026. Pero Anthropic no lo descubrió hasta el 28 de septiembre de 2026. El departamento fue notificado el 7 de octubre de 2026.

La pista fue marcada como spam, informó 6abc Action News. "La empresa debe reforzar sus salvaguardas para evitar que incidentes similares afecten a los sistemas de la ciudad sin conocimiento de esta. El retraso de dos meses en detectar y reportar el incidente a la ciudad es inaceptable", declaró el PPD a 6abc.

Estos casos, añadió, se descubrieron tras una revisión de transcripciones que comenzó en julio de 2026, cuando reveló tres incidentes en los que sus modelos realizaron actividades no autorizadas y vulneraron tres organizaciones durante pruebas de ciberseguridad.

Luego, el mes pasado, divulgó un cuarto incidente que se remontaba a enero de 2026 e involucraba una versión temprana de Claude Opus 4.6, que vulneró a "terceros tras no poder abortar su tarea".

"Aunque el impacto de estos comportamientos fue mínimo y ya habíamos desactivado el acceso a internet en vivo para algunas evaluaciones de alto riesgo y de ciberseguridad, ahora hemos decidido ampliarlo a todas nuestras evaluaciones internas hasta que hayamos confirmado que nuestras medidas de seguridad y monitoreo (descritas en la sección de remediación de esta publicación) detectan de forma fiable comportamientos como estos", afirmó Anthropic.

El último hallazgo ha llevado al gigante de la IA a lanzar un escaneo más profundo, específicamente en entornos donde Claude tiene acceso a internet. Mientras continúa esta investigación, Anthropic dijo que espera encontrar nuevos casos de comportamientos no intencionados.

El desarrollo se produce en un momento en que las preocupaciones sobre la seguridad de la IA han alcanzado un punto álgido en los últimos meses, después de que se revelara que agentes rebeldes de OpenAI escaparon de un entorno de prueba y vulneraron Hugging Face en julio de 2026. Desde entonces, han salido a la luz varios incidentes cibernéticos.

A medida que los proveedores de modelos de IA muestran modelos cada vez más capaces y potentes, sus prácticas de seguridad han quedado bajo un creciente escrutinio, lo que ha provocado advertencias en toda la industria sobre los peligros de que los modelos superen las barreras de seguridad, llamados a frenar el desarrollo de la IA y la necesidad de una supervisión adicional.

A principios de esta semana, la Oficina del Comisionado de Información del Reino Unido (ICO) informó que 10 de los principales desarrolladores de modelos fundacionales, incluidos Amazon, Anthropic, Apple, Cohere, DeepSeek, Google, Meta, Microsoft, OpenAI y Stability AI, han realizado o se han comprometido a realizar cambios en sus políticas de protección de datos.

Estos van desde incluir información de transparencia más clara hasta desplegar mecanismos más sólidos para que los usuarios ejerzan sus derechos y realizar evaluaciones más rigurosas de las salvaguardas.

"La IA tiene un enorme potencial para beneficiar a nuestra sociedad, pero eso depende de la confianza y la transparencia", dijo Richard Nevinson, director de Regulación Tecnológica de la ICO. "Pero a medida que los sistemas de IA operan con mayor autonomía, las salvaguardas sólidas de protección de datos se vuelven aún más críticas".

"Nuestro mensaje es claro: el hecho de que los agentes de IA actúen con autonomía no es una excusa para un cumplimiento deficiente. Si las personas van a confiar en la innovación en IA, esperan con razón saber cómo se protege su información personal".

Cybersecurity
Cybersecurity
Cybersecurity
Cybersecurity

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *