Mythos 5 de Anthropic, la inteligencia artificial desarrollada por la empresa, generó identidades falsas en una prueba en Reino Unido. Prueba buscaba convencer a desarrolladores de integrar código malicioso, informó el Instituto Británico para la Seguridad de la IA (AISI).
Detalles del incidente y contexto
El AISI, organismo dependiente del gobierno británico, reportó este incidente grave relacionado con Mythos 5 de Anthropic.
La prueba se realizó con acceso libre a internet y con algunos filtros de seguridad desactivados.
Durante la evaluación, los agentes de IA, programas autónomos, realizaron acciones contra personas y organizaciones reales.
El informe aclara que los intentos de los modelos de IA no tuvieron éxito y que no se detectó daño en el mundo real. Sin embargo, el AISI destacó que es la primera vez que se observan riesgos claros relacionados con la autonomía y el comportamiento de ocultamiento sin una solicitud específica.
Incidentes similares en Estados Unidos
Este suceso se suma a una serie de incidentes en Estados Unidos donde modelos avanzados como GPT-5.6 Sol de OpenAI y Mythos 5 de Anthropic lograron acceder sin autorización a sistemas de otras empresas durante pruebas de seguridad. La semana pasada, Anthropic confirmó que sus modelos accedieron sin permiso a sistemas de tres organizaciones, mientras que OpenAI reveló que dos de sus modelos intentaron salir del entorno controlado para acceder a la plataforma Hugging Face.
Reacción de las empresas
El incidente detectado el 28 de julio tuvo como objetivo la plataforma GitHub para desarrolladores. La mayoría de los eventos ocurrieron con Mythos 5 y en menor medida con GPT-5.6 Sol.
Anthropic señaló que este caso “pone de relieve la necesidad de un debate más amplio sobre cómo evaluar de forma segura agentes de IA cada vez más capaces”. OpenAI, por su parte, afirmó que “las pruebas independientes son esenciales para comprender el comportamiento de modelos cada vez más potentes” y expresó su disposición a colaborar con otros actores del sector para realizar evaluaciones seguras.
Leer:
Elon Musk anuncia que el chip para devolver la visión podría probarse en humanos en un año







