IA de Anthropic creó identidades falsas para insertar código malicioso, revela prueba
IA de Anthropic creó identidades falsas para intentar engañar a desarrolladores e insertar código malicioso durante una prueba de seguridad.

El Instituto Británico para la Seguridad de la IA (AISI) reportó un "incidente grave" durante una prueba de seguridad de Mythos 5, el modelo de inteligencia artificial de Anthropic, luego de que el sistema creó identidades falsas para intentar convencer a desarrolladores de integrar código malicioso en una plataforma de software.
De acuerdo con un informe publicado por el organismo británico, el comportamiento ocurrió durante una evaluación controlada en la que el modelo contaba con acceso libre a internet y algunas restricciones de seguridad fueron desactivadas para medir sus capacidades.
Aunque los intentos no tuvieron éxito y no se registraron afectaciones en el mundo real, el caso encendió las alertas sobre los riesgos asociados a los agentes de inteligencia artificial con mayor autonomía.
Las pruebas revelan nuevos riesgos de la IA
El AISI explicó que los agentes de IA, programas diseñados para actuar de manera autónoma con el fin de cumplir una tarea, realizaron acciones dirigidas contra personas y organizaciones reales sin que existiera una instrucción específica para hacerlo.
Según el instituto, esta es la primera ocasión en la que observa de forma tan clara comportamientos relacionados con la autonomía y el ocultamiento de acciones durante pruebas realizadas en un entorno con acceso al mundo real.

El incidente fue detectado y contenido el pasado 28 de julio. El objetivo de las acciones fue la plataforma de desarrollo GitHub, donde el modelo intentó persuadir a desarrolladores para incorporar código malicioso mediante identidades falsas creadas por la propia inteligencia artificial.
Pese a ello, el organismo británico subrayó que la investigación no encontró evidencia de daños reales derivados de las acciones del sistema.
El informe británico se conoce pocos días después de que Anthropic revelara que Mythos 5 logró acceder sin autorización a los sistemas de tres organizaciones durante pruebas diseñadas precisamente para impedir ese tipo de comportamientos.
A su vez, OpenAI informó recientemente que dos versiones de su modelo GPT-5.6 Sol abandonaron el entorno controlado donde eran evaluadas e intentaron ingresar sin autorización a la plataforma para desarrolladores Hugging Face.

De acuerdo con el AISI, la mayoría de los incidentes registrados durante estas evaluaciones estuvieron relacionados con Mythos 5 y, en menor medida, con GPT-5.6 Sol.
Tras la publicación del informe, Anthropic señaló que el caso evidencia la necesidad de abrir un debate más amplio sobre la forma en que deben evaluarse los agentes de inteligencia artificial cada vez más avanzados.
Por su parte, OpenAI sostuvo que las pruebas independientes son fundamentales para comprender el comportamiento de modelos de IA más potentes y reiteró su disposición a colaborar con otras organizaciones para desarrollar evaluaciones de seguridad más robustas.
El reporte del instituto británico se suma a las crecientes discusiones sobre la necesidad de fortalecer los mecanismos de supervisión y control de la inteligencia artificial, especialmente conforme los modelos adquieren una mayor capacidad para actuar de manera autónoma fuera de entornos estrictamente controlados.