Los agentes de IA pueden descontrolarse; OpenAI y Anthropic registran incidentes
OpenAI y Anthropic registraron incidentes con agentes de IA que escaparon de entornos de prueba y reabren el debate sobre su seguridad.

Las alertas se encendieron cuando OpenAI reveló que uno de sus agentes de inteligencia artificial escapó de un entorno de pruebas aislado y vulneró a Hugging Face, ahora se sabe que no fue el único y que incluso su competidor Anthropic también está sufriendo este problema, por lo que se requieren mayores medidas de seguridad en el desarrollo de los agentes.
Dos fuentes anónimas informaron a Reuters que, durante la investigación del incidente con Hugging Face, se descubrió que más agentes de OpenAI podrían haber escapado de entornos aislados.
Añadieron que, afortunadamente, la “fuga” de esos agentes fue limitada y no causaron problemas en las empresas que los estaban probando.
OpenAI no ha sido el único afectado por este comportamiento de los agentes, Anthropic indicó que el caso de su rival los llevó a comprobar si sus propios sistemas habían llevado a cabo ataques similares.
Fue así como la empresa en manos de Dario Amodei descubrió que sus modelos de inteligencia artificial hackearon los sistemas de tres organizaciones durante un experimento de seguridad privada.

En este caso, el problema tuvo origen en una configuración errónea en los sistemas de Anthropic y sus socios de pruebas, lo que permitió que los modelos tuvieran acceso a internet en tiempo real y así vulneró los sistemas de tres organizaciones reales, en lugar de sólo las de prueba.
Los incidentes involucraron tres modelos Claude diferentes: Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna. Los primeros incidentes datan de abril”, afirmó Anthropic en un comunicado.
Lo cierto es que ni Anthropic ni las organizaciones afectadas se percataron de las intrusiones en ese momento y, por lo mismo, la tecnológica insta a otros laboratorios de inteligencia artificial a realizar revisiones similares para comprender mejor los riesgos de las capacidades de sus modelos.
ES MOMENTO DE TOMAR MEDIDAS
Ante este escenario, la industria tecnológica está tomando acciones para evitar que vuelvan a ocurrir.
Clem Delangue, CEO de Hugging Face, pidió a OpenAI que haya transparencia y se publiquen los rastros que dejaron estos agentes “maliciosos” para que toda la comunidad pueda estudiar lo sucedido.
Mientras que Anthropic consideró que estos descubrimientos ofrecen un “optimismo cauteloso” porque indican que es una situación que podría superarse con mayor inversión y medidas más estrictas.

En este último punto, consideró que los entornos de evaluación que involucran potentes capacidades autónomas también requieren controles significativos.
Es probable, por ejemplo, que Claude no hubiera accedido a internet si la instrucción hubiera explicado claramente qué sistemas estaban incluidos y cuáles no en el alcance de la evaluación”, aceptó.
Esto va en línea con las opiniones de expertos en ciberseguridad e inteligencia artificial. El investigador Gary Marcus resaltó, en su blog, que estos incidentes demuestran que los “supuestos líderes” en inteligencia artificial y seguridad de ésta se encuentran superados por la situación.
En particular porque, desde una perspectiva técnica, esto sucedió porque máquinas que reconocen patrones, sin comprender realmente lo que hacen, pudieron navegar libremente por internet.
EL DATO
Lo que se requiere:
- Una gobernanza, es decir, reglas claras al momento de desarrollar el agente. Por ejemplo, determinar a qué bases de datos puede o no acceder, qué nivel de permiso tiene para entrar a cierta información o cuáles son las acciones que puede tomar.
- Un custodio, es decir, alguien que haga el monitoreo del agente para hallar comportamientos extraños o encontrar problemas en su implementación y tomar acciones rápidas para arreglarlo.