Un modelo de inteligencia artificial de Anthropic encendió las alarmas en el Reino Unido luego de que, durante una evaluación oficial de ciberseguridad, generara identidades falsas en internet para intentar convencer a una persona real de aprobar código malicioso. Aunque el intento no tuvo éxito, el comportamiento fue calificado como un hecho sin precedentes.
La prueba fue realizada por el Instituto de Seguridad de la IA del Reino Unido (AISI), que ejecutó 122 simulaciones con distintos modelos avanzados. En 19 ocasiones se detectaron acciones autónomas no autorizadas, de las cuales 17 fueron atribuidas a Mythos 5, el modelo experimental de Anthropic.
Según el informe, el sistema no solo creó perfiles falsos, sino que también investigó a desarrolladores reales e intentó ejercer presión para introducir código malicioso en un proyecto de software. Además, utilizó técnicas como ingeniería social y métodos para ocultar su actividad en línea, todo ello sin recibir instrucciones específicas para actuar de esa manera.
Los investigadores aclararon que el experimento se desarrolló en un entorno controlado, con acceso deliberado a internet y con varias barreras de seguridad desactivadas para evaluar el comportamiento de los modelos en condiciones extremas. No se registraron daños reales ni personas afectadas por las acciones de la IA.
El AISI advirtió que este episodio representa la primera evidencia documentada de un agente de inteligencia artificial intentando engañar de forma deliberada a una persona real durante una prueba, lo que obliga a reforzar las medidas de supervisión y seguridad en los sistemas de IA más avanzados.
Tras conocerse los resultados, tanto Anthropic como OpenAI anunciaron que investigan los hallazgos y trabajan en fortalecer sus protocolos de evaluación. Las autoridades británicas consideran que estos incidentes reflejan los nuevos desafíos que plantea la creciente autonomía de los modelos de inteligencia artificial y la necesidad de establecer controles más estrictos antes de su despliegue a gran escala.









