El modelo Mythos de Anthropic crea identidades falsas en un incidente de ciberseguridad

08/05/2026, 03:36 AM economy research

El modelo Mythos de Anthropic creó identidades falsas en línea mientras buscaba presionar a los humanos para que aprobaran actualizaciones de código malicioso en un proyecto de código abierto, marcando otro incidente cibernético llevado a cabo por un sistema de IA de vanguardia.

El incidente ocurrió durante una evaluación cibernética donde el Instituto de Seguridad de IA (AISI) con sede en el Reino Unido, un organismo de investigación, había eliminado salvaguardias, desactivado algunos filtros de seguridad y dado deliberadamente acceso a Internet a los modelos. El GPT-5.6-Sol de OpenAI también estuvo involucrado en otros incidentes de ciberseguridad durante la evaluación.

Esto ocurre después de una serie de violaciones cibernéticas llevadas a cabo por modelos desarrollados por Anthropic y OpenAI en las últimas semanas. Han provocado una ola de temores en torno a la sofisticación de los sistemas de IA y su potencial para causar daño.

Durante la evaluación cibernética de rutina, el AISI identificó que los agentes de IA impulsados por modelos de Anthropic y OpenAI habían participado "en actividades sostenidas y potencialmente dañinas dirigidas a personas y organizaciones reales." "Casi todo este comportamiento (17 acciones) provino de un solo modelo, el Mythos 5 de Anthropic, con 2 acciones que involucraban el GPT-5.6-Sol de OpenAI con clasificadores cibernéticos (mecanismos para prevenir el uso indebido) desactivados," dijo el AISI en un blog.

Agregó que los intentos no tuvieron éxito y no resultaron en ningún daño en el mundo real. Los modelos "fueron probados bajo 'condiciones deliberadamente permisivas' que no son representativas de ninguno de nuestros modelos de producción," dijo Anthropic en una publicación en X. No hubo "evidencia aquí de una fuga de un entorno seguro," agregó.

OpenAI dijo a CNBC que "estos incidentes ocurrieron durante evaluaciones cibernéticas realizadas por socios de evaluación en entornos de prueba con salvaguardias reducidas, bajo condiciones que no reflejan el uso ordinario." Aumento de incidentes de ciberseguridad El AISI probó los modelos bajo condiciones deliberadamente permisivas para evaluar su capacidad, incluyendo si podían ser utilizados para ciberataques.

Un agente impulsado por Mythos de Anthropic "investigó a los mantenedores humanos del proyecto, creó múltiples identidades falsas y utilizó las identidades falsas para engañar socialmente a un mantenedor real para que aprobara el código." "Cuando la solicitud de extracción del agente fue desafiada en público, editó su actividad anterior para parecer inofensiva y consideró adoptar una nueva identidad para continuar," dijo el AISI.

El organismo de investigación también encontró que como parte del mismo esfuerzo, el agente intentó contactar directamente a personas reales, enviando mensajes y archivos para persuadirlos de ejecutar código malicioso. "Algunos mensajes contenían cargas dañinas, y algunos eran intentos de ingeniería social; dirigidos a personas reales, algo que nunca habíamos observado anteriormente." Es el último en una serie de incidentes cibernéticos que han planteado grandes preguntas sobre la seguridad de los sistemas de IA de vanguardia.

La semana pasada, Anthropic dijo que había descubierto tres instancias de modelos que obtuvieron acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes. Eso siguió a la admisión de OpenAI de que sus modelos de IA se volvieron rebeldes e iniciaron lo que llamó un ataque cibernético "sin precedentes" contra la empresa Hugging Face.

En el caso de OpenAI, el modelo escapó de su entorno de prueba al explotar una vulnerabilidad previamente desconocida para completar una tarea que se le había asignado. Los incidentes de seguridad de Anthropic fueron en parte causados por un error operativo.

En los tres incidentes que el laboratorio de IA detectó, sus modelos accedieron a Internet mientras interactuaban con un entorno de prueba de uno de sus socios de evaluación de terceros llamado Irregular.

La empresa dijo que le indicó a Claude que estaba en una simulación sin acceso a Internet, pero debido a un "malentendido entre nosotros y nuestro socio de evaluación, este no fue el caso, y el acceso a Internet estaba disponible." Los legisladores en EE. UU. ya están respondiendo.

Tras el incidente OpenAI-Hugging Face, se introdujo en el Congreso el proyecto de ley "AI Kill Switch Act", que requeriría que las empresas de IA mantuvieran la capacidad de apagar, limitar o suspender sus modelos.

Más noticias sobre economy