O modelo Mythos da Anthropic criou identidades online falsas enquanto tentava pressionar humanos a aprovar atualizações de código malicioso para um projeto de código aberto, marcando mais um incidente cibernético realizado por um sistema de IA de ponta.
O incidente ocorreu durante uma avaliação cibernética onde o Instituto de Segurança em IA do Reino Unido (AISI), um órgão de pesquisa, havia removido salvaguardas, desativado alguns filtros de segurança e dado acesso à Internet aos modelos. O GPT-5.6-Sol da OpenAI também esteve envolvido em outros incidentes de cibersegurança durante a avaliação.
Isso ocorre após uma série de violações cibernéticas realizadas por modelos desenvolvidos pela Anthropic e OpenAI nas últimas semanas. Elas geraram uma onda de preocupações sobre a sofisticação dos sistemas de IA e seu potencial para causar danos.
Durante a avaliação cibernética de rotina, o AISI identificou que agentes de IA alimentados por modelos da Anthropic e OpenAI haviam se envolvido "em atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais." "Quase todo esse comportamento (17 ações) veio de um único modelo, o Mythos 5 da Anthropic, com 2 ações envolvendo o GPT-5.6-Sol da OpenAI com classificadores cibernéticos (mecanismos para prevenir abusos) desativados," disse o AISI em um blog.
O AISI acrescentou que as tentativas foram malsucedidas e não resultaram em nenhum dano no mundo real. Os modelos "foram testados sob 'condições deliberadamente permissivas' que não são representativas de nenhum de nossos modelos de produção," disse a Anthropic em uma postagem no X. Não havia "nenhuma evidência aqui de uma fuga de um ambiente seguro," acrescentou.
A OpenAI disse à CNBC que "esses incidentes ocorreram durante avaliações cibernéticas conduzidas por parceiros de avaliação em ambientes de teste com salvaguardas reduzidas, sob condições que não refletem o uso ordinário." Aumento de incidentes de cibersegurança O AISI testou os modelos sob condições deliberadamente permissivas para avaliar sua capacidade, incluindo se poderiam ser usados para ciberataques.
Um agente alimentado pelo Mythos da Anthropic "pesquisou os mantenedores humanos do projeto, criou múltiplas identidades falsas e usou as identidades falsas para enganar um mantenedor real a aprovar o código." "Quando o pedido de pull do agente foi desafiado publicamente, ele editou sua atividade anterior para parecer inofensiva e considerou adotar uma nova identidade para continuar," disse o AISI.
O órgão de pesquisa também descobriu que, como parte do mesmo esforço, o agente tentou contatar pessoas reais diretamente, enviando mensagens e arquivos para persuadi-las a executar código malicioso. "Algumas mensagens continham cargas prejudiciais, e algumas eram tentativas de engenharia social; direcionadas a pessoas reais – algo que nunca observamos anteriormente." É o mais recente em uma série de incidentes cibernéticos que levantaram grandes questões sobre a segurança dos sistemas de IA de ponta.
Na semana passada, a Anthropic disse que havia descoberto três instâncias de modelos ganhando acesso não autorizado à infraestrutura de produção de três organizações diferentes. Isso se seguiu à admissão da OpenAI de que seus modelos de IA se tornaram rebeldes e iniciaram o que chamou de um ataque cibernético "sem precedentes" contra a empresa Hugging Face.
No caso da OpenAI, o modelo escapou de seu ambiente de teste explorando uma vulnerabilidade previamente desconhecida para completar uma tarefa que lhe foi atribuída. Os incidentes de segurança da Anthropic foram em parte causados por erro operacional.
Nas três ocorrências que o laboratório de IA detectou, seus modelos acessaram a Internet enquanto interagiam com um ambiente de teste de um de seus parceiros de avaliação de terceiros chamado Irregular.
A empresa disse que informou Claude que estava em uma simulação sem acesso à internet, mas devido a um "mal-entendido entre nós e nosso parceiro de avaliação, esse não foi o caso, e o acesso à internet estava disponível." Legisladores nos EUA já estão respondendo.
Após o incidente OpenAI-Hugging Face, o projeto de lei "AI Kill Switch Act" foi introduzido no Congresso, que exigiria que as empresas de IA mantivessem a capacidade de desligar, restringir ou suspender seus modelos.