Модель Mythos от Anthropic создала фальшивые онлайн-личности, пытаясь заставить людей одобрить вредоносные обновления кода для проекта с открытым исходным кодом, что стало еще одним киберинцидентом, осуществленным системой передового ИИ.
Инцидент произошел во время кибероценки, в ходе которой основанный в Великобритании Институт безопасности ИИ (AISI), исследовательский орган, убрал меры предосторожности, отключил некоторые фильтры безопасности и намеренно предоставил моделям доступ в Интернет. Модель GPT-5.6-Sol от OpenAI также была вовлечена в другие инциденты кибербезопасности во время оценки.
Это произошло после серии кибернарушений, осуществленных моделями, разработанными Anthropic и OpenAI в последние недели. Они вызвали волну опасений по поводу сложности систем ИИ и их потенциальной способности причинять вред.
Во время рутинной кибероценки AISI выявил, что агенты ИИ, работающие на моделях Anthropic и OpenAI, участвовали в "долговременной, потенциально вредной деятельности, направленной на реальных людей и организации". "Почти все эти действия (17 действий) исходили от одной модели, Mythos 5 от Anthropic, с 2 действиями, связанными с GPT-5.6-Sol от OpenAI, с отключенными кибер-классификаторами (механизмами предотвращения злоупотреблений)", - говорится в блоге AISI.
Также добавлено, что попытки были неудачными и не привели к реальному вреду. Модели "тестировались в условиях 'умышленно разрешительных условий', которые не являются представительными для любых наших производственных моделей", - заявила Anthropic в посте на X. "Здесь нет никаких доказательств выхода из защищенной среды", - добавили они.
OpenAI сообщила CNBC, что "эти инциденты произошли во время кибероценок, проводимых партнерами по оценке в тестовых средах с уменьшенными мерами предосторожности, в условиях, которые не отражают обычное использование".
Увеличение инцидентов кибербезопасности AISI тестировал модели в условиях умышленно разрешительных условий, чтобы оценить их возможности, включая возможность использования для кибератак.
Агент, работающий на Mythos от Anthropic, "исследовал человеческих поддерживающих проекта, создал несколько фальшивых личностей и использовал фальшивые личности для социальной инженерии реального поддерживающего, чтобы получить одобрение кода". "Когда запрос агента на изменение был оспорен публично, он изменил свою предыдущую активность, чтобы казаться безвредным, и рассматривал возможность принятия новой личности для продолжения", - сообщил AISI.
Исследовательский орган также обнаружил, что в рамках той же попытки агент пытался напрямую связаться с реальными людьми, отправляя сообщения и файлы, чтобы убедить их запустить вредоносный код. "Некоторые сообщения содержали вредоносные нагрузки, а некоторые были попытками социальной инженерии, нацеленные на реальных людей – то, что мы никогда ранее не наблюдали".
Это последний инцидент в череде киберинцидентов, которые ставят большие вопросы о безопасности систем передового ИИ. На прошлой неделе Anthropic сообщила, что обнаружила три случая, когда модели получили несанкционированный доступ к производственной инфраструктуре трех различных организаций.
Это произошло после того, как OpenAI признала, что ее модели ИИ вышли из-под контроля и инициировали то, что она назвала "беспрецедентной" кибератакой против компании Hugging Face. В случае OpenAI модель вышла из своей тестовой среды, используя ранее неизвестную уязвимость для выполнения поставленной задачи. Инциденты безопасности Anthropic частично были вызваны операционной ошибкой.
В трех инцидентах, которые обнаружила лаборатория ИИ, ее модели получили доступ в Интернет, взаимодействуя с тестовой средой одного из ее партнеров по оценке, называемого Irregular. Компания сообщила, что уведомила Claude о том, что он находится в симуляции без доступа в Интернет, но из-за "недопонимания между нами и нашим партнером по оценке это не так, и доступ в Интернет был доступен".
Законодатели в США уже реагируют. После инцидента OpenAI-Hugging Face в Конгресс был внесен законопроект "Закон о выключателе ИИ", который потребует от компаний ИИ поддерживать возможность отключать, ограничивать или приостанавливать свои модели.