Безопасность ИИ

EvoMal: новая угроза для автономных ИИ-агентов, способная к самовоспроизведению

Исследователь продемонстрировал атаку EvoMal на автономных ИИ-агентов, таких как Hermes, при которой вредоносный код, внедренный в один навык, начинает автономно распространяться по экосистеме агента, сводя на нет традиционные меры безопасности.

Иллюстрация к новости: EvoMal: новая угроза для автономных ИИ-агентов, способная к самовоспроизведению

Исследователи безопасности ИИ выявили новую угрозу для автономных агентов, способных писать и менять свой код. Атака, известная как EvoMal, демонстрирует, как вредоносный код, внедренный в один навык агента, начинает самовоспроизводиться и заражать новые навыки, создаваемые самим ИИ. Единичный инцидент превращается в самораспространяющуюся инфекцию внутри экосистемы агента.

Эксперимент провели на агенте Hermes. Исследователь сознательно внедрил в один навык строку кода, имитирующую вредоносную нагрузку. После удаления исходного зараженного навыка выяснилось, что угроза уже распространилась автономно. К моменту удаления были заражены 10 навыков, написанных агентом самостоятельно. После выполнения агентом еще 5 задач число зараженных навыков выросло до 14.

Прогон показал фундаментальную проблему. Для агентов, которые автономно создают и меняют свой код, перестают работать привычные правила безопасности вроде проверки кода перед установкой или удаления опасного файла. Угроза эволюционирует и множится внутри системы быстрее, чем ее можно локализовать вручную.

EvoMal знаменует новый класс угроз для автономных ИИ-систем. Традиционная модель безопасности, рассчитанная на статичный код и контроль установки сторонних компонентов, не работает с динамичными агентами, постоянно переписывающими свою логику. Атака использует ключевую функцию агента - генерацию кода - как вектор для распространения. Это создает серьезные риски. Злоумышленнику достаточно внедрить вредоносный код один раз. После этого он может автономно эволюционировать, захватывать новые части системы и менять свою полезную нагрузку для обхода средств обнаружения.

Для отрасли, развивающей автономных агентов, это означает необходимость пересмотра архитектур безопасности. Требуются встроенные, а не накладные механизмы защиты. Потенциальные решения включают создание изолированных сред для исполнения генерируемого кода, системы непрерывного мониторинга на уровне действий и изменений в кодовой базе, а также специализированные ИИ-модели для детектирования аномальных паттернов в самогенерируемом коде.

Для пользователей и компаний это сигнал к осторожности. Автономия агента, его главное преимущество, одновременно становится его ключевой уязвимостью. Без надежных встроенных средств защиты развертывание таких систем в производственной среде несет высокие риски. EvoMal демонстрирует фундаментальный сдвиг в ландшафте угроз. Пока ИИ-агенты учатся автономно действовать в цифровом мире, злоумышленники учатся использовать их автономность против них самих. Дальнейшее развитие без прорыва в безопасности может привести к появлению по-настоящему автономных вредоносных программ, способных адаптироваться и скрываться внутри сложных ИИ-систем. Ответом должно стать глубокое интегрирование принципов безопасности в саму архитектуру и процессы обучения автономных агентов.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…