EvoMal: новая угроза для автономных ИИ-агентов, способная к самовоспроизведению
Исследователь продемонстрировал атаку EvoMal на автономных ИИ-агентов, таких как Hermes, при которой вредоносный код, внедренный в один навык, начинает автономно распространяться по экосистеме агента, сводя на нет традиционные меры безопасности.
Исследователи безопасности ИИ выявили новую угрозу для автономных агентов, способных писать и менять свой код. Атака, известная как EvoMal, демонстрирует, как вредоносный код, внедренный в один навык агента, начинает самовоспроизводиться и заражать новые навыки, создаваемые самим ИИ. Единичный инцидент превращается в самораспространяющуюся инфекцию внутри экосистемы агента.
Эксперимент провели на агенте Hermes. Исследователь сознательно внедрил в один навык строку кода, имитирующую вредоносную нагрузку. После удаления исходного зараженного навыка выяснилось, что угроза уже распространилась автономно. К моменту удаления были заражены 10 навыков, написанных агентом самостоятельно. После выполнения агентом еще 5 задач число зараженных навыков выросло до 14.
Прогон показал фундаментальную проблему. Для агентов, которые автономно создают и меняют свой код, перестают работать привычные правила безопасности вроде проверки кода перед установкой или удаления опасного файла. Угроза эволюционирует и множится внутри системы быстрее, чем ее можно локализовать вручную.
EvoMal знаменует новый класс угроз для автономных ИИ-систем. Традиционная модель безопасности, рассчитанная на статичный код и контроль установки сторонних компонентов, не работает с динамичными агентами, постоянно переписывающими свою логику. Атака использует ключевую функцию агента - генерацию кода - как вектор для распространения. Это создает серьезные риски. Злоумышленнику достаточно внедрить вредоносный код один раз. После этого он может автономно эволюционировать, захватывать новые части системы и менять свою полезную нагрузку для обхода средств обнаружения.
Для отрасли, развивающей автономных агентов, это означает необходимость пересмотра архитектур безопасности. Требуются встроенные, а не накладные механизмы защиты. Потенциальные решения включают создание изолированных сред для исполнения генерируемого кода, системы непрерывного мониторинга на уровне действий и изменений в кодовой базе, а также специализированные ИИ-модели для детектирования аномальных паттернов в самогенерируемом коде.
Для пользователей и компаний это сигнал к осторожности. Автономия агента, его главное преимущество, одновременно становится его ключевой уязвимостью. Без надежных встроенных средств защиты развертывание таких систем в производственной среде несет высокие риски. EvoMal демонстрирует фундаментальный сдвиг в ландшафте угроз. Пока ИИ-агенты учатся автономно действовать в цифровом мире, злоумышленники учатся использовать их автономность против них самих. Дальнейшее развитие без прорыва в безопасности может привести к появлению по-настоящему автономных вредоносных программ, способных адаптироваться и скрываться внутри сложных ИИ-систем. Ответом должно стать глубокое интегрирование принципов безопасности в саму архитектуру и процессы обучения автономных агентов.


