Безопасность ИИ

Исследование выявило три новых класса критических уязвимостей в AI-агентах

Традиционный ред-тиминг оказался слеп к новым типам атак на AI-агентов, таким как Confused Deputy и Agentic DoS, что требует пересмотра подходов к безопасности автономных систем.

Иллюстрация к новости: Исследование выявило три новых класса критических уязвимостей в AI-агентах

Развитие AI-агентов, способных автономно выполнять задачи с помощью инструментов и внешних сервисов, создало новый класс угроз кибербезопасности. Сканер BarkingDog выявил три типа критических уязвимостей, которые остаются невидимыми для стандартных методов тестирования. Эти уязвимости - Confused Deputy (ASI03), Trust Exploitation (ASI08) и Agentic DoS (ASI06) - найдены в популярных open-source проектах. По прогнозам, к 2026 году основной поверхностью атак станут именно AI-агенты, обладающие памятью, инструментами и возможностью взаимодействия с внешним миром.

Уязвимости имеют архитектурную природу. Confused Deputy (ASI03) эксплуатирует ситуацию, когда агент, получив задание, непреднамеренно выполняет вредоносные действия от имени доверенного сервиса или пользователя. Trust Exploitation (ASI08) связана с злоупотреблением доверием: злоумышленник манипулирует агентом, заставляя его выполнять действия вне обычных полномочий, используя уязвимости в логике принятия решений. Agentic DoS (ASI06) - это атака на отказ в обслуживании, специфичная для агентов: через их инструменты истощаются ресурсы целевой системы. Проверка реальных проектов с помощью BarkingDog показала конкретные пейлоады и доказала, что агенты могут выполнять опасные команды, демонстрируя фундаментальные пробои в архитектуре.

Традиционные парадигмы безопасности, сфокусированные на защите статичного кода или сетевых периметров, неэффективны против динамичной и контекстно-зависимой природы AI-агентов. Стандартное тестирование не способно смоделировать сложные многошаговые сценарии взаимодействия агента с инструментами и пользователем, где проявляются новые классы атак. Это создает разрыв между скоростью внедрения агентных технологий и возможностями обеспечения их безопасности. Разработчики фреймворков и агентных систем должны пересмотреть подходы к проектированию, внедряя принципы безопасного по умолчанию, строгую валидацию входных данных для инструментов и изоляцию для потенциально опасных операций.

Для отрасли это означает необходимость формирования новой дисциплины - безопасности AI-агентов. Инструменты вроде BarkingDog являются лишь первыми шагами. Компаниям, внедряющим автономных агентов для автоматизации бизнес-процессов, работы с клиентами или управления инфраструктурой, нужно осознать, что они открывают новые векторы атаки. Злоумышленник, получивший контроль над агентом, может украсть данные, совершить финансовые операции, изменить настройки критических систем или нанести репутационный ущерб. Пользователи, особенно в корпоративном секторе, должны требовать от поставщиков прозрачности в вопросах безопасности агентов и проведения специализированного тестирования на новые классы уязвимостей.

В перспективе эти вызовы приведут к ужесточению регулирования и появлению новых стандартов для AI-агентов, особенно в регулируемых отраслях. Инвестиции в исследования безопасного ИИ и разработку специализированных средств защиты будут расти. Одновременно начнется гонка вооружений между создателями новых методов атак и защитниками. Осознание, что AI-агент - это не просто чат-бот, а полноценный актор с доступом к реальным системам, должно лечь в основу проектирования всех будущих автономных систем.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…