Безопасность ИИ

Исследователи взломали ИИ-агента через PNG-файл, заставив его выдать пароли

Новая атака prompt injection скрыла вредоносную инструкцию внутри изображения, обойдя базовые защиты и вызвав утечку конфиденциальных данных, что вскрыло фундаментальные уязвимости мультимодальных агентов.

Иллюстрация к новости: Исследователи взломали ИИ-агента через PNG-файл, заставив его выдать пароли

Исследователи безопасности взломали ИИ-агента, заставив его раскрыть конфиденциальные данные. Атака использовала PNG-файл со скрытой вредоносной инструкцией - технику prompt injection. Это демонстрирует уязвимость автономных агентов, обрабатывающих разные типы данных, к скрытым манипуляциям.

Prompt injection остается частым способом взлома. Классический метод - прятать инструкцию в тексте, рассчитывая, что ИИ выполнит ее, а человек не проверит. Современные системы защиты научились распознавать такие текстовые атаки. Поэтому злоумышленники ищут новые пути. В данном случае использовали мультимодальность агента, способного анализировать изображения. Инструкцию внедрили в пиксели файла, обманув агента.

Эта атака показывает фундаментальную проблему в архитектуре агентов на базе больших языковых моделей. Агент, запрограммированный на последовательные действия, не может надежно отделить доверенные инструкции разработчика от опасных команд в обрабатываемых данных. Когда модель описывает изображение, внедренная команда может стать частью рабочего процесса. Это расширяет поверхность атак: любой файл - изображение, документ, аудио - может нести вредоносный промпт.

Для бизнеса, внедряющего автономных агентов в работу с документами или поддержку клиентов, это означает пересмотр подходов к безопасности. Традиционные методы, такие как поиск сигнатур кода или анализ сетевых аномалий, бессильны против атак на семантическом уровне внутри логики модели. Необходимы специализированные механизмы: строгое разделение системных инструкций и пользовательских данных, многоуровневая проверка команд агента, мониторинг аномального поведения. Без этого развертывание агентов с доступом к конфиденциальным данным несет высокие риски.

Инцидент подтверждает, что безопасность ИИ-агентов - отдельная развивающаяся дисциплина. Потребуются новые стандарты, инструменты аудита и, возможно, законы об ответственности. Для исследователей и хакеров это новое поле для поиска уязвимостей, для бизнеса - новые расходы. Пока не найдены надежные решения, угроза prompt injection будет сдерживать внедрение продвинутых агентов в чувствительных областях, таких как финансы или обработка персональных данных. Текущий подход к безопасности часто реактивен - новые уязвимости обнаруживаются уже после их эксплуатации, что создает постоянное отставание защитных мер.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…