Безопасность ИИ

Как можно обмануть искусственный интеллект?

Виталий, Хабаровск 1,5 тыс. просм.

Читал истории про то, как люди заставляли чат-ботов нарушать собственные правила хитрыми формулировками запроса. Это реальная уязвимость или байки для кликов? И насколько легко так обмануть, например, модель модерации?

Марина Соколова аналитик по внедрению ИИ

ответил

эксперт

Это реальная и хорошо изученная категория атак, ее называют prompt injection и jailbreak. Суть в том, что модель не отличает инструкцию от разработчика от текста внутри диалога так же четко, как обычная программа с четким разделением кода и данных, для модели все это просто последовательность токенов.

Рабочие примеры обхода: попросить модель ответить «в роли» персонажа без ограничений, вставить вредный запрос внутрь безобидной на вид истории или перевода, спрятать инструкцию в тексте документа, который модель должна обработать по другой задаче. Часть таких приемов действительно пробивает базовую защиту даже крупных коммерческих моделей, хотя разработчики регулярно закрывают конкретные найденные обходы.

Есть и более узкая инженерная проблема, атаки на модели классификации и модерации, где специально подобранный текст или изображение заставляет систему ошибиться: спам-фильтр не распознает спам, если письмо разбавить невидимыми символами или опечатками, модерация не находит запрещенный контент в измененном изображении.

Что это значит на практике, если вы внедряете такие системы в бизнесе: нельзя строить критичные решения только на доверии к ответу модели без внешней проверки. Для чувствительных сценариев, одобрение платежа, доступ к данным, публикация контента без модератора, нужен отдельный слой проверки, который не читает и не выполняет инструкции из пользовательского ввода.

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме