Как можно обмануть искусственный интеллект?
Виталий, Хабаровск 1,5 тыс. просм.
Читал истории про то, как люди заставляли чат-ботов нарушать собственные правила хитрыми формулировками запроса. Это реальная уязвимость или байки для кликов? И насколько легко так обмануть, например, модель модерации?
Марина Соколова аналитик по внедрению ИИ
ответил
Это реальная и хорошо изученная категория атак, ее называют prompt injection и jailbreak. Суть в том, что модель не отличает инструкцию от разработчика от текста внутри диалога так же четко, как обычная программа с четким разделением кода и данных, для модели все это просто последовательность токенов.
Рабочие примеры обхода: попросить модель ответить «в роли» персонажа без ограничений, вставить вредный запрос внутрь безобидной на вид истории или перевода, спрятать инструкцию в тексте документа, который модель должна обработать по другой задаче. Часть таких приемов действительно пробивает базовую защиту даже крупных коммерческих моделей, хотя разработчики регулярно закрывают конкретные найденные обходы.
Есть и более узкая инженерная проблема, атаки на модели классификации и модерации, где специально подобранный текст или изображение заставляет систему ошибиться: спам-фильтр не распознает спам, если письмо разбавить невидимыми символами или опечатками, модерация не находит запрещенный контент в измененном изображении.
Что это значит на практике, если вы внедряете такие системы в бизнесе: нельзя строить критичные решения только на доверии к ответу модели без внешней проверки. Для чувствительных сценариев, одобрение платежа, доступ к данным, публикация контента без модератора, нужен отдельный слой проверки, который не читает и не выполняет инструкции из пользовательского ввода.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.