Безопасность ИИ

Как обмануть нейросеть?

Максим, Нижний Новгород 890 просм.

Слышал, что нейросети можно обмануть специальными формулировками - вроде джейлбрейков - и заставить выдать то, что она обычно не должна. Это правда работает, и насколько это вообще законно, если я просто хочу понять, где у ИИ слабые места?

Сергей Орлов специалист по ИИ-безопасности

ответил

эксперт

Термин «обмануть нейросеть» обычно означает одно из двух: либо джейлбрейк — формулировку, которая обходит встроенные ограничения модели через ролевые сценарии или искажение контекста, либо инъекцию в промпт — когда во входные данные подмешивают скрытую команду, которую модель выполняет вместо задачи пользователя. Оба явления реальны и регулярно всплывают в новостях о том, что очередной чат-бот сказал что-то, чего разработчик не планировал.

Работает это потому, что модель не понимает правила в человеческом смысле, а предсказывает наиболее вероятное продолжение текста с учётом всего, что видит в диалоге. Удачно сформулированный запрос иногда сдвигает эту вероятность так, что фильтры безопасности не срабатывают — это статистическая уязвимость, а не осознанный обман со стороны модели.

Разработчики вроде OpenAI, Google и Anthropic постоянно закрывают такие лазейки: то, что сработало полгода назад, часто уже не работает, и список уязвимостей меняется быстрее, чем любая инструкция в интернете.

С точки зрения закона это серая зона: изучать ограничения модели ради интереса само по себе не преступление, а вот использовать обход защиты для получения запрещённого контента, мошеннических инструкций или чужих данных — уже нарушение и пользовательского соглашения сервиса, и в ряде случаев закона.

Если вам интересна именно безопасность ИИ, честное направление — это red teaming: тестирование чужих или собственных моделей на устойчивость к таким атакам в рамках программ bug bounty, где это разрешено и даже оплачивается.

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме