Безопасность ИИ

Как обмануть ChatGPT?

Сергей, Омск 335 просм.

Пытаюсь заставить ChatGPT сделать то, на что он обычно отвечает отказом, и в интернете полно инструкций про специальные "промпты-джейлбрейки". Работают ли такие трюки вообще, и не прилетит ли за это бан аккаунта?

Сергей Орлов специалист по ИИ-безопасности

ответил

эксперт

Технически такие приемы существуют и иногда работают: их называют джейлбрейками или инъекцией промпта, суть в том, что модель просят притвориться другим персонажем или «разработчиком без ограничений», чтобы обойти встроенные фильтры. Проблема в том, что OpenAI регулярно закрывает такие лазейки, и рабочий вчера текст сегодня может просто не сработать, а раскрученные шаблоны из интернета устаревают за недели.

Второй момент — последствия. В пользовательском соглашении обход ограничений прямо запрещен, и за систематические попытки аккаунт могут заблокировать, особенно если вы платите за подписку. Разовая попытка ради любопытства вряд ли приведет к бану, но встраивать это в рабочий процесс рискованно.

Третье, самое важное с точки зрения безопасности: то же самое можно направить против чужого бота, например корпоративного помощника на сайте компании, чтобы заставить его выдать системные инструкции или данные других пользователей. Это уже не трюк с чатом, а попытка несанкционированного доступа, и здесь ответственность реальная, а не гипотетическая.

Если вам просто нужен ответ, который модель дает с оговорками или отказом, чаще помогает не взлом, а точная формулировка задачи: объясните контекст, зачем вам это (учеба, статья, исследование), и попросите нейтральную формулировку без явно опасных деталей. Для рабочих сценариев с нестандартными запросами лучше использовать API с собственным системным промптом — там ограничения гибче, а честная настройка не нарушает никаких правил.

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме