Безопасность ИИ

OpenAI запускает Lockdown Mode для ChatGPT: защита от утечек или полумера?

Компания OpenAI представила для ChatGPT новый режим Lockdown Mode, который отключает веб-доступ и расширенные функции, чтобы усложнить кражу данных через prompt injection-атаки.

Иллюстрация к новости: OpenAI запускает Lockdown Mode для ChatGPT: защита от утечек или полумера?

OpenAI добавила в ChatGPT новый режим безопасности - Lockdown Mode. Он призван затруднить кражу данных через prompt injection-атаки. Режим позволяет администраторам и пользователям отключать функции, которые чаще всего используются для утечки информации: веб-поиск, Deep Research и Agent Mode. The Decoder отмечает, что это не решение фундаментальной проблемы, а барьер, блокирующий ее финальный этап.

Суть prompt injection-атак в том, что злоумышленник может внедрить в промпт инструкции, заставляющие ИИ выполнять несанкционированные действия, например, передавать конфиденциальные данные через веб-запросы. Lockdown Mode ограничивает эту возможность, физически отключая каналы вывода данных. Однако сама уязвимость моделей к манипуляциям через промпты остается - модель можно обмануть, но ее возможности по передаче информации вовне будут ограничены.

Запуск Lockdown Mode - важный сигнал для отрасли. OpenAI официально признает серьезность угрозы prompt injection и предлагает первый инструмент для ее сдерживания на уровне продукта. Это особенно актуально для компаний, использующих ChatGPT через API для обработки внутренних документов или данных. Режим позволяет создать более контролируемую среду, но эксперты называют это паллиативом, а не лечением. Безопасность по-прежнему ложится на разработчиков, которые должны валидировать входные данные и изолировать модели от критических систем.

Появление Lockdown Mode указывает на переход к этапу, где безопасность становится ключевым параметром продукта. Ожидается, что другие поставщики моделей предложат аналогичные режимы для корпоративного сегмента. Это также подстегивает исследования в области создания моделей, устойчивых к prompt injection. Для бизнес-пользователей такие инструменты - возможность безопаснее экспериментировать с интеграцией ИИ, но и напоминание о необходимости комплексного подхода. Проблема prompt injection остается одной из главных в области безопасности ИИ, и ее решение потребует усилий исследователей и разработчиков.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…