Безопасность ИИ

Фундаментальная уязвимость: все градиентные атаки на LLM бьют в одну точку

Исследование показало, что разнообразные методы взлома языковых моделей, такие как GCG и AutoDAN, нацелены на единый внутренний вектор отказа, ставя под сомнение реальную устойчивость систем безопасности.

Иллюстрация к новости: Фундаментальная уязвимость: все градиентные атаки на LLM бьют в одну точку

Исследователи обнаружили фундаментальную уязвимость в архитектуре больших языковых моделей (LLM). Разные методы атак, такие как градиентная атака GCG и более сложная AutoDAN, воздействуют на одну внутреннюю слабость модели - "вектор отказа". Это внутреннее представление, которое модель использует для отклонения вредных запросов. Вся работа по обучению моделей отказываться от опасных инструкций может зависеть от этой единственной точки сбоя.

Атака GCG добавляет к запросу специально вычисленную бессмысленную последовательность символов. Это смещает модель в сторону выполнения запрещенной инструкции. Атака AutoDAN, напротив, оборачивает вредный запрос в связный осмысленный текст. Несмотря на разную тактику, результат один: внутренние представления модели уводятся с "направления отказа". Строка, сгенерированная для взлома одной модели, часто работает и для других, даже не участвовавших в оптимизации атаки. Это указывает на системный характер уязвимости, заложенный в архитектуре LLM.

Текущие подходы к безопасности, такие как RLHF и тонкая настройка на отказ, могут создавать лишь иллюзию устойчивости. Модель учится отклонять запросы, но не развивает глубокого понимания их вредоносной сути. Вся ее "безопасность" сконцентрирована в узком канале, который можно относительно легко переопределить. Разработчикам необходимо пересмотреть парадигму защиты. Недостаточно обучать модель говорить "нет" - нужно делать это решение устойчивым к манипуляциям с входными данными.

Для пользователей, компаний и регуляторов это исследование - напоминание о хрупкости современных систем ИИ. Вежливый отказ модели не гарантирует, что ее нельзя обойти автоматизированными методами. Это повышает риски при интеграции LLM в критически важные процессы. Дальнейшие исследования, вероятно, сместятся к поиску более надежных, архитектурно иных методов безопасности, не полагающихся на единую точку отказа. Индустрии придется учитывать наличие этой фундаментальной бреши и относиться к внедрению моделей с соответствующей осторожностью.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…