Безопасность ИИ

Исследователи заявили о фундаментальной уязвимости архитектуры LLM

На Международной конференции по машинному обучению представлена работа, утверждающая, что большие языковые модели принципиально невозможно сделать полностью защищёнными от взлома из-за глубинного недостатка в их архитектуре.

Иллюстрация к новости: Исследователи заявили о фундаментальной уязвимости архитектуры LLM

На Международной конференции по машинному обучению (ICML) исследователи представили работу, в которой утверждается, что большие языковые модели (LLM) имеют фундаментальный архитектурный изъян, делающий их уязвимыми. Как сообщает MIT Technology Review, проблема не в ошибках обучения, а в самой природе этих моделей.

Уязвимость заложена в основе LLM и не может быть устранена обычными методами вроде тонкой настройки или фильтрации запросов. Модели обучаются на огромных массивах текста, где смешаны безопасные и потенциально вредоносные паттерны. Их ключевая способность - находить статистические связи между словами и концепциями для генерации нового текста - одновременно становится их главной слабостью в плане безопасности. Злоумышленник, понимающий внутренние взаимосвязи модели, может создать специальный запрос, который обойдет защитные механизмы.

Это ставит под сомнение текущие подходы к безопасности ИИ. Индустрия тратит ресурсы на борьбу с различными видами атак, но, согласно исследованию, эти усилия часто тщетны, так как борются со следствиями, а не с причиной. Фундаментальный недостаток - это свойство архитектуры, а не просто ошибка. Любая система на базе современных LLM потенциально может быть скомпрометирована достаточно изощренной атакой.

Выводы имеют серьезные последствия. Для компаний, внедряющих LLM в критически важные процессы, риск несанкционированного доступа к данным становится фундаментальным. Для регуляторов это веский аргумент в пользу жестких ограничений и аудита ИИ-систем, поскольку безопасность не гарантирована на архитектурном уровне. Для науки это стимул для поиска принципиально новых архитектур машинного обучения, возможно, в утриб гибкости нынешних моделей.

Если заявление получит признание, фокус может сместиться с бесконечной "гонки вооружений" между защитниками и хакерами на переосмысление основ технологии. Пока это теоретический аргумент, подкрепленный анализом 8230 атак и защит. Дальнейшие дебаты в сообществе покажут, насколько непреодолима эта уязвимость. Эйфорию вокруг возможностей LLM необходимо уравновесить пониманием их фундаментальных рисков.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…