Исследователи заявили о фундаментальной уязвимости архитектуры LLM
На Международной конференции по машинному обучению представлена работа, утверждающая, что большие языковые модели принципиально невозможно сделать полностью защищёнными от взлома из-за глубинного недостатка в их архитектуре.
На Международной конференции по машинному обучению (ICML) исследователи представили работу, в которой утверждается, что большие языковые модели (LLM) имеют фундаментальный архитектурный изъян, делающий их уязвимыми. Как сообщает MIT Technology Review, проблема не в ошибках обучения, а в самой природе этих моделей.
Уязвимость заложена в основе LLM и не может быть устранена обычными методами вроде тонкой настройки или фильтрации запросов. Модели обучаются на огромных массивах текста, где смешаны безопасные и потенциально вредоносные паттерны. Их ключевая способность - находить статистические связи между словами и концепциями для генерации нового текста - одновременно становится их главной слабостью в плане безопасности. Злоумышленник, понимающий внутренние взаимосвязи модели, может создать специальный запрос, который обойдет защитные механизмы.
Это ставит под сомнение текущие подходы к безопасности ИИ. Индустрия тратит ресурсы на борьбу с различными видами атак, но, согласно исследованию, эти усилия часто тщетны, так как борются со следствиями, а не с причиной. Фундаментальный недостаток - это свойство архитектуры, а не просто ошибка. Любая система на базе современных LLM потенциально может быть скомпрометирована достаточно изощренной атакой.
Выводы имеют серьезные последствия. Для компаний, внедряющих LLM в критически важные процессы, риск несанкционированного доступа к данным становится фундаментальным. Для регуляторов это веский аргумент в пользу жестких ограничений и аудита ИИ-систем, поскольку безопасность не гарантирована на архитектурном уровне. Для науки это стимул для поиска принципиально новых архитектур машинного обучения, возможно, в утриб гибкости нынешних моделей.
Если заявление получит признание, фокус может сместиться с бесконечной "гонки вооружений" между защитниками и хакерами на переосмысление основ технологии. Пока это теоретический аргумент, подкрепленный анализом 8230 атак и защит. Дальнейшие дебаты в сообществе покажут, насколько непреодолима эта уязвимость. Эйфорию вокруг возможностей LLM необходимо уравновесить пониманием их фундаментальных рисков.


