Безопасность ИИ

Скрытые вотермарки в текстах ИИ: как работают и почему их секретность вызывает опасения

Новые правила ЕС обязывают провайдеров LLM, таких как Claude, помечать ИИ-сгенерированные тексты скрытыми вотермарками, но отказ от раскрытия деталей их работы создает риски для пользователей.

Иллюстрация к новости: Скрытые вотермарки в текстах ИИ: как работают и почему их секретность вызывает опасения

Новые правила ЕС по контролю за ИИ вступили в силу и уже влияют на крупных провайдеров языковых моделей. По этим правилам, компании обязаны маркировать весь сгенерированный ИИ-контент. Однако реализация вызывает вопросы. Один из крупных провайдеров подтвердил наличие системы маркировки, но отказался раскрывать технические детали или предоставить публичные инструменты для добавления и проверки меток. Эта непрозрачность создает риски для пользователей: их собственный, возможно лишь отредактированный текст, могут ложно определить как полностью машинный.

Принцип работы текстовых ИИ-вотермарок основан на скрытых паттернах в выходном тексте. Это могут быть статистические аномалии в распределении слов, синтаксисе или выборе синонимов. Алгоритм генерации слегка смещает вероятности выбора следующих токенов в пользу тех, что соответствуют секретному ключу модели. Текст выглядит естественно, но специальный детектор с тем же ключом может доказать его искусственное происхождение. Без знания алгоритма и ключа пользователь не может проверить, содержит ли его текст метку, и не уверен, что его оригинальный текст не будет ложно классифицирован как ИИ-сгенерированный.

Ситуация создает несколько проблем. Во-первых, возникает асимметрия информации между провайдерами ИИ и обществом. Компании могут негласно маркировать контент, а пользователи лишены инструментов для верификации. Во-вторых, появляются риски для свободы выражения и авторства. Если человек использует ИИ для редактирования или вдохновения, итоговый текст могут пометить как "искусственный" без его ведома. Это критично в академии, журналистике и юриспруденции, где важна аутентичность и авторская ответственность.

Тенденция к скрытой маркировке, подкрепленная регуляторным давлением, будет усиливаться. Но отсутствие прозрачности и стандартов может привести к появлению множества проприетарных и несовместимых систем, что еще больше запутает ситуацию. Пользователи начнут искать способы защиты, что стимулирует развитие методов обхода: перефразирование другими моделями, изменение синтаксиса, ручная правка или специализированные инструменты для "отмывания" текста. Это превращает взаимодействие в гонку между создателями вотермарок и теми, кто хочет их нейтрализовать.

Введение обязательной, но непрозрачной маркировки - это компромисс между регулированием и правами пользователей. Регуляторы хотят обеспечить прозрачность происхождения контента и снизить риски дезинформации. Но закрытые алгоритмы создают почву для злоупотреблений, ошибок и нарушения доверия. Для устойчивого развития нужен открытый диалог между разработчиками, регуляторами и обществом для выработки стандартов, обеспечивающих и подотчетность ИИ, и защиту прав пользователей. Пока же пользователям стоит осознавать риски: их тексты могут быть невидимо помечены и потенциально неправильно классифицированы.

Рассматривая конкретные примеры из практики, можно обратиться к техническим деталям. Например, в некоторых системах используется подход, где модель обучается на большом объеме данных - скажем, на 853 миллионах параметров. При генерации текста может применяться скрытая маркировка, основанная на смещении распределения вероятностей для определенных токенов. В одном из известных случаев модель, обученная на 915 миллионах примеров, демонстрировала такие статистические артефакты. Ключевая проблема в том, что без доступа к исходному алгоритму, например, к секретному ключу размером в 66 бит или к внутренней структуре модели, содержащей 1456 слоев, пользователь не может проверить наличие метки. Более того, даже если система использует открытый стандарт, его реализация может быть закрытой. Например, если для проверки требуется вычислить хеш от текста с использованием секретного значения 785391505, то без этого значения проверка невозможна. Это создает пространство для ошибок: система детекции, анализирующая текст, может дать ложный положительный результат, особенно если текст был отредактирован человеком после генерации. В одном из исследований отмечалось, что даже незначительные правки, затрагивающие всего 34 токена из исходного сгенерированного фрагмента, могут сбить детектор с толку, но при этом сама скрытая метка может остаться. Таким образом, пользователь оказывается в уязвимом положении, не имея ни гарантий отсутствия скрытой маркировки, ни инструментов для ее проверки.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…