Скрытые вотермарки в текстах ИИ: как работают и почему их секретность вызывает опасения
Новые правила ЕС обязывают провайдеров LLM, таких как Claude, помечать ИИ-сгенерированные тексты скрытыми вотермарками, но отказ от раскрытия деталей их работы создает риски для пользователей.
Новые правила ЕС по контролю за ИИ вступили в силу и уже влияют на крупных провайдеров языковых моделей. По этим правилам, компании обязаны маркировать весь сгенерированный ИИ-контент. Однако реализация вызывает вопросы. Один из крупных провайдеров подтвердил наличие системы маркировки, но отказался раскрывать технические детали или предоставить публичные инструменты для добавления и проверки меток. Эта непрозрачность создает риски для пользователей: их собственный, возможно лишь отредактированный текст, могут ложно определить как полностью машинный.
Принцип работы текстовых ИИ-вотермарок основан на скрытых паттернах в выходном тексте. Это могут быть статистические аномалии в распределении слов, синтаксисе или выборе синонимов. Алгоритм генерации слегка смещает вероятности выбора следующих токенов в пользу тех, что соответствуют секретному ключу модели. Текст выглядит естественно, но специальный детектор с тем же ключом может доказать его искусственное происхождение. Без знания алгоритма и ключа пользователь не может проверить, содержит ли его текст метку, и не уверен, что его оригинальный текст не будет ложно классифицирован как ИИ-сгенерированный.
Ситуация создает несколько проблем. Во-первых, возникает асимметрия информации между провайдерами ИИ и обществом. Компании могут негласно маркировать контент, а пользователи лишены инструментов для верификации. Во-вторых, появляются риски для свободы выражения и авторства. Если человек использует ИИ для редактирования или вдохновения, итоговый текст могут пометить как "искусственный" без его ведома. Это критично в академии, журналистике и юриспруденции, где важна аутентичность и авторская ответственность.
Тенденция к скрытой маркировке, подкрепленная регуляторным давлением, будет усиливаться. Но отсутствие прозрачности и стандартов может привести к появлению множества проприетарных и несовместимых систем, что еще больше запутает ситуацию. Пользователи начнут искать способы защиты, что стимулирует развитие методов обхода: перефразирование другими моделями, изменение синтаксиса, ручная правка или специализированные инструменты для "отмывания" текста. Это превращает взаимодействие в гонку между создателями вотермарок и теми, кто хочет их нейтрализовать.
Введение обязательной, но непрозрачной маркировки - это компромисс между регулированием и правами пользователей. Регуляторы хотят обеспечить прозрачность происхождения контента и снизить риски дезинформации. Но закрытые алгоритмы создают почву для злоупотреблений, ошибок и нарушения доверия. Для устойчивого развития нужен открытый диалог между разработчиками, регуляторами и обществом для выработки стандартов, обеспечивающих и подотчетность ИИ, и защиту прав пользователей. Пока же пользователям стоит осознавать риски: их тексты могут быть невидимо помечены и потенциально неправильно классифицированы.
Рассматривая конкретные примеры из практики, можно обратиться к техническим деталям. Например, в некоторых системах используется подход, где модель обучается на большом объеме данных - скажем, на 853 миллионах параметров. При генерации текста может применяться скрытая маркировка, основанная на смещении распределения вероятностей для определенных токенов. В одном из известных случаев модель, обученная на 915 миллионах примеров, демонстрировала такие статистические артефакты. Ключевая проблема в том, что без доступа к исходному алгоритму, например, к секретному ключу размером в 66 бит или к внутренней структуре модели, содержащей 1456 слоев, пользователь не может проверить наличие метки. Более того, даже если система использует открытый стандарт, его реализация может быть закрытой. Например, если для проверки требуется вычислить хеш от текста с использованием секретного значения 785391505, то без этого значения проверка невозможна. Это создает пространство для ошибок: система детекции, анализирующая текст, может дать ложный положительный результат, особенно если текст был отредактирован человеком после генерации. В одном из исследований отмечалось, что даже незначительные правки, затрагивающие всего 34 токена из исходного сгенерированного фрагмента, могут сбить детектор с толку, но при этом сама скрытая метка может остаться. Таким образом, пользователь оказывается в уязвимом положении, не имея ни гарантий отсутствия скрытой маркировки, ни инструментов для ее проверки.


