Anthropic раскрыла механизм водяных знаков для Claude, устойчивых к редактированию
Компания Anthropic подробно описала работу новой системы скрытой маркировки текстов, генерируемых её ИИ Claude, основанной на "зелёном списке" токенов.
Компания Anthropic раскрыла технические детали системы скрытой маркировки текста для своего ИИ Claude. Вместо видимых меток она внедряет в текст статистически обнаруживаемый узор, используя метод "зеленого списка" токенов. При генерации модель предпочитает слова из заранее определенного набора, создавая невидимый для человека отпечаток, который помогает идентифицировать ИИ-контент.
Технически система работает так: перед генерацией для каждого возможного следующего токена вычисляется его вероятность. Все токены делятся на "зеленый" и "красный" списки на основе криптографического ключа, уникального для пользователя или запроса. Модель получает инструкцию слегка повышать вероятность выбора токенов из "зеленого списка". В итоге в тексте накапливается статистический перекос в пользу этих слов, что и является водяным знаком. Ключ и список известны только Anthropic, что позволяет компании проверить, создан ли текст Claude, проанализировав распределение токенов. Такой подход устойчив к поверхностному редактированию - простые правки вроде замены синонимов не устраняют глубинный статистический паттерн.
Anthropic рассматривает вопрос устойчивости водяного знака к удалению. Система не абсолютно надежна. Поверхностное редактирование не скомпрометирует маркировку, но глубокая переработка текста человеком, меняющая его структуру и лексику, может разрушить статистический узор. Для генерации кода водяной знак оказывает минимальное воздействие, так как синтаксис языков программирования жестко регламентирован и у модели меньше свободы в выборе альтернативных токенов, что не ухудшает качество генерируемого кода.
Внедрение технологии имеет последствия для отрасли. Для разработчиков, издательств или образовательных платформ это инструмент проверки и борьбы с неправомерным использованием ИИ-контента. Для Anthropic это способ усилить доверие к продукту. Подобные системы маркировки могут стать стандартом для крупных языковых моделей, поскольку они предлагают баланс между скрытностью для пользователя и возможностью верификации для создателя, не требуя изменения видимого формата контента. Однако их эффективность напрямую зависит от сложности попыток обхода - глубокая смысловая переработка остается уязвимостью.


