Безопасность ИИ

Anthropic раскрыла механизм водяных знаков для Claude, устойчивых к редактированию

Компания Anthropic подробно описала работу новой системы скрытой маркировки текстов, генерируемых её ИИ Claude, основанной на "зелёном списке" токенов.

Иллюстрация к новости: Anthropic раскрыла механизм водяных знаков для Claude, устойчивых к редактированию

Компания Anthropic раскрыла технические детали системы скрытой маркировки текста для своего ИИ Claude. Вместо видимых меток она внедряет в текст статистически обнаруживаемый узор, используя метод "зеленого списка" токенов. При генерации модель предпочитает слова из заранее определенного набора, создавая невидимый для человека отпечаток, который помогает идентифицировать ИИ-контент.

Технически система работает так: перед генерацией для каждого возможного следующего токена вычисляется его вероятность. Все токены делятся на "зеленый" и "красный" списки на основе криптографического ключа, уникального для пользователя или запроса. Модель получает инструкцию слегка повышать вероятность выбора токенов из "зеленого списка". В итоге в тексте накапливается статистический перекос в пользу этих слов, что и является водяным знаком. Ключ и список известны только Anthropic, что позволяет компании проверить, создан ли текст Claude, проанализировав распределение токенов. Такой подход устойчив к поверхностному редактированию - простые правки вроде замены синонимов не устраняют глубинный статистический паттерн.

Anthropic рассматривает вопрос устойчивости водяного знака к удалению. Система не абсолютно надежна. Поверхностное редактирование не скомпрометирует маркировку, но глубокая переработка текста человеком, меняющая его структуру и лексику, может разрушить статистический узор. Для генерации кода водяной знак оказывает минимальное воздействие, так как синтаксис языков программирования жестко регламентирован и у модели меньше свободы в выборе альтернативных токенов, что не ухудшает качество генерируемого кода.

Внедрение технологии имеет последствия для отрасли. Для разработчиков, издательств или образовательных платформ это инструмент проверки и борьбы с неправомерным использованием ИИ-контента. Для Anthropic это способ усилить доверие к продукту. Подобные системы маркировки могут стать стандартом для крупных языковых моделей, поскольку они предлагают баланс между скрытностью для пользователя и возможностью верификации для создателя, не требуя изменения видимого формата контента. Однако их эффективность напрямую зависит от сложности попыток обхода - глубокая смысловая переработка остается уязвимостью.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…