Безопасность ИИ

Дипфейк-видео: как их делают и как отличить от настоящего

Разбираемся, как нейросети подделывают лицо и голос в видео, какие детали выдают подделку и что грозит по закону, если дипфейк сделали с вами или вы его создали.

Иллюстрация к статье: Дипфейк-видео: как их делают и как отличить от настоящего

Дипфейк видео - это ролик, в котором лицо или голос человека заменены нейросетью так, что он говорит или делает то, чего на самом деле не было. Слово пришло из английского deep fake, "глубокая подделка", и в русском языке прижилось без перевода.

Ещё несколько лет назад дипфейк видео ассоциировалось в основном с шуточными роликами про актёров и политиков. Сейчас качество подделок выросло настолько, что распознать их на глаз стало сложнее, а сам процесс перестал требовать студии и команды монтажёров. Из-за этого с чужим лицом или голосом в мошеннической схеме теперь может столкнуться кто угодно, а не только медийные персоны.

Как нейросети подделывают лицо и голос

Технология в основе дипфейков - это нейросети, обученные на большом количестве фотографий, видео или аудиозаписей конкретного человека. Чем больше исходного материала, тем точнее сеть воспроизводит мимику, ракурсы лица и интонации голоса.

Для видео чаще всего меняют не всю картинку, а область глаз, носа и рта: нейросеть подгоняет чужие черты под мимику и освещение оригинального ролика, поэтому со стороны кажется, что человек сам произносит нужные слова. Для голоса всё проще и от этого тревожнее: современным сервисам клонирования достаточно нескольких десятков секунд чистой записи, чтобы воспроизвести тембр и манеру речи с похожестью, которой хватает, чтобы обмануть человека по телефону.

Как именно устроены конкретные инструменты для подделки чужой личности, здесь разбирать не будем - эта тема ближе к мошенничеству, чем к технологиям, и подробности принесут больше вреда, чем пользы. А вот понимать общий принцип полезно: тогда легче замечать, где нейросеть ошиблась.

Где дипфейки встречаются не только в разоблачениях

Сама технология нейтральна. Её используют для дубляжа фильмов на другие языки с сохранением движения губ актёра, для восстановления голоса людям, потерявшим его из-за болезни, и для спецэффектов, когда актёра "омолаживают" в кадре на десяток лет. Похожим принципом - нейросеть заменяет один тип контента на другой по образцу - пользуются и вполне мирные сервисы: например, Gamma: презентации из текста, обзор и разбор ограничений собирает слайды из текстового описания, а не подделывает чужое лицо. Разница не в технологии, а в том, есть ли согласие человека и есть ли цель обмануть.

Проблема начинается там, где то же самое делают без согласия и с расчётом на обман. Самые частые сценарии: поддельные видеообращения от имени руководителя компании с просьбой срочно перевести деньги, ролики со знаменитостями, которые "рекламируют" сомнительные инвестиции, видеозвонки от имени родственника, попавшего в беду, и интимные ролики, где лицо жертвы приклеено к чужому телу для шантажа.

Разработчики крупных нейросетей тоже реагируют на проблему на своём уровне. У Google, например, в связке с Gemini: обзор нейросети Google работает система скрытых меток SynthID: она ставит на сгенерированный контент водяной знак, невидимый глазу, но считываемый специальным инструментом. Правда, это работает только для контента, созданного сервисами самой компании, и не спасает от подделок, сделанных в других программах - в том числе в тех бесплатных приложениях для обработки видео и звука, которые быстро распространяются в сети (какие сервисы для монтажа честно работают без оплаты, мы отдельно разбирали в обзоре бесплатные нейросети: что реально работает без оплаты и VPN).

Признаки подделки: на что смотреть при просмотре видео

Что выдаёт видео

  • Моргание: слишком редкое, слишком частое или неестественно ровное - нейросети до сих пор плохо воспроизводят этот рефлекс.
  • Границы лица: у волос, ушей, очков или воротника заметно лёгкое размытие, будто край лица существует отдельно от остального кадра.
  • Освещение: тени на лице падают не в ту сторону, что тени на фоне, а кожа выглядит более гладкой и глянцевой, чем всё вокруг.
  • Ракурсы: при повороте головы в профиль лицо на долю секунды деформируется или "плывёт" - алгоритмы хуже справляются с углами, которых было мало в обучающих материалах.
  • Мимика: человек улыбается ртом, но не глазами, или брови двигаются с небольшой задержкой относительно речи.

Что выдаёт звук

  • Голос звучит слишком ровно, без пауз на вдох и без живых сбивок.
  • Интонация не совпадает со смыслом фразы: важные слова не выделены ударением, эмоция будто приклеена поверх нейтрального тона.
  • Синхронизация губ и звука чуть отстаёт или опережает, особенно на согласных.
  • В телефонном разговоре нет фонового шума и эха, которые обычно есть при звонке с мобильного - звук слишком "чистый" для реальной ситуации.

Если сомнения остаются, полезно проверить источник: кто выложил видео первым, есть ли оригинал у самого человека или официального аккаунта, упоминают ли ролик независимые издания. Поддельное видео почти всегда живёт без внятного первоисточника.

Частые заблуждения о дипфейках

Кривые пальцы - это не про дипфейки. Стереотип про лишние пальцы и неправильно сросшиеся руки пришёл из нейросетей, которые рисуют картинки с нуля. В дипфейк-видео чужое лицо накладывается на тело реального человека в реальной съёмке, поэтому руки и пропорции там обычно в порядке - искать нужно другие признаки, а не пальцы.

Хорошее качество видео не гарантия подлинности. Чем мощнее нейросеть и чем больше материала для обучения, тем чище результат: профессионально сделанный дипфейк вполне может выглядеть убедительнее, чем случайная съёмка на телефон.

Подделывают только знаменитостей и политиков - тоже неправда. На практике жертвами голосовых подделок чаще становятся обычные люди: мошенники клонируют голос ребёнка или родителя по паре аудиосообщений из соцсетей и звонят с просьбой перевести деньги.

Если голос звучит знакомо, это ещё не значит, что говорит именно тот человек. Современным сервисам клонирования нужно совсем немного исходного аудио, и отличить клон от оригинала по телефону, особенно в стрессовой ситуации, сложно даже близким.

Чем это опасно для жертвы

Дипфейк редко остаётся просто неприятным видео. Для жертвы это репутационный удар: коллеги, клиенты или знакомые могли увидеть ролик раньше, чем выяснилось, что он поддельный, а опровержение расходится хуже, чем оригинал. Отдельная и особенно тяжёлая история - шантаж: интимные дипфейки используют, чтобы вымогать деньги или добиваться от жертвы других действий под угрозой публикации. Есть и прямой финансовый риск: голосовые подделки родственников или руководителей - рабочая мошенническая схема, а не редкость, и банки пока не всегда успевают её распознавать до перевода денег. Ко всему добавляется психологическая нагрузка: человеку приходится доказывать, что не он сказал или сделал то, что видно на видео, а это тяжелее, чем кажется со стороны.

Ответственность по российскому законодательству

Отдельного закона именно про дипфейки в России на момент публикации нет, но это не значит, что их создание и распространение остаются без последствий - вопрос решается через уже существующие нормы.

Право на изображение защищено гражданским кодексом: использование чужого лица без согласия - это как минимум основание для иска о защите чести, достоинства и деловой репутации, а также для компенсации морального вреда. Если дипфейк использовали, чтобы получить деньги обманным путём - под видом срочного перевода, "помощи родственнику" или фиктивной инвестиции, - это подпадает под статью о мошенничестве в уголовном кодексе. Распространение через поддельное видео заведомо ложных и порочащих сведений может квалифицироваться как клевета. А публикация интимных дипфейков без согласия жертвы дополнительно затрагивает нормы о неприкосновенности частной жизни.

Это не юридическая консультация, а общая картина: конкретную статью и перспективы дела в каждом случае определяет юрист, глядя на обстоятельства. Но обратиться к юристу и в полицию стоит в любом случае - молчать про поддельное видео с вашим лицом невыгодно именно жертве.

Что делать, если дипфейк сделали с вами

Первое - не удалять и не игнорировать ролик, а сохранить всё: ссылку, скриншоты, дату публикации и данные аккаунта, который его выложил. Это пригодится и полиции, и площадке, где будете требовать удаление.

Второе - подать жалобу на самой платформе. У большинства соцсетей и видеохостингов есть отдельная форма для поддельного контента с чужим лицом, и по ней ролики блокируют быстрее, чем по обычной жалобе на нарушение правил.

Третье - если дипфейк использовали для звонка с просьбой о деньгах, не переводите ничего, пока не свяжетесь с человеком другим способом: позвоните сами на известный вам номер или напишите в переписке, которая уже была раньше. Мошенники специально создают ощущение срочности, чтобы жертва не успела проверить.

И обратитесь в полицию с заявлением, даже если ролик набрал не так много просмотров - зафиксированный факт обращения важен и для расследования, и для последующего гражданского иска. Больше материалов о похожих угрозах собрано в рубрике безопасность ИИ: там мы разбираем, как нейросети используют против обычных людей и что с этим делать.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…