Как озвучить нейросеть, чтобы она отвечала голосом?
Алексей, Нижний Новгород 750 просм.
Делаю короткие обучающие ролики: сценарий пишу через нейросеть, а голос пока записываю сам на телефон и потом часами убираю шумы и оговорки. Слышал, что озвучку тоже можно поручить нейросети. Как это устроено и с чего начать, если с синтезом речи раньше не работал?
Дмитрий Волков инженер по машинному обучению
ответил
Записывать голос самостоятельно для этого больше не нужно. Текст, который выдала одна нейросеть, можно тут же прогнать через другую, которая занимается синтезом речи, и на выходе получить готовый аудиофайл.
Схема простая. Вы отправляете текст в сервис синтеза речи, например Yandex SpeechKit, ElevenLabs или открытый Silero, выбираете один из готовых голосов, и через несколько секунд получаете mp3 или wav. Программировать для этого не обязательно: у большинства сервисов есть веб-интерфейс, куда текст просто вставляется, а API нужен, только если хотите встроить озвучку в свой продукт или автоматизировать процесс для десятков роликов.
Длинный сценарий часто приходится резать на куски: многие сервисы ограничивают один запрос парой тысяч символов, дальше склеиваете аудио в любом редакторе. Отдельно стоит поработать с самим текстом перед отправкой: расставьте запятые и точки там, где нужна пауза, разбейте длинные предложения. Без этого голос звучит монотонно и торопливо, машина не расставляет интонации сама, она читает ровно то, что вы написали, знак за знаком.
Выбор голоса и языковых нюансов тоже на вас: для русского текста берите голос, обученный именно на русском, иначе ударения в именах и терминах будут сбиваться. Для рекламных роликов с узнаваемым голосом бренда синтетическая озвучка пока проигрывает живому актеру по эмоциональности, а вот для обучающих и новостных видео разницу почти никто не замечает.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.