Нейросети

Как сделать голос нейросети похожим на свой собственный?

Евгений, Санкт-Петербург 563 просм.

Веду подкаст, а после ларингита голос иногда садится на полдня, и записи приходится переносить. Хочу сделать себе цифровую копию голоса, чтобы нейросеть озвучивала текст вместо меня в такие дни, но не понимаю, сколько для этого нужно записи и насколько похоже это вообще звучит.

Дмитрий Волков инженер по машинному обучению

ответил

эксперт

Технически это называется клонирование голоса, и порог входа сейчас низкий: некоторым сервисам вроде ElevenLabs хватает 30-60 секунд чистой записи, чтобы собрать узнаваемую модель вашего тембра. Но чем больше материала вы дадите, тем стабильнее результат: для по-настоящему близкой копии лучше записать 5-10 минут в тихой комнате, с разной интонацией, а не монотонным чтением одного текста.

Дальше все просто: записи загружаются в сервис, система строит голосовую модель, и любой новый текст можно озвучить этим голосом через тот же интерфейс, куда вы обычно вставляете текст для обычного синтеза речи. Разница только в том, что вместо готового каталожного голоса используется ваш собственный.

Есть момент, который стоит знать заранее: почти все крупные сервисы теперь просят наговорить фразу-подтверждение, что вы согласны на клонирование именно своего голоса. Это не бюрократия ради галочки, а реакция на волну мошенничества с поддельными голosami родственников, из-за нее платформы усилили проверку и следят, чтобы чужой голос нельзя было склонировать без согласия человека.

По качеству спокойное повествование, ровно то, что нужно для подкаста, копия воспроизводит почти идеально. А вот смех, резкие эмоциональные вставки или пение синтетический голос пока передает слабее, там разница с оригиналом заметна. Если планируете использовать клон постоянно, раз в несколько месяцев обновляйте образец записи: голос естественно немного меняется, а модель — нет.

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме