Как искусственный интеллект поет песни?
Денис, Волгоград 215 просм.
Наткнулся на сервисы, где нейросеть за пару минут сочиняет целую песню с пением, причём голос звучит вполне живо. Как это вообще устроено - там что, реальный человек озвучивает, или искусственный интеллект действительно "поет" сам?
Марина Соколова аналитик по внедрению ИИ
ответил
Никакого человека за кадром нет, но и в привычном смысле «пения» тоже нет — модель не издаёт звук голосовыми связками, а генерирует звуковую волну по частям, предсказывая, каким должен быть следующий крошечный фрагмент звука. Она обучена на огромном количестве записей вокала вместе с текстами и нотами, поэтому усвоила, как высота, тембр и ритм связаны со словами и мелодией.
Технически процесс делится на несколько шагов: сначала генерируется текст и мелодическая структура, затем отдельная часть модели превращает это в спектрограмму — визуальное представление звука по частоте и времени, а финальный слой достраивает из неё аудиоволну, максимально похожую на человеческий вокал. Именно поэтому голос звучит естественно: модель училась не на «правилах пения», а на тысячах реальных примеров.
Ограничения у технологии тоже есть:
- сложные эмоциональные переходы и живая импровизация даются хуже, чем ровный куплет;
- на длинных треках иногда заметны «швы» между сгенерированными кусками;
- голос обычно узнаваемо синтетический на слух опытного музыканта, хотя массовому слушателю это незаметно.
Для музыкантов и авторов это уже рабочий инструмент для набросков и демо, но как полноценная замена живого вокала на профессиональном релизе технология пока используется реже — в основном из-за вопросов авторских прав на голос, на котором обучалась модель.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.