Нейросети

Как сделать песню нейросетью: голос, музыка и текст за один вечер

Пошаговый план для тех, кто хочет получить готовую песню нейросетью за один вечер: как написать текст, подобрать музыку, наложить голос и свести всё в один трек без музыкального образования.

Иллюстрация к статье: Как сделать песню нейросетью: голос, музыка и текст за один вечер

Ещё недавно песня, сделанная нейросетью, была курьёзом: рваный вокал, музыка без формы, текст ни о чём. Сейчас написать песню нейросетью реально за один вечер, и результат вполне можно скинуть друзьям, не извиняясь заранее.

Разберём весь путь создания песни нейросетью: текст, музыка, голос и финальная сборка. Задача разбита на шаги, каждый занимает от десяти минут до часа - сложного оборудования не нужно, только браузер, наушники и немного терпения на подбор формулировок.

Шаг 1. Написать текст песни

Начинать стоит с текста, а не с музыки: мелодия под готовые слова подбирается проще, чем слова под готовый бит.

Для текста подойдёт любая нейросеть общего назначения - ChatGPT, Claude, Яндекс GPT. Задача не в том, чтобы просто попросить "напиши песню про любовь", а в том, чтобы задать структуру: сколько куплетов, есть ли припев, какая тема сюжета, в каком настроении. Хороший запрос выглядит примерно так: "напиши текст песни про переезд в другой город, два куплета и припев, разговорный язык, без пафоса".

Русскоязычные модели по-разному справляются с рифмой и ритмом строк: одна рифмует складно, но плоско, другая путается в длине строк. Если результат разваливается, стоит явно попросить нейросеть выровнять слоги между строками - это частая слабая сторона генерации текста песен. Про то, какие сервисы вообще нормально работают с русским языком и не превращают текст в подстрочник с иностранного, есть отдельный разбор: нейросети на русском языке.

Готовый текст лучше не отправлять в музыкальный сервис как есть - вычитайте его вслух. Строка, которая нормально выглядит на экране, часто ломает ритм, если её пропеть.

Шаг 2. Сгенерировать музыку и мелодию

Здесь работают специализированные сервисы для музыки - Suno и Udio сейчас самые известные. Логика у обоих похожая: вставляете текст песни, описываете жанр и настроение, например "инди-рок, энергично, гитары" или "спокойный акустический поп", и сервис сочиняет музыку с вокалом одним куском.

Именно здесь чаще всего спотыкаются песни нейросетью на русском языке: качество сильно зависит от того, на каком языке текст. По-английски Suno и Udio поют уверенно, с русским периодически путаются - глотают окончания, ставят ударения не туда. Если цель - русскоязычная песня, стоит сразу настроиться на пару лишних попыток и лёгкую правку текста под то, как модель его слышит.

Бесплатный тариф у таких сервисов обычно есть, но лимит генераций в сутки скромный и вырабатывается быстро, особенно если делать несколько вариантов одной песни, чтобы выбрать лучший. Какие нейросети вообще можно нормально использовать бесплатно, без подписки и без VPN, разобрано отдельно, там же про реальные лимиты, а не заявленные: бесплатные нейросети.

На момент публикации Suno и Udio доступны из России без VPN, но такие вещи меняются быстро - перед тем как садиться за песню, стоит проверить доступ заново.

Шаг 3. Отдельно наложить или заменить голос

Если музыкальный сервис на шаге 2 уже сгенерировал вокал вместе с музыкой, этот шаг можно пропустить: штатного голоса для большинства задач достаточно.

Отдельно заниматься голосом имеет смысл по двум причинам. Первая - нужен конкретный тембр, например голос, похожий на собственный, или голос персонажа, которого сами придумали. Вторая - музыка получилась хорошая, а вокал вышел невнятным, и хочется переозвучить его, не трогая инструментал.

Для этого нужен сервис голосового синтеза, который умеет петь, а не просто читать текст. Разница важная: обычный синтез речи читает ровно, без музыкальных пауз и растяжки нот, а сервисы для вокала держат мелодию и подстраиваются под темп трека. Готовый вокал накладывается поверх инструментала отдельным слоем в аудиоредакторе, автоматически они не смешиваются.

Отдельно про этику: клонирование чужого голоса без согласия человека нарушает условия использования почти всех таких сервисов, и в этом есть смысл - речь идёт о чужом лице и голосе. Для себя, для друга, который дал добро, или для полностью синтетического голоса вопросов обычно не возникает.

Шаг 4. Свести слои в один трек

Если музыкальный сервис на шаге 2 сразу выдал готовую песню с вокалом внутри, сведение не нужно - переходите к следующему шагу. Если текст, музыка и вокал собирались раздельно, их нужно объединить в один файл.

Подойдёт любой бесплатный аудиоредактор с несколькими дорожками. Логика простая: инструментал на одну дорожку, вокал на другую, громкости выравниваются так, чтобы слова были разборчивы поверх музыки, а не тонули в ней. Если голос звучит суховато на фоне музыки, помогает лёгкая реверберация - без неё нейросетевой вокал часто звучит плоско, будто записан в пустой комнате без мебели.

Стоит проверить громкость на разных устройствах: в наушниках и на динамике телефона баланс между голосом и музыкой звучит по-разному, и сведение, которое казалось идеальным в наушниках, на динамике телефона может утопить вокал.

Шаг 5. Собрать обложку и сохранить результат

Песне нужна обложка, если её собираются куда-то выкладывать - хотя бы в чат или в личный плейлист. Делать её вручную необязательно: обложку тоже можно сгенерировать нейросетью, задав тему и настроение трека словами, примерно как текст на первом шаге. Про то, как формулировать запрос, чтобы получить нужную картинку, а не случайный набор форм, есть отдельный разбор: генерация изображений нейросетью.

Готовый трек лучше сохранить в исходном качестве, которое даёт сервис, а не в сжатом виде для быстрой отправки: пережать можно всегда, а вернуть качество после сжатия уже нет.

Типичные ошибки и что делать, если не получилось

Слишком общий запрос на музыку. "Сделай красивую песню" даёт непредсказуемый результат, потому что нейросеть додумывает всё сама. Жанр, темп, инструменты и настроение стоит задавать явно, желательно с описанием похожего звучания словами, не названием конкретного исполнителя: "медленно, минорный лад, пианино и струнные".

Текст не ложится на музыку. Если строки то длиннее, то короче без видимой причины, сервис генерации музыки начинает либо обрезать слова, либо растягивать их неестественно. Лечится вычиткой текста вслух до генерации музыки, а не после.

Голос звучит роботом даже там, где сервис обещает живой вокал. Чаще всего это заметно на резких скачках высоты ноты и на длинных гласных. Если неестественно звучит одна конкретная строка, обычно проще перегенерировать этот фрагмент с чуть другой формулировкой текста, чем пересобирать всю песню заново.

Бесплатный лимит закончился на середине работы. Логично разнести процесс на два захода: в один написать и отточить текст, во второй, со свежим лимитом, генерировать музыку и голос. Так меньше соблазна тратить попытки на текст, который потом всё равно захочется переписать.

Результат нравится, а скачать в хорошем качестве нельзя без подписки. Это не поломка, а особенность модели монетизации: бесплатный доступ обычно даёт генерацию и прослушивание, но не выгрузку файла без ограничений. Прежде чем тратить вечер на конкретный сервис, стоит заранее посмотреть, на каких условиях он отдаёт готовый файл.

Больше про то, какие ещё нейросети стоит попробовать помимо музыкальных, есть в общем разделе на сайте: архив рубрики.

Если совсем ничего не клеится - музыка не подходит под текст, голос режет слух, а вечер уже заканчивается, - не пытайтесь сделать идеально с первой попытки. Соберите черновой вариант из первых же результатов, отложите на день и переслушайте свежим ухом. Обычно сразу становится ясно, что именно раздражает, и это чинится точечно куда быстрее, чем пересборка всей песни с нуля.

Вопросы читателей по теме

Все вопросы

Чем отличается нейросеть от искусственного интеллекта?

спрашивает Дмитрий, Уфа 54 просм.

Дмитрий Волков: Путаница объяснима, потому что термины действительно пересекаются, но по объёму понятий это не одно и то же. Искусственный интеллект - самое широкое понятие, оно означает вообще любую систему, которая имитирует интеллектуальное поведение: принимает решения, распознаёт образы, ведёт диалог. Под это определение подпадают и простые программы на жёстких правилах без единой нейросети внутри, и современные большие…

Как нейросеть создает изображение?

спрашивает Дмитрий, Оренбург 113 просм.

Дмитрий Волков: Большинство современных генераторов изображений - это диффузионные модели, и работают они на первый взгляд контринтуитивно: не рисуют картинку с нуля, а наоборот, учатся убирать шум. При обучении модели показывают реальное изображение, постепенно добавляют к нему случайный шум до тех пор, пока от исходной картинки не останется одна серая рябь, и просят модель на каждом шаге…

Какая нейросеть делает фото по описанию?

спрашивает Екатерина, Ульяновск 133 просм.

Сергей Орлов: Генераторов изображений по тексту сейчас несколько, и выбор зависит от того, что важнее - реалистичность, доступность без VPN или цена. Midjourney и DALL-E через ChatGPT Plus дают самую реалистичную картинку и хорошо понимают сложные описания, но обе платные и не всегда без ограничений доступны из России. Из отечественных сервисов Шедеврум от Яндекса и Kandinsky от…

Как нейросети помогают в повседневных задачах?

спрашивает Игорь, Уфа 223 просм.

Дмитрий Волков: Смотря что вы называете нейросетью. Строго говоря, это математическая модель, которая лежит в основе почти всех современных сервисов ИИ: от переводчиков и голосовых помощников до систем, которые советуют вам следующий фильм. В офисной работе от неё есть польза в трёх конкретных вещах, а не в абстрактных обещаниях. Во-первых, черновая обработка текста: свести длинное письмо в…