Какие нейросети сейчас генерируют видео по тексту или фото?
Максим, Санкт-Петербург 1,7 тыс. просм.
Слышал, что нейросети теперь не только пишут тексты и рисуют картинки, но и делают целые видеоролики. Хочу разобраться в этой теме подробнее, но не знаю даже названий сервисов, кроме Sora, о которой все говорят. Что вообще есть на рынке сейчас?
Дмитрий Волков инженер по машинному обучению
ответил
Направление за последний год выросло быстро, и сервисов на нем уже больше десятка. Их удобно делить на две группы по способу генерации.
Текст-в-видео: сюда попадают OpenAI Sora, Runway (модели поколения Gen), Pika, Luma Dream Machine, Kling от китайской Kuaishou и Google Veo. Вы пишете текстовое описание сцены, и модель рисует ролик с нуля, обычно на 5-10 секунд.
Фото-в-видео: сервис оживляет уже существующую картинку, добавляя ей движение камеры или анимацию объектов на ней. По такому принципу работают многие функции внутри Runway и Pika, а также отдельные инструменты вроде тех, что оживляют фотографии лиц.
Из российских разработок есть Kandinsky Video от Сбера и аналогичные видео-модели у Яндекса, они пока заметно уступают лидерам по детализации и плавности движения, зато дешевле и не требуют оплаты через зарубежные карты.
Общие ограничения у всей категории одинаковые: ролики короткие, руки и мелкий текст на экране часто выходят с искажениями, а быстрое движение камеры модель передает хуже, чем статичную сцену. Для рекламных вставок, атмосферных фонов и коротких роликов в соцсети качества уже достаточно, а вот на полноценный монтаж сериями с точным сюжетом рассчитывать пока рано.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.