Нейросети

Какие нейросети сейчас генерируют видео по тексту или фото?

Максим, Санкт-Петербург 1,7 тыс. просм.

Слышал, что нейросети теперь не только пишут тексты и рисуют картинки, но и делают целые видеоролики. Хочу разобраться в этой теме подробнее, но не знаю даже названий сервисов, кроме Sora, о которой все говорят. Что вообще есть на рынке сейчас?

Дмитрий Волков инженер по машинному обучению

ответил

эксперт

Направление за последний год выросло быстро, и сервисов на нем уже больше десятка. Их удобно делить на две группы по способу генерации.

Текст-в-видео: сюда попадают OpenAI Sora, Runway (модели поколения Gen), Pika, Luma Dream Machine, Kling от китайской Kuaishou и Google Veo. Вы пишете текстовое описание сцены, и модель рисует ролик с нуля, обычно на 5-10 секунд.

Фото-в-видео: сервис оживляет уже существующую картинку, добавляя ей движение камеры или анимацию объектов на ней. По такому принципу работают многие функции внутри Runway и Pika, а также отдельные инструменты вроде тех, что оживляют фотографии лиц.

Из российских разработок есть Kandinsky Video от Сбера и аналогичные видео-модели у Яндекса, они пока заметно уступают лидерам по детализации и плавности движения, зато дешевле и не требуют оплаты через зарубежные карты.

Общие ограничения у всей категории одинаковые: ролики короткие, руки и мелкий текст на экране часто выходят с искажениями, а быстрое движение камеры модель передает хуже, чем статичную сцену. Для рекламных вставок, атмосферных фонов и коротких роликов в соцсети качества уже достаточно, а вот на полноценный монтаж сериями с точным сюжетом рассчитывать пока рано.

Подробный разбор ИИ ускоряет тестирование: как нейросети генерируют тест-кейсы и чек-листы

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме