Нейросети

Veo: обзор видеомодели Google

Veo - нейросеть Google, которая по тексту или картинке собирает готовый видеоролик со звуком. Рассказываем, где её включить, сколько это стоит и почему бесплатно не получится.

Иллюстрация к статье: Veo: обзор видеомодели Google

Veo - нейросеть Google для генерации видео по текстовому описанию или референсной картинке: пишете промпт, спустя минуту-другую получаете готовый ролик с движением камеры, светом и, в последней версии, звуком. Ещё пару лет назад такие ролики выдавали себя рваной анимацией и плывущими лицами, сейчас отличить их от съёмки с рук получается не всегда.

За названием Veo стоит не один продукт, а семейство моделей от Google DeepMind, и с наскока тут не разобраться: сервис раскидан по нескольким приложениям, тарифам и даже отдельному инструменту для монтажа. Дальше по порядку - что Veo умеет на практике, сколько стоит доступ, что раздражает в работе и чем заменить сервис, если подписка Google не подходит.

Что это и кому нужно

Google развивает Veo как линейку моделей: Veo 2 вышла в конце 2024 года и подняла планку по реализму физики и картинки, Veo 3 добавила главное новшество - синхронный со сценой звук. Диалоги, уличный шум, звук шагов генерируются вместе с видео, а не накладываются отдельным треком постфактум. Какое-то время это было отличительной чертой именно Veo, конкуренты подтягивают озвучку только сейчас.

Пользоваться моделью можно несколькими способами. Проще всего - через приложение Gemini, где Veo доступна как один из режимов генерации прямо в чате. Для более сложной работы Google выпустила Flow - отдельный инструмент, который собирает несколько сгенерированных фрагментов в связную сцену с одними и теми же персонажами и локацией. У разработчиков и компаний путь другой - Vertex AI, где модель вызывается через API и встраивается в собственный пайплайн.

Кому это реально нужно? Авторам роликов для соцсетей, которым не хватает бюджета на съёмку, но нужна конкретная картинка под сценарий. Маркетологам, которые готовят короткие рекламные вставки без выезда на локацию. Тем, кто монтирует YouTube Shorts - там Veo встроена в фирменную функцию Dream Screen и позволяет вставить сгенерированный фон или сцену прямо в редакторе. Продавцам на маркетплейсах видео в карточке товара тоже поднимает конверсию, и здесь Veo способна закрыть часть работы, которую раньше делали блогеры или фотостудии - я разбирал эту тему отдельно в материале про нейросети для маркетплейсов: карточки, фото товара и описания.

Что умеет

Базовый сценарий простой: текстовый промпт на входе, видеоролик на выходе. Можно описать сцену словами - что происходит, какая погода, куда движется камера - и получить связный клип, а не набор случайных кадров. Второй вариант входа - референсное изображение: загружаете картинку, модель оживляет её, добавляя движение и логичное развитие сцены.

  • Звук из коробки. Veo 3 генерирует не только картинку, но и озвучку: реплики персонажей с более-менее попадающей артикуляцией, фоновые шумы, музыку под настроение сцены. У OpenAI похожий инструмент называется Sora, я писал о нём в обзоре видеогенератора OpenAI - ролики визуально сопоставимы, но звука у Sora на момент того обзора не было, и разница чувствуется сразу.
  • Понимание операторских терминов. В промпт можно вписать наезд камеры, панораму, план с высоты птичьего полёта - модель действительно пытается отработать именно такое движение, а не абстрактную анимацию.
  • Физика и свет. Вода, ткань, отражения, тени от движущихся объектов выглядят правдоподобнее, чем у моделей прошлого поколения. Не идеально, но заметно лучше.

Длина одного сгенерированного фрагмента ограничена - обычно это несколько секунд, а не минута готового ролика. Чтобы собрать что-то длиннее, нужен именно Flow: там можно склеить несколько сцен, сохранив персонажа и обстановку между ними. Без этого инструмента получить связный ролик на тридцать секунд одним запросом не выйдет.

Тарифы и доступ из России

Бесплатно и без ограничений Veo не работает. В приложении Gemini иногда можно попробовать генерацию в урезанном виде или по акции, но это скорее демонстрация возможностей, чем рабочий инструмент - на серьёзный объём такого лимита не хватит.

Полноценный доступ идёт через платные тарифы Google AI - в разное время они назывались Gemini Advanced, потом Google AI Pro и Google AI Ultra. Базовый уровень стоит примерно как обычная подписка ChatGPT Plus, но с ограниченным количеством генераций Veo в месяц. Полный доступ к старшей версии модели и приоритетной очереди открывает только верхний тариф, а он заметно дороже - фактически рассчитан на тех, для кого видео это часть работы, а не разовое развлечение. Точные цены называть не буду - Google меняет тарифную сетку чаще, чем хотелось бы, и к моменту чтения статьи цифры уже могут устареть.

Для разработчиков и бизнеса есть третий путь - Vertex AI, где оплата идёт по факту использования, за каждую секунду сгенерированного видео, без месячной подписки. Это удобнее, если генерация нужна не постоянно, а под конкретные задачи, но требует настроенного облачного аккаунта с привязанным способом оплаты.

С доступом из России ситуация обычная для сервисов Google: интерфейс и сам запрос генерации на момент публикации открываются через VPN, а вот оформить платную подписку или облачный биллинг напрямую российской картой не получится - Google не принимает такие платежи для ИИ-тарифов. На практике пользуются виртуальными картами других стран или платёжными посредниками, и это обходной путь, а не официально поддерживаемый способ. Ситуация может измениться в любую сторону, так что воспринимайте это как снимок на дату публикации, а не гарантию.

Ограничения и минусы

Главное неудобство - короткие фрагменты. Одна генерация - это несколько секунд, и для ролика длиннее приходится либо клеить сцены во Flow, либо смириться с тем, что персонаж между кусками слегка меняется лицом или одеждой. Идеальной консистентности пока нет ни у кого на рынке, но именно при попытке рассказать цельную историю это ограничение чувствуется особенно остро.

Квота расходуется быстро. Генерация в хорошем качестве стоит заметного числа кредитов подписки, и если пробовать разные варианты промпта, месячный лимит можно выбрать за несколько дней активной работы. Дозаправить квоту без перехода на более дорогой тариф нельзя - это не отдельная докупка, а вопрос смены плана целиком.

Есть и содержательные проблемы: руки и мелкая моторика всё ещё иногда выглядят неестественно, надписи и текст внутри кадра почти никогда не читаются правильно, а быстрое движение по кадру временами превращается в кашу из смазанных пикселей. Модерация тоже строгая - реальных людей, узнаваемых персонажей и некоторые темы модель генерировать отказывается, и это не всегда предсказуемо: похожий по духу промпт может пройти, а этот - нет.

Рендер не мгновенный: на клип с хорошим качеством уходит от минуты и больше, а в часы пиковой нагрузки очередь становится заметно длиннее. Тем, кто рассчитывал получить готовое видео так же быстро, как картинку, это может показаться неприятным сюрпризом.

Чем заменить

Если единственное, что нужно - это видео без звука и без завязки на экосистему Google, у OpenAI есть Sora, о которой уже шла речь выше: по картинке сервисы сейчас близки, разница в основном в звуке и в том, куда встроен доступ.

Среди сторонних сервисов внимания заслуживают Kling и Runway - оба дают бесплатные пробные кредиты без обязательной подписки на дорогой тариф, и для одного ролика этого может хватить, чтобы вообще не связываться с оплатой. Если бесплатный вариант принципиален, а платные тарифы Veo не подходят по деньгам, посмотрите отдельный разбор бесплатных нейросетей: что реально работает без оплаты и VPN - там собраны рабочие варианты для похожих задач, пусть Veo среди них и нет.

Если вы уже платите за подписку Google AI ради Gemini или Диска, попробовать Veo в её составе логично - доплачивать за отдельный сервис не придётся, а качество сегодня одно из лучших на рынке. Если подписки нет и заводить её ради десятка роликов не хочется, дешевле начать с бесплатных кредитов Kling или Runway, а к Veo вернуться, когда станет ясно, что видео нужно на регулярной основе, а не разово. Другие обзоры нейросетей собраны в архиве рубрики - там можно сравнить несколько сервисов, прежде чем платить за какой-то один.

Вопросы читателей по теме

Все вопросы

Чем отличается нейросеть от искусственного интеллекта?

спрашивает Дмитрий, Уфа 78 просм.

Дмитрий Волков: Путаница объяснима, потому что термины действительно пересекаются, но по объёму понятий это не одно и то же. Искусственный интеллект - самое широкое понятие, оно означает вообще любую систему, которая имитирует интеллектуальное поведение: принимает решения, распознаёт образы, ведёт диалог. Под это определение подпадают и простые программы на жёстких правилах без единой нейросети внутри, и современные большие…

Как нейросеть создает изображение?

спрашивает Дмитрий, Оренбург 145 просм.

Дмитрий Волков: Большинство современных генераторов изображений - это диффузионные модели, и работают они на первый взгляд контринтуитивно: не рисуют картинку с нуля, а наоборот, учатся убирать шум. При обучении модели показывают реальное изображение, постепенно добавляют к нему случайный шум до тех пор, пока от исходной картинки не останется одна серая рябь, и просят модель на каждом шаге…

Какая нейросеть делает фото по описанию?

спрашивает Екатерина, Ульяновск 145 просм.

Сергей Орлов: Генераторов изображений по тексту сейчас несколько, и выбор зависит от того, что важнее - реалистичность, доступность без VPN или цена. Midjourney и DALL-E через ChatGPT Plus дают самую реалистичную картинку и хорошо понимают сложные описания, но обе платные и не всегда без ограничений доступны из России. Из отечественных сервисов Шедеврум от Яндекса и Kandinsky от…

Как нейросети помогают в повседневных задачах?

спрашивает Игорь, Уфа 237 просм.

Дмитрий Волков: Смотря что вы называете нейросетью. Строго говоря, это математическая модель, которая лежит в основе почти всех современных сервисов ИИ: от переводчиков и голосовых помощников до систем, которые советуют вам следующий фильм. В офисной работе от неё есть польза в трёх конкретных вещах, а не в абстрактных обещаниях. Во-первых, черновая обработка текста: свести длинное письмо в…