Нейросети

Промпты для генерации фото: как описать кадр

Разбираем, из каких частей складывается промпт для фото и какие сервисы реально его понимают: что бесплатно, что просит VPN и где кириллица в тексте на картинке превращается в кашу.

Иллюстрация к статье: Промпты для генерации фото: как описать кадр

Промпты для фото решают, получится ли на выходе кадр, который можно поставить в портфолио, или очередная нейросетевая нежить с восемью пальцами. Разница обычно не в том, какой сервис вы выбрали, а в том, как подробно вы описали сцену: кто в кадре, какой свет, с какой точки снято и в каком стиле.

В этом материале сначала разберём, из каких частей складывается рабочий промпт для фото, а потом пройдёмся по сервисам, которые эти промпты понимают: что в них бесплатно, что просит VPN и оплату иностранной картой, и где кириллица в тексте на картинке превращается в кашу.

Из чего складывается промпт для описания кадра

Нейросеть не додумывает то, что вы не сказали. Если в промпте нет слова про свет, она поставит первый попавшийся - часто плоский полуденный, который убивает любое настроение. Есть шесть частей, из которых стоит собирать описание кадра.

  • Субъект и действие: кто или что в кадре и что оно делает - не просто "девушка", а "девушка читает книгу у окна".
  • Окружение: где происходит сцена - студия с белым фоном, городская улица вечером, лес в тумане.
  • Свет: мягкий рассеянный, жёсткий боковой, золотой час, неоновая подсветка - свет задаёт настроение сильнее, чем цвет.
  • Оптика и ракурс: портретный объектив с размытым фоном, широкий угол, съёмка с уровня земли - это тоже часть промпта, а не техническая деталь только для профессионалов.
  • Стиль: фотореализм, плёночная зернистость, редакционная съёмка для журнала - без этого слова сервис может выдать иллюстрацию вместо фото.
  • Что убрать: у многих сервисов есть поле для негативного промпта - список того, чего быть не должно: лишние пальцы, текст на фоне, размытость.

Дальше - сами сервисы, куда эти промпты вводятся. Разброс большой: от бесплатных российских генераторов до Midjourney, который просит оплату иностранной картой. Если важно именно бесплатно и без VPN, отдельно на эту тему есть обзор Бесплатные нейросети: что реально работает без оплаты и VPN, а здесь фокус на том, как сервисы понимают описание кадра.

Midjourney

Один из первых сервисов, ставших синонимом качественной генерации фото, до сих пор держит планку по фотореализму, свету и композиции. При подробном промпте результат часто выглядит как настоящий кадр, а не как рендер.

Работает через бота в Discord, есть и отдельный веб-интерфейс. Discord на момент публикации в России обычно открывается без VPN, хотя перебои со скоростью случаются. С оплатой сложнее: бесплатного тарифа у Midjourney сейчас нет, нужна подписка и иностранная карта или посредник.

Интерфейс и промпты - на английском. Писать можно и по-русски, но на английском описание кадра обычно получается точнее.

ChatGPT (генерация изображений)

Генерация картинок встроена прямо в чат: накидали промпт для фото, посмотрели результат, тут же попросили поменять свет или убрать лишний предмет на фоне - не переписывая всё описание заново.

OpenAI ограничивает прямую регистрацию из России, доступ обычно идёт через VPN, а для платной подписки нужен способ оплаты, не привязанный к российскому банку. Бесплатный доступ есть, но с суточным лимитом генераций; Plus стоит около 20 долларов в месяц, хотя тарифы у OpenAI меняются.

Русский язык ChatGPT понимает прекрасно, промпт можно писать разговорным языком, без попытки угадать английские термины.

Если задача не фото, а текст, у ChatGPT и его конкурентов для этого разные сильные стороны - мы отдельно сравнивали их на одной практической задаче в материале Нейросети для написания текста: разбор сервисов на одной задаче.

Bing Image Creator (Copilot)

Бесплатная альтернатива с движком, близким к DALL-E, но без подписки - достаточно аккаунта Microsoft. Удобно, чтобы быстро проверить промпт для фото, не тратя лимиты в других сервисах.

Microsoft тоже частично ограничил доступ для российских аккаунтов, вход и генерация иногда требуют VPN - ситуация меняется, лучше проверить лично перед тем как рассчитывать на сервис.

Интерфейс переведён на русский, промпты понимает так же хорошо, как ChatGPT.

Бесплатно, с дневным лимитом быстрых генераций - после исчерпания картинки создаются медленнее, но создаются.

Шедеврум

Российский сервис от Яндекса, изначально заточенный под то, чтобы промпты писались по-русски без перевода в голове на английский. Кроме одиночных кадров умеет режим продолжения истории - серию картинок по одному сюжету.

Работает из России без оговорок: VPN не нужен ни для регистрации, ни для оплаты.

Бесплатен, лимит генераций в сутки есть, но обновляется каждый день, и для повседневных задач его обычно хватает.

Если фото получилось удачным и хочется его оживить, из готового кадра здесь же можно собрать короткий ролик - как это делается в разных сервисах, разобрано в статье Как сделать видео из фото нейросетью.

Kandinsky (Fusion Brain)

Генератор от Сбера, начинавший как модель для иллюстраций и артов, но версии последних лет неплохо справляются и с фотореалистичными кадрами - портретами, предметной съёмкой, пейзажами.

Как и Шедеврум, сервис российский, доступен без VPN и без иностранной карты.

Интерфейс и промпты полностью на русском, причём модель обучена именно на русскоязычных описаниях, поэтому формулировки вроде "мягкий вечерний свет" она понимает без потери смысла.

Бесплатно, с лимитом генераций в сутки; за плату лимит увеличивается, открывается более высокое разрешение.

Stable Diffusion

Строго говоря, это не сервис, а открытая модель, которую десятки площадок встраивают в свои интерфейсы - от Fusion Brain до менее известных сайтов. Единого ответа "как он работает" нет: результат зависит от конкретной обёртки, которую вы открыли.

Из-за этого нет и единого ответа про VPN и оплату - у одних площадок всё бесплатно, у других нужна регистрация с иностранной картой. Проверять приходится по каждому сайту отдельно.

Модель обучена в основном на англоязычных описаниях, поэтому промпт для фото на английском обычно даёт более предсказуемый результат, чем тот же текст по-русски.

Adobe Firefly

Отличается тем, что встроена прямо в Photoshop и Illustrator: можно не генерировать фото с нуля, а дорисовать часть кадра, заменить фон или убрать лишний объект по текстовому описанию.

Adobe официально свернула продажи в России, доступ практически всегда идёт через VPN, оплата - через иностранную карту или посредника.

Интерфейс частично переведён, местами криво; промпты по-русски сервис понимает терпимо.

При регистрации начисляется небольшое количество бесплатных генеративных кредитов, дальше - платная подписка.

Leonardo.Ai

Изначально делался под концепт-арты и игровые ассеты, поэтому у него много готовых стилей в один клик, но с фотореализмом тоже справляется прилично, особенно в портретах.

На момент публикации работает без VPN, но перед оплатой стоит проверить актуальную ситуацию самостоятельно - доступность зарубежных сервисов из России меняется быстро.

Интерфейс английский, промпты по-русски понимает средне: часть деталей описания может потеряться.

Каждый день начисляются бесплатные жетоны на генерацию, но они сгорают, если не потратить их до следующего начисления - копить не получится.

Ideogram

Сильная сторона - текст на изображении: вывеска, надпись на футболке, логотип с читаемыми буквами, там, где у большинства генераторов получается абракадабра вместо букв.

На момент публикации доступен без VPN.

Промпт для фото можно писать по-русски, сервис поймёт сцену, но если нужен текст именно на картинке, надёжнее задавать его латиницей - кириллица периодически рассыпается на похожие по форме символы.

Бесплатных генераций в сутки немного, но они есть; платная подписка снимает лимит и добавляет приватность результатов.

Recraft

Одинаково уверенно работает и с растровыми фото, и с векторной графикой - из одного промпта можно получить и фотореалистичный кадр, и чистую иконку без лишних деталей.

На момент публикации доступен без VPN. Интерфейс английский, промпты по-русски понимает нормально.

Бесплатный лимит ограничен числом генераций в месяц, а не в сутки, поэтому расходуется он быстрее - легко потратить весь запас за пару активных дней.

Canva (Magic Media)

Генерация встроена прямо в редактор Canva: получили фото - тут же вставили в готовый макет для соцсетей или презентации, не перекладывая файл между сервисами.

Доступна без VPN, оплата - обычными способами, привязанными к аккаунту Canva. Интерфейс полностью на русском.

Бесплатный аккаунт даёт ограниченное число генераций в месяц, платная подписка Canva снимает лимит заодно с остальными платными функциями редактора.

Какой сервис выбрать под задачу

Если нужно просто получить фото без танцев с VPN и оплатой, Шедеврум и Kandinsky закрывают задачу быстрее всех: оба бесплатны, оба на русском, оба работают из России без оговорок.

Для фотореализма и сложной композиции, где важна каждая деталь кадра, лучше показывают себя Midjourney и ChatGPT, но за них придётся повозиться с доступом и оплатой.

Если в кадре нужен читаемый текст - вывеска, обложка, футболка с надписью - берите Ideogram и пишите текст латиницей.

Для правки уже существующих фото, а не генерации с нуля, ближе всех Adobe Firefly, особенно если вы и так работаете в Photoshop. Для сочетания фото и векторной графики подойдёт Recraft, а если результат сразу нужен в макете для соцсетей - Canva.

Прежде чем платить за подписку, есть смысл вбить один и тот же промпт для фото в пару бесплатных сервисов - разница в том, как они трактуют свет и ракурс, сразу покажет, стоит ли платить за более продвинутый инструмент. Больше разборов подобных сервисов - в разделе нейросети.

Вопросы читателей по теме

Все вопросы

Чем отличается нейросеть от искусственного интеллекта?

спрашивает Дмитрий, Уфа 78 просм.

Дмитрий Волков: Путаница объяснима, потому что термины действительно пересекаются, но по объёму понятий это не одно и то же. Искусственный интеллект - самое широкое понятие, оно означает вообще любую систему, которая имитирует интеллектуальное поведение: принимает решения, распознаёт образы, ведёт диалог. Под это определение подпадают и простые программы на жёстких правилах без единой нейросети внутри, и современные большие…

Как нейросеть создает изображение?

спрашивает Дмитрий, Оренбург 145 просм.

Дмитрий Волков: Большинство современных генераторов изображений - это диффузионные модели, и работают они на первый взгляд контринтуитивно: не рисуют картинку с нуля, а наоборот, учатся убирать шум. При обучении модели показывают реальное изображение, постепенно добавляют к нему случайный шум до тех пор, пока от исходной картинки не останется одна серая рябь, и просят модель на каждом шаге…

Какая нейросеть делает фото по описанию?

спрашивает Екатерина, Ульяновск 145 просм.

Сергей Орлов: Генераторов изображений по тексту сейчас несколько, и выбор зависит от того, что важнее - реалистичность, доступность без VPN или цена. Midjourney и DALL-E через ChatGPT Plus дают самую реалистичную картинку и хорошо понимают сложные описания, но обе платные и не всегда без ограничений доступны из России. Из отечественных сервисов Шедеврум от Яндекса и Kandinsky от…

Как нейросети помогают в повседневных задачах?

спрашивает Игорь, Уфа 237 просм.

Дмитрий Волков: Смотря что вы называете нейросетью. Строго говоря, это математическая модель, которая лежит в основе почти всех современных сервисов ИИ: от переводчиков и голосовых помощников до систем, которые советуют вам следующий фильм. В офисной работе от неё есть польза в трёх конкретных вещах, а не в абстрактных обещаниях. Во-первых, черновая обработка текста: свести длинное письмо в…