Нейросети

Генерация изображений нейросетью: как получить нужную картинку, а не абстракцию

Разница между размытой абстракцией и нужной картинкой обычно не в выборе сервиса, а в том, как составлен запрос. Пошаговая инструкция и разбор частых ошибок.

Иллюстрация к статье: Генерация изображений нейросетью: как получить нужную картинку, а не абстракцию

Нейросеть для генерации изображений почти никогда не выдает с первого раза то, что вы себе представляли: вместо конкретного рыжего кота в очках на подоконнике - размытый силуэт животного и подоконник непонятной формы. Дело не в том, что технология сырая, а в том, что запрос был слишком общим, чтобы модель угадала детали.

Изображения нейросеть строит по тексту буквально: чего нет в описании, того не будет и в результате, додумывать за вас она не станет. Разница между абстрактной картинкой и нужной обычно решается не выбором самого продвинутого сервиса, а тем, как составлен запрос и что вы делаете с первым результатом. Дальше - пошаговая инструкция, которая работает и в Midjourney, и в Kandinsky, и в DALL-E внутри ChatGPT.

1. Определите, для чего нужна картинка

Требования разные в зависимости от задачи. Иллюстрация для статьи или соцсетей допускает вольности с пропорциями и мелкими деталями. Макет упаковки, логотип или картинка с читаемой надписью - тут нейросети справляются хуже, и на выходе почти всегда нужна ручная доработка в графическом редакторе. А если задача - обработать уже существующее фото: заменить фон, убрать лишнего человека, восстановить старый снимок, это не генерация с нуля, а редактирование. Логичнее сразу открыть подборку нейросети для фото: обработка, замена фона и восстановление старых снимков - там инструменты именно под эту задачу.

2. Выберите сервис под задачу, а не первый попавшийся

Универсального лидера нет, у каждого сервиса свой характер.

  • Kandinsky от Сбера - бесплатный, работает без VPN, неплохо понимает запросы на русском языке без перевода.
  • Shedevrum от Яндекса - тоже бесплатный и доступен из России, удобнее всего как мобильное приложение.
  • Midjourney - подписка без бесплатного тарифа, качество картинки в среднем выше, но интерфейс через Discord или веб непривычен для новичка и требует освоения синтаксиса команд.
  • DALL-E внутри ChatGPT - хорошо следует за текстом запроса и чаще конкурентов рисует читаемые короткие надписи, бесплатный доступ ограничен несколькими генерациями в сутки.
  • Stable Diffusion - можно запустить локально или через один из веб-интерфейсов, даёт больше всего контроля над процессом ценой более долгого разбора настроек.

Доступ к зарубежным сервисам вроде Midjourney и ChatGPT из России на момент публикации периодически требует VPN или оплаты через посредников - ситуация меняется, поэтому перед подпиской стоит проверить актуальный статус, а не полагаться на прошлый опыт. Если не хочется регистрироваться ради одной картинки, часть сервисов такую возможность дают: список собран в материале нейросети без регистрации: что можно сделать прямо в браузере. Актуальные обзоры инструментов регулярно выходят в рубрике нейросети.

3. Пишите не одно слово, а сцену

Запрос из одного существительного - главная причина абстрактных картинок. Нейросети для изображений работают лучше по формуле: кто или что в кадре, что делает, где происходит действие, какой ракурс и освещение.

Сравните два запроса. Первый: кот. Модель сама придумает породу, позу, фон и стиль - результат почти гарантированно окажется не тем, что вы хотели. Второй: рыжий кот в очках сидит на подоконнике и смотрит в окно, дневной свет, вид сбоку. Здесь у модели нет пространства для домыслов, и результат предсказуем.

Добавляйте детали постепенно, а не пытайтесь впихнуть всё важное в первое предложение. Порядок слов почти не влияет на результат - куда важнее не пропустить сам факт, который должен попасть в кадр.

4. Явно задайте стиль

Без слова о стиле нейросеть выбирает его сама, и не всегда так, как вы ожидали. Стоит прямо называть один из вариантов: фотореализм, плоская векторная иллюстрация, акварель, 3d-рендер, карандашный скетч, аниме. Смешивать в одном запросе противоречивые стили - фотореализм и одновременно мультяшность - плохая идея: модель либо проигнорирует часть указаний, либо выдаст что-то среднее и невнятное.

Если стиль важен для серии картинок (например, для оформления канала), полезно один раз найти удачную формулировку и потом использовать её без изменений в каждом новом запросе - так картинки будут выглядеть частью одной серии, а не набором случайных изображений.

5. Укажите, чего быть не должно

В Midjourney и Stable Diffusion есть отдельное поле для негативного запроса (в Midjourney это параметр --no): туда выносят то, что нейросеть упорно добавляет, хотя вы этого не просили - лишние руки, текст на заднем плане, водяные знаки. В сервисах без такого поля тот же эффект достигается описанием от противного: не просто "портрет", а "портрет без очков и без головного убора".

Этот шаг особенно выручает, когда один и тот же артефакт повторяется от генерации к генерации: если нейросеть раз за разом рисует лишний палец или посторонний предмет на фоне, явный запрет в промпте убирает проблему быстрее, чем десять попыток переформулировать всё заново.

6. Используйте референс, если сервис это умеет

Многие нейросети для изображений принимают на вход не только текст, но и картинку - это называют режимом image-to-image. Загруженное фото или чужая иллюстрация задают композицию, цветовую гамму или позу, а текстовый запрос корректирует детали. Это удобнее, чем пытаться описать словами сложную композицию, которую проще показать.

Важно не путать этот режим с редактированием готового фото: здесь референс только подсказывает нейросети направление, а итоговая картинка генерируется заново и может сильно отличаться от исходника.

7. Не соглашайтесь на первый вариант

Большинство сервисов при одном запросе выдают сразу два-четыре варианта. Сравнивайте их между собой и выбирайте не самый красивый с первого взгляда, а тот, что ближе к задуманному по композиции - остальное обычно проще поправить дополнительным запросом или доработкой, чем перерисовывать композицию с нуля.

Если ни один из вариантов не подошёл, не обязательно переписывать весь запрос заново. Часто достаточно перегенерировать с тем же текстом: даже без изменений в промпте нейросеть каждый раз выдаёт новый результат.

8. Дорабатывайте результат вместо генерации с нуля

Когда общая композиция устраивает, а хромает деталь - неправильная кисть руки, лишний предмет на фоне, смазанный участок, - большинство сервисов позволяют переделать не всю картинку, а конкретную область: функция называется по-разному (inpainting, локальное редактирование, вариации региона), но суть одна - вы обводите проблемное место и описываете, что там должно быть вместо этого.

Отдельно стоит апскейл - увеличение разрешения готовой картинки. Изображение, сгенерированное нейросетью, часто выходит небольшим по размеру и нуждается в увеличении перед печатью или публикацией в высоком качестве - апскейл встроен в большинство современных сервисов и работает в один клик.

Типичные ошибки при генерации изображений

  • Запрос из одного-двух слов без описания сцены, ракурса и стиля.
  • Смешение противоречивых стилей в одном запросе - фотореализм и мультяшность одновременно почти всегда дают невнятный результат.
  • Расчёт на то, что нейросеть "поймёт" контекст, которого нет в тексте запроса - если деталь важна, её нужно назвать словами.
  • Согласие на первый же вариант без сравнения с остальными предложенными.
  • Просьба нарисовать длинный читаемый текст на картинке - с короткими надписями современные нейросети справляются, с абзацами текста почти никогда.
  • Игнорирование лимитов бесплатного тарифа: генерация обрывается на середине задачи, когда лимит уже исчерпан.

Что делать, если результат не получился

  • Меняйте не весь запрос сразу, а один параметр за раз - стиль, ракурс или освещение, - чтобы понять, что именно сбивает генерацию.
  • Уберите лишние детали: слишком длинный и перегруженный запрос путает модель не меньше, чем слишком короткий.
  • Попробуйте другой сервис. Модели по-разному воспринимают одни и те же слова, и тот же запрос в другой нейросети иногда попадает в цель с первого раза.
  • Используйте функцию локального редактирования или вариаций вместо повторной генерации с нуля.
  • Если лимит бесплатного тарифа исчерпан или сервис недоступен, посмотрите, какие ещё бесплатные нейросети: что реально работает без оплаты и VPN дают доступ к генерации изображений.

Если нужна одна картинка без лишних требований к деталям - хватит Kandinsky или Shedevrum и пары минут на формулировку запроса. Если результат должен точно попасть в задуманный кадр, закладывайте не одну попытку, а несколько итераций: сначала короткий текстовый запрос, потом правка по одному параметру за раз, потом доработка детали или апскейл. На практике до нужной картинки обычно доходят за три-четыре захода - и это быстрее, чем пытаться с первого раза написать идеальный промпт.

Вопросы читателей по теме

Все вопросы

Чем отличается нейросеть от искусственного интеллекта?

спрашивает Дмитрий, Уфа 54 просм.

Дмитрий Волков: Путаница объяснима, потому что термины действительно пересекаются, но по объёму понятий это не одно и то же. Искусственный интеллект - самое широкое понятие, оно означает вообще любую систему, которая имитирует интеллектуальное поведение: принимает решения, распознаёт образы, ведёт диалог. Под это определение подпадают и простые программы на жёстких правилах без единой нейросети внутри, и современные большие…

Как нейросеть создает изображение?

спрашивает Дмитрий, Оренбург 113 просм.

Дмитрий Волков: Большинство современных генераторов изображений - это диффузионные модели, и работают они на первый взгляд контринтуитивно: не рисуют картинку с нуля, а наоборот, учатся убирать шум. При обучении модели показывают реальное изображение, постепенно добавляют к нему случайный шум до тех пор, пока от исходной картинки не останется одна серая рябь, и просят модель на каждом шаге…

Какая нейросеть делает фото по описанию?

спрашивает Екатерина, Ульяновск 133 просм.

Сергей Орлов: Генераторов изображений по тексту сейчас несколько, и выбор зависит от того, что важнее - реалистичность, доступность без VPN или цена. Midjourney и DALL-E через ChatGPT Plus дают самую реалистичную картинку и хорошо понимают сложные описания, но обе платные и не всегда без ограничений доступны из России. Из отечественных сервисов Шедеврум от Яндекса и Kandinsky от…

Как нейросети помогают в повседневных задачах?

спрашивает Игорь, Уфа 223 просм.

Дмитрий Волков: Смотря что вы называете нейросетью. Строго говоря, это математическая модель, которая лежит в основе почти всех современных сервисов ИИ: от переводчиков и голосовых помощников до систем, которые советуют вам следующий фильм. В офисной работе от неё есть польза в трёх конкретных вещах, а не в абстрактных обещаниях. Во-первых, черновая обработка текста: свести длинное письмо в…