Генерация изображений нейросетью: как получить нужную картинку, а не абстракцию
Разница между размытой абстракцией и нужной картинкой обычно не в выборе сервиса, а в том, как составлен запрос. Пошаговая инструкция и разбор частых ошибок.
Нейросеть для генерации изображений почти никогда не выдает с первого раза то, что вы себе представляли: вместо конкретного рыжего кота в очках на подоконнике - размытый силуэт животного и подоконник непонятной формы. Дело не в том, что технология сырая, а в том, что запрос был слишком общим, чтобы модель угадала детали.
Изображения нейросеть строит по тексту буквально: чего нет в описании, того не будет и в результате, додумывать за вас она не станет. Разница между абстрактной картинкой и нужной обычно решается не выбором самого продвинутого сервиса, а тем, как составлен запрос и что вы делаете с первым результатом. Дальше - пошаговая инструкция, которая работает и в Midjourney, и в Kandinsky, и в DALL-E внутри ChatGPT.
1. Определите, для чего нужна картинка
Требования разные в зависимости от задачи. Иллюстрация для статьи или соцсетей допускает вольности с пропорциями и мелкими деталями. Макет упаковки, логотип или картинка с читаемой надписью - тут нейросети справляются хуже, и на выходе почти всегда нужна ручная доработка в графическом редакторе. А если задача - обработать уже существующее фото: заменить фон, убрать лишнего человека, восстановить старый снимок, это не генерация с нуля, а редактирование. Логичнее сразу открыть подборку нейросети для фото: обработка, замена фона и восстановление старых снимков - там инструменты именно под эту задачу.
2. Выберите сервис под задачу, а не первый попавшийся
Универсального лидера нет, у каждого сервиса свой характер.
- Kandinsky от Сбера - бесплатный, работает без VPN, неплохо понимает запросы на русском языке без перевода.
- Shedevrum от Яндекса - тоже бесплатный и доступен из России, удобнее всего как мобильное приложение.
- Midjourney - подписка без бесплатного тарифа, качество картинки в среднем выше, но интерфейс через Discord или веб непривычен для новичка и требует освоения синтаксиса команд.
- DALL-E внутри ChatGPT - хорошо следует за текстом запроса и чаще конкурентов рисует читаемые короткие надписи, бесплатный доступ ограничен несколькими генерациями в сутки.
- Stable Diffusion - можно запустить локально или через один из веб-интерфейсов, даёт больше всего контроля над процессом ценой более долгого разбора настроек.
Доступ к зарубежным сервисам вроде Midjourney и ChatGPT из России на момент публикации периодически требует VPN или оплаты через посредников - ситуация меняется, поэтому перед подпиской стоит проверить актуальный статус, а не полагаться на прошлый опыт. Если не хочется регистрироваться ради одной картинки, часть сервисов такую возможность дают: список собран в материале нейросети без регистрации: что можно сделать прямо в браузере. Актуальные обзоры инструментов регулярно выходят в рубрике нейросети.
3. Пишите не одно слово, а сцену
Запрос из одного существительного - главная причина абстрактных картинок. Нейросети для изображений работают лучше по формуле: кто или что в кадре, что делает, где происходит действие, какой ракурс и освещение.
Сравните два запроса. Первый: кот. Модель сама придумает породу, позу, фон и стиль - результат почти гарантированно окажется не тем, что вы хотели. Второй: рыжий кот в очках сидит на подоконнике и смотрит в окно, дневной свет, вид сбоку. Здесь у модели нет пространства для домыслов, и результат предсказуем.
Добавляйте детали постепенно, а не пытайтесь впихнуть всё важное в первое предложение. Порядок слов почти не влияет на результат - куда важнее не пропустить сам факт, который должен попасть в кадр.
4. Явно задайте стиль
Без слова о стиле нейросеть выбирает его сама, и не всегда так, как вы ожидали. Стоит прямо называть один из вариантов: фотореализм, плоская векторная иллюстрация, акварель, 3d-рендер, карандашный скетч, аниме. Смешивать в одном запросе противоречивые стили - фотореализм и одновременно мультяшность - плохая идея: модель либо проигнорирует часть указаний, либо выдаст что-то среднее и невнятное.
Если стиль важен для серии картинок (например, для оформления канала), полезно один раз найти удачную формулировку и потом использовать её без изменений в каждом новом запросе - так картинки будут выглядеть частью одной серии, а не набором случайных изображений.
5. Укажите, чего быть не должно
В Midjourney и Stable Diffusion есть отдельное поле для негативного запроса (в Midjourney это параметр --no): туда выносят то, что нейросеть упорно добавляет, хотя вы этого не просили - лишние руки, текст на заднем плане, водяные знаки. В сервисах без такого поля тот же эффект достигается описанием от противного: не просто "портрет", а "портрет без очков и без головного убора".
Этот шаг особенно выручает, когда один и тот же артефакт повторяется от генерации к генерации: если нейросеть раз за разом рисует лишний палец или посторонний предмет на фоне, явный запрет в промпте убирает проблему быстрее, чем десять попыток переформулировать всё заново.
6. Используйте референс, если сервис это умеет
Многие нейросети для изображений принимают на вход не только текст, но и картинку - это называют режимом image-to-image. Загруженное фото или чужая иллюстрация задают композицию, цветовую гамму или позу, а текстовый запрос корректирует детали. Это удобнее, чем пытаться описать словами сложную композицию, которую проще показать.
Важно не путать этот режим с редактированием готового фото: здесь референс только подсказывает нейросети направление, а итоговая картинка генерируется заново и может сильно отличаться от исходника.
7. Не соглашайтесь на первый вариант
Большинство сервисов при одном запросе выдают сразу два-четыре варианта. Сравнивайте их между собой и выбирайте не самый красивый с первого взгляда, а тот, что ближе к задуманному по композиции - остальное обычно проще поправить дополнительным запросом или доработкой, чем перерисовывать композицию с нуля.
Если ни один из вариантов не подошёл, не обязательно переписывать весь запрос заново. Часто достаточно перегенерировать с тем же текстом: даже без изменений в промпте нейросеть каждый раз выдаёт новый результат.
8. Дорабатывайте результат вместо генерации с нуля
Когда общая композиция устраивает, а хромает деталь - неправильная кисть руки, лишний предмет на фоне, смазанный участок, - большинство сервисов позволяют переделать не всю картинку, а конкретную область: функция называется по-разному (inpainting, локальное редактирование, вариации региона), но суть одна - вы обводите проблемное место и описываете, что там должно быть вместо этого.
Отдельно стоит апскейл - увеличение разрешения готовой картинки. Изображение, сгенерированное нейросетью, часто выходит небольшим по размеру и нуждается в увеличении перед печатью или публикацией в высоком качестве - апскейл встроен в большинство современных сервисов и работает в один клик.
Типичные ошибки при генерации изображений
- Запрос из одного-двух слов без описания сцены, ракурса и стиля.
- Смешение противоречивых стилей в одном запросе - фотореализм и мультяшность одновременно почти всегда дают невнятный результат.
- Расчёт на то, что нейросеть "поймёт" контекст, которого нет в тексте запроса - если деталь важна, её нужно назвать словами.
- Согласие на первый же вариант без сравнения с остальными предложенными.
- Просьба нарисовать длинный читаемый текст на картинке - с короткими надписями современные нейросети справляются, с абзацами текста почти никогда.
- Игнорирование лимитов бесплатного тарифа: генерация обрывается на середине задачи, когда лимит уже исчерпан.
Что делать, если результат не получился
- Меняйте не весь запрос сразу, а один параметр за раз - стиль, ракурс или освещение, - чтобы понять, что именно сбивает генерацию.
- Уберите лишние детали: слишком длинный и перегруженный запрос путает модель не меньше, чем слишком короткий.
- Попробуйте другой сервис. Модели по-разному воспринимают одни и те же слова, и тот же запрос в другой нейросети иногда попадает в цель с первого раза.
- Используйте функцию локального редактирования или вариаций вместо повторной генерации с нуля.
- Если лимит бесплатного тарифа исчерпан или сервис недоступен, посмотрите, какие ещё бесплатные нейросети: что реально работает без оплаты и VPN дают доступ к генерации изображений.
Если нужна одна картинка без лишних требований к деталям - хватит Kandinsky или Shedevrum и пары минут на формулировку запроса. Если результат должен точно попасть в задуманный кадр, закладывайте не одну попытку, а несколько итераций: сначала короткий текстовый запрос, потом правка по одному параметру за раз, потом доработка детали или апскейл. На практике до нужной картинки обычно доходят за три-четыре захода - и это быстрее, чем пытаться с первого раза написать идеальный промпт.


