Нейросети

Картинка по описанию: как текстовый запрос превращается в изображение

Нейросеть по описанию превращает текстовый запрос в готовую картинку за секунды, но результат сильно зависит от того, как вы его сформулируете. Пошаговая инструкция и разбор частых ошибок новичков.

Иллюстрация к статье: Картинка по описанию: как текстовый запрос превращается в изображение

Нейросеть по описанию - это когда вы печатаете текстовый запрос вроде "рыжий кот в очках читает книгу, акварель" и получаете готовую картинку за считанные секунды. Технология называется text-to-image, генерация по тексту, и за последние пару лет она заметно поумнела: понимает не только перечень предметов, но и стиль, свет, композицию кадра.

Пригодится это тем, кому нужна одна конкретная картинка, а не поход по фотостокам: обложка для поста, аватар, иллюстрация к статье, подарочный коллаж другу. Ниже - пошаговая инструкция, как выбрать сервис, правильно описать желаемое и не наткнуться на типичные грабли новичков.

Шаг 1. Выберите сервис для генерации

Все нейросети для картинок по описанию работают по одному принципу: вы вводите текст, сервис возвращает несколько вариантов изображения. Разница между ними в доступности, языке запросов и характере результата.

Если хочется попробовать без оплаты и VPN, для начала загляните в подборку бесплатные нейросети: что реально работает без оплаты и VPN - там разобрано, какие сервисы на момент публикации доступны из России напрямую. Из русскоязычных вариантов заметны Kandinsky от Сбера и Шедеврум от Яндекса: оба понимают запросы на русском без перевода и не требуют VPN. Из зарубежных - Midjourney (работает через Discord, платная подписка) и DALL-E внутри ChatGPT (нужна учётная запись OpenAI и обычно VPN). У каждого сервиса свой почерк: одни лучше рисуют фотореалистичные сцены, другие - иллюстрации и мультяшный стиль.

Шаг 2. Опишите, что должно быть на картинке

Хороший запрос - это не одно слово, а несколько конкретных деталей. Перечислите по порядку:

  • главный объект и его признаки (не просто "девушка", а "девушка в красном пальто с зонтом")
  • что происходит и в какой позе или ракурсе
  • место и фон
  • стиль: фотография, иллюстрация, акварель, 3D-рендер, пиксель-арт
  • освещение и настроение: закат, студийный свет, мрачно, солнечно

Абстрактные слова вроде "красиво" или "стильно" нейросеть трактует по-своему, и часто не так, как вы себе представляли. Чем конкретнее описание, тем предсказуемее результат на выходе.

Шаг 3. Уточните формат и детали под задачу

Пропорции картинки задаются отдельно: квадрат для соцсетей, вертикаль для сторис, альбомная ориентация для обложки статьи. Если сервис поддерживает выбор палитры, укажите цвета, которые важны, например синий и оранжевый бренда. Полезно добавить отсылку к стилю известного жанра: "в духе плаката шестидесятых" или "как иллюстрация из детской книги" - модели неплохо считывают такие сравнения и подстраивают под них композицию.

Шаг 4. Сгенерируйте несколько вариантов

За один запрос сервис обычно отдаёт от двух до четырёх картинок, и они всегда разные, даже если текст не менялся ни на букву - так устроена генерация, в основе которой случайное зерно. Не старайтесь поймать идеальный результат с первой попытки: пересоздайте вариант ещё раз, слегка поменяйте формулировку одной детали и сравните. Обычно нужная картинка находится за три-пять попыток, и это нормальный рабочий процесс, а не признак того, что вы делаете что-то не так.

Шаг 5. Доработайте результат

Если общая композиция понравилась, а подвела деталь - руки, текст на вывеске, лишний палец - большинство сервисов дают перерисовать только выделенную область, не трогая остальное. Это называется inpainting, в интерфейсе ищите кисть или пункт "изменить часть". Для увеличения разрешения обычно есть отдельная функция upscale: без неё картинка часто выходит слишком мелкой для печати или большого баннера.

Отдельный случай - когда нужен не абстрактный персонаж, а конкретный человек в сгенерированной сцене, например ваше собственное лицо на фэнтезийном портрете. Одного текстового запроса для этого недостаточно, здесь работает другая функция: как её применяют, разобрано в статье замена лица на фото и видео нейросетью: как это делается.

Шаг 6. Сохраните и используйте по назначению

Скачивайте картинку в максимальном разрешении, которое даёт сервис - обычно кнопка download стоит прямо рядом с превью. Для коммерческого использования, например в рекламе или на обложке платного продукта, загляните в условия конкретного сервиса: у бесплатных тарифов часто есть отметка о некоммерческом использовании или требование указывать, что изображение сделано нейросетью. Если картинка идёт в печать, разрешение стоит проверить заранее - веб-версия на пятьсот пикселей для баннера в человеческий рост не подойдёт.

Где ещё пригодится генерация по текстовому запросу

Принцип "опишите словами, что хотите получить" работает не только с картинками. Похожим образом устроены нейросети, которые сочиняют стихи и рифмованные тексты под тему и настроение - если любопытно, как это выглядит на практике, есть отдельный разбор: нейросети для стихов и рифмы. Обзоры конкретных сервисов, инструкции и сравнения нейросетей для разных задач собраны в рубрике нейросети.

Типичные ошибки и что делать, если не получилось

  • Слишком общий запрос. "Красивый пейзаж" сервис поймёт по-своему. Распишите объект, план, свет и стиль отдельными фразами - результат сразу станет предсказуемее.
  • Просите то, чего модель физически не умеет. Текст на вывесках и надписи большинство сервисов до сих пор коверкают, а точное портретное сходство с конкретным живым человеком по одному описанию не получится - для этого нужны отдельные функции с загрузкой фото, а не просто слова.
  • Запрос на русском в сервисе, заточенном под английский. Если результат выходит странным или не по теме, попробуйте перевести описание вручную или через переводчик - для части моделей это до сих пор ощутимая разница в качестве.
  • Одна и та же генерация раз за разом не устраивает. Не пытайтесь получить идеал с первого запроса. Меняйте по одной детали за раз и смотрите, что именно повлияло на результат - так проще понять логику конкретного сервиса.
  • Уткнулись в лимит бесплатных генераций. У большинства сервисов бесплатный тариф ограничен несколькими картинками в сутки. Возвращайтесь на следующий день или пробуйте другой сервис из подборки бесплатных вариантов.
  • Персонаж выходит с лишними пальцами или искажённым лицом. Это известная слабость генеративных моделей, которая с новыми версиями встречается реже, но не исчезла совсем. Перерисуйте проблемную область через inpainting или сгенерируйте картинку заново с более общим планом, где лицо не в фокусе.

Если результат нужен здесь и сейчас для одного поста, не усложняйте: возьмите бесплатный сервис без VPN, опишите объект одним конкретным предложением и сразу закладывайте на генерацию три-четыре попытки - это дешевле и быстрее, чем перебирать фотостоки в поисках подходящего кадра.

Вопросы читателей по теме

Все вопросы

Чем отличается нейросеть от искусственного интеллекта?

спрашивает Дмитрий, Уфа 54 просм.

Дмитрий Волков: Путаница объяснима, потому что термины действительно пересекаются, но по объёму понятий это не одно и то же. Искусственный интеллект - самое широкое понятие, оно означает вообще любую систему, которая имитирует интеллектуальное поведение: принимает решения, распознаёт образы, ведёт диалог. Под это определение подпадают и простые программы на жёстких правилах без единой нейросети внутри, и современные большие…

Как нейросеть создает изображение?

спрашивает Дмитрий, Оренбург 113 просм.

Дмитрий Волков: Большинство современных генераторов изображений - это диффузионные модели, и работают они на первый взгляд контринтуитивно: не рисуют картинку с нуля, а наоборот, учатся убирать шум. При обучении модели показывают реальное изображение, постепенно добавляют к нему случайный шум до тех пор, пока от исходной картинки не останется одна серая рябь, и просят модель на каждом шаге…

Какая нейросеть делает фото по описанию?

спрашивает Екатерина, Ульяновск 133 просм.

Сергей Орлов: Генераторов изображений по тексту сейчас несколько, и выбор зависит от того, что важнее - реалистичность, доступность без VPN или цена. Midjourney и DALL-E через ChatGPT Plus дают самую реалистичную картинку и хорошо понимают сложные описания, но обе платные и не всегда без ограничений доступны из России. Из отечественных сервисов Шедеврум от Яндекса и Kandinsky от…

Как нейросети помогают в повседневных задачах?

спрашивает Игорь, Уфа 223 просм.

Дмитрий Волков: Смотря что вы называете нейросетью. Строго говоря, это математическая модель, которая лежит в основе почти всех современных сервисов ИИ: от переводчиков и голосовых помощников до систем, которые советуют вам следующий фильм. В офисной работе от неё есть польза в трёх конкретных вещах, а не в абстрактных обещаниях. Во-первых, черновая обработка текста: свести длинное письмо в…