ChatGPT и картинки: как работать с изображениями в чате
Разбираем на практике, что ChatGPT умеет с фотографиями: загрузить снимок и получить разбор, распознать текст на нём или сгенерировать картинку с нуля - и что делать, если генерация не задалась.
ChatGPT давно перестал быть просто чат-ботом с текстом: в диалог можно закинуть фото и получить разбор того, что на нём изображено, а можно попросить нарисовать картинку с нуля по текстовому описанию. Именно поэтому запрос "чат гпт фото" в поиске один из самых частых - людям нужен понятный порядок действий, а не пересказ общих возможностей нейросети.
В этой инструкции - как загрузить фото в чат, как получить от ChatGPT внятный ответ по картинке, как сгенерировать изображение и что делать, если генерация не удалась или сервис вдруг перестал открываться.
Шаг 1. Загрузите фото в чат
В браузерной версии рядом с полем ввода есть значок скрепки или плюса - через него можно выбрать фото с компьютера или перетащить файл прямо в окно чата. В мобильном приложении там же значок камеры: можно сфотографировать что-то на месте или взять готовый снимок из галереи. За один раз получится прикрепить и несколько фото, если нужно сравнить их между собой или собрать в одном ответе.
Сама по себе отправка фото без текста тоже сработает - модель опишет, что видит. Но качество ответа сильно вырастет, если сразу написать, что именно вас интересует.
Шаг 2. Сформулируйте вопрос к изображению
Разница между "что на фото" и конкретным вопросом огромная. Сравните: "переведи текст на этой вывеске", "объясни, что не так с этим графиком в презентации", "подбери три варианта подписи для соцсетей к этому кадру", "оцени, подойдёт ли такой наряд для собеседования". Чем конкретнее задача, тем меньше в ответе воды про освещение и композицию, которая никому не нужна.
Такой же принцип работает и в других сценариях с языковыми моделями - подборка практических разборов есть в разделе LLM.
Шаг 3. Попросите распознать текст, объекты или график
Одна из самых практичных функций - работа с текстом на фото. Сфотографируйте квитанцию, договор, рукописную заметку или скриншот с ошибкой - и попросите переписать текст словами, свести цифры в список или объяснить, что означает сообщение об ошибке. С печатным текстом модель справляется уверенно, с почерком - через раз, тут многое зависит от разборчивости и качества снимка.
Похожим образом можно решать бытовые задачи в поездках: сфотографировать меню в кафе на незнакомом языке и попросить перевод, или состав продукта на упаковке, если важно проверить его на аллергены. Работает и обратная задача - распознать блюдо, растение или породу собаки на фото. Здесь стоит относиться к ответу с долей скепсиса: в редких и региональных случаях модель может ошибиться и назвать что-то похожее, но не то.
То, что модель вообще способна "видеть" содержимое фото, а не угадывать по одному описанию, - следствие того, как её обучали на парах "картинка плюс текст". Если интересно, как устроен сам процесс обучения, есть отдельный разбор: Как обучают нейросети: от датасета до готовой модели.
Шаг 4. Сгенерируйте картинку по описанию
Генерация изображений живёт в том же окне чата, переключаться никуда не нужно: пишете "нарисуй..." и описываете, что хотите получить. Чем подробнее запрос, тем ближе результат к задумке. Не "нарисуй кота", а, например, "рыжий кот в мультяшном стиле сидит на подоконнике, за окном дождь, тёплый вечерний свет от лампы".
Если нужна серия картинок в одном стиле - скажем, набор иконок или аватаров, - явно попросите держать единую палитру и манеру рисунка от изображения к изображению, иначе стиль будет плавать от генерации к генерации.
На бесплатном тарифе число генераций в сутки ограничено - не хватит на большую партию картинок за один присест. Платная подписка ChatGPT Plus снимает часть ограничений, но условия и цены у OpenAI со временем меняются, поэтому перед оплатой стоит свериться с актуальными условиями прямо в приложении.
Учтите и содержательные ограничения: с реалистичными изображениями настоящих людей, особенно публичных фигур, модель работать откажется - это вопрос политики, а не техники.
Шаг 5. Отредактируйте изображение через диалог
Готовую картинку не обязательно перегенерировать с нуля из-за одной детали. Можно попросить точечную правку прямо следующим сообщением: "сделай фон синим", "убери подпись в углу", "добавь персонажу очки" - модель держит контекст предыдущей генерации и меняет только то, что попросили. Так же можно работать и с загруженным фото: попросить убрать лишний объект на заднем плане или изменить стиль снимка, хотя с реальными фотографиями результат предсказать сложнее, чем со сгенерированной картинкой.
Шаг 6. Сохраните результат
В браузере наведите курсор на картинку - появится значок скачивания, файл уйдёт в папку загрузок обычно в формате PNG. В приложении на телефоне достаточно долгого нажатия на изображение и пункта "сохранить в галерею". У части сгенерированных изображений в файле остаются метаданные о происхождении - это нормально и не мешает обычному использованию, но стоит иметь в виду, если картинка идёт в печать или в брендбук.
Типичные ошибки и что делать, если не получилось
- Файл не загружается. Проверьте формат - jpg и png проходят без проблем, а некоторые форматы с айфона лучше сначала пересохранить в jpg. Слишком большой файл сервис тоже может отклонить.
- Модель отказывается отвечать или рисовать. Обычно дело в модерации: реальные лица, публичные личности, откровенный контент. Переформулируйте запрос без этих деталей.
- Результат генерации не похож на задуманное. Промпт слишком общий - добавьте стиль, ракурс, освещение, цветовую гамму и запросите заново.
- Бесплатный лимит на генерации исчерпан. Можно подождать сброса лимита, оформить подписку либо закрыть разовую задачу через один из бесплатных сервисов, которые реально работают без оплаты и VPN.
- Сайт или приложение не открывается. Доступ к ChatGPT из России время от времени меняется, и способ, который работал вчера, сегодня может подвести. Рабочие варианты на текущий момент собраны в материале ChatGPT в России: что работает, что нет и чем заменить.
- Ответ по фото поверхностный. Переспросите конкретнее и разберите фото по частям, а если это текст - пришлите более чёткий снимок: размытый скан не разберёт даже нейросеть.
Если задача разовая - перевести вывеску, разобрать квитанцию, сгенерировать одну картинку для поста, - бесплатной версии и пары минут в браузере вполне хватит. Если картинки нужны регулярно, для рабочих задач или карточек товара, сразу закладывайте, что часть лимита уйдёт на неудачные попытки, пока не найдётся формулировка, которая устраивает, - и уже под это считайте, нужна ли платная подписка.


