Что такое мультимодальная языковая модель?
Михаил, Москва 1,2 тыс. просм.
Читаю новости про новые модели вроде Qwen и Gemini, и там постоянно всплывает слово "мультимодальная". Пытаюсь понять: это значит, что модель заодно с текстом понимает картинки и звук, или просто модное название того, что чат-боты и так умели?
Дмитрий Волков инженер по машинному обучению
ответил
Мультимодальная модель — это нейросеть, обученная работать сразу с несколькими типами данных: текстом, изображениями, звуком, иногда видео. Ключевое слово тут «обучена сразу»: в отличие от связки из нескольких отдельных программ, где одна распознает картинку, а другая пишет по ее описанию текст, здесь одна сеть с общим внутренним представлением для всех типов входа.
Технически это устроено так: и текст, и изображение, и звук переводятся в один и тот же формат внутренних чисел, эмбеддинги, а дальше модель обрабатывает их в общем контексте. Поэтому такая модель может посмотреть на фото чека и посчитать сумму, объяснить график на скриншоте или разобрать голосовое сообщение и сразу ответить по его содержанию.
Из свежих примеров — GPT-4o, Gemini 2.5 и адаптации моделей вроде Qwen умеют принимать на вход изображение, аудио и текст одновременно и отвечать с учетом всех данных сразу, а не по очереди. На практике это удобно: не нужно отдельно распознавать текст с фото и вставлять его в чат, модель делает это сама одним запросом.
Ограничение то же, что у обычных языковых моделей: качество понимания зависит от того, чего было больше в обучающих данных. Текст такие модели понимают увереннее всего, а с редким почерком на фото, нестандартным акцентом в аудио или мелкими деталями на картинке до сих пор ошибаются. Поэтому важные цифры, даты и имена, которые модель «прочитала» с изображения или расшифровала из звука, стоит перепроверять глазами, а не принимать на веру.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.