LLM

Что такое LLM в нейросетях?

Андрей, Кемерово 599 просм.

Часто вижу термин LLM рядом со словом "нейросеть", но не понимаю, это одно и то же или LLM - какой-то отдельный вид среди других нейросетей. В чём разница?

Дмитрий Волков инженер по машинному обучению

ответил

эксперт

LLM, large language model, это не отдельная технология, а один из видов нейросетей — тот, что специализируется на языке. Нейросеть в целом — широкий термин: сюда входят и модели для распознавания изображений, и системы для прогноза погоды, и рекомендательные алгоритмы. LLM — это подкласс, обученный конкретно на огромных объёмах текста: книгах, статьях, коде, диалогах.

Архитектурно почти все современные LLM построены на трансформере — механизме, который умеет оценивать связь между словами независимо от расстояния между ними в предложении. Именно поэтому такая модель «помнит» контекст в начале длинного текста и учитывает его в конце ответа. Размер модели измеряют в параметрах — численных коэффициентах, которые настраиваются при обучении: у современных крупных моделей их десятки и сотни миллиардов.

Отличие от других нейросетей практическое, а не просто по названию:

  • модель для распознавания изображений на входе получает пиксели, а на выходе метку класса;
  • LLM на входе и выходе работает с текстом, представленным в виде токенов — кусочков слов;
  • одна и та же архитектура трансформера при этом используется и там, и там, разница в данных для обучения и в задаче.

Если коротко: любая LLM — нейросеть, но не любая нейросеть — LLM. Термин полезен именно потому, что уточняет специализацию модели, когда речь заходит о работе с текстом, а не о нейросетях вообще.

Подробный разбор LLM Wiki в Obsidian: когда нейросеть не просто отвечает, а поддерживает базу знаний

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме