Что такое LLM в нейросетях?
Андрей, Кемерово 607 просм.
Часто вижу термин LLM рядом со словом "нейросеть", но не понимаю, это одно и то же или LLM - какой-то отдельный вид среди других нейросетей. В чём разница?
Дмитрий Волков инженер по машинному обучению
ответил
LLM, large language model, это не отдельная технология, а один из видов нейросетей - тот, что специализируется на языке. Нейросеть в целом - широкий термин: сюда входят и модели для распознавания изображений, и системы для прогноза погоды, и рекомендательные алгоритмы. LLM - это подкласс, обученный конкретно на огромных объёмах текста: книгах, статьях, коде, диалогах.
Архитектурно почти все современные LLM построены на трансформере - механизме, который умеет оценивать связь между словами независимо от расстояния между ними в предложении. Именно поэтому такая модель "помнит" контекст в начале длинного текста и учитывает его в конце ответа. Размер модели измеряют в параметрах - численных коэффициентах, которые настраиваются при обучении: у современных крупных моделей их десятки и сотни миллиардов.
Отличие от других нейросетей практическое, а не просто по названию:
- модель для распознавания изображений на входе получает пиксели, а на выходе метку класса;
- LLM на входе и выходе работает с текстом, представленным в виде токенов - кусочков слов;
- одна и та же архитектура трансформера при этом используется и там, и там, разница в данных для обучения и в задаче.
Если коротко: любая LLM - нейросеть, но не любая нейросеть - LLM. Термин полезен именно потому, что уточняет специализацию модели, когда речь заходит о работе с текстом, а не о нейросетях вообще.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.