Что такое LLM в нейросетях?
Андрей, Кемерово 599 просм.
Часто вижу термин LLM рядом со словом "нейросеть", но не понимаю, это одно и то же или LLM - какой-то отдельный вид среди других нейросетей. В чём разница?
Дмитрий Волков инженер по машинному обучению
ответил
LLM, large language model, это не отдельная технология, а один из видов нейросетей — тот, что специализируется на языке. Нейросеть в целом — широкий термин: сюда входят и модели для распознавания изображений, и системы для прогноза погоды, и рекомендательные алгоритмы. LLM — это подкласс, обученный конкретно на огромных объёмах текста: книгах, статьях, коде, диалогах.
Архитектурно почти все современные LLM построены на трансформере — механизме, который умеет оценивать связь между словами независимо от расстояния между ними в предложении. Именно поэтому такая модель «помнит» контекст в начале длинного текста и учитывает его в конце ответа. Размер модели измеряют в параметрах — численных коэффициентах, которые настраиваются при обучении: у современных крупных моделей их десятки и сотни миллиардов.
Отличие от других нейросетей практическое, а не просто по названию:
- модель для распознавания изображений на входе получает пиксели, а на выходе метку класса;
- LLM на входе и выходе работает с текстом, представленным в виде токенов — кусочков слов;
- одна и та же архитектура трансформера при этом используется и там, и там, разница в данных для обучения и в задаче.
Если коротко: любая LLM — нейросеть, но не любая нейросеть — LLM. Термин полезен именно потому, что уточняет специализацию модели, когда речь заходит о работе с текстом, а не о нейросетях вообще.
Задать свой вопрос
Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.
Вопрос отправлен на модерацию. После проверки он появится на сайте вместе с ответом эксперта.