LLM

Что такое RAG для LLM?

Олег, Рязань 245 просм.

Разбираюсь, как подключить свою базу знаний к чат-боту на основе GPT, и постоянно натыкаюсь на аббревиатуру RAG. Это отдельная модель или какая-то надстройка над обычным чат-ботом? Как это вообще работает на практике?

Дмитрий Волков инженер по машинному обучению

ответил

эксперт

RAG расшифровывается как retrieval-augmented generation, генерация с дополнением через поиск. Это не отдельная модель, а архитектура, схема работы, которая соединяет обычную языковую модель с внешней базой знаний.

Работает это в два шага. Сначала система превращает ваш вопрос в числовой вектор и ищет по такому же способу проиндексированные фрагменты документов, наиболее близкие по смыслу, а не по точному совпадению слов. Затем найденные фрагменты подставляются в промпт вместе с вашим вопросом, и уже с этим контекстом языковая модель формулирует ответ.

Главная причина, почему RAG стал стандартом для корпоративных чат-ботов: языковую модель не нужно дообучать на ваших документах, это дорого и долго, а обновление базы знаний происходит мгновенно, просто через добавление или замену документа в хранилище. К тому же модель отвечает на основе конкретных найденных фрагментов, а не только по памяти из обучения, что заметно снижает число выдуманных фактов, галлюцинаций, особенно по внутренним данным компании, которых модель в принципе не видела при обучении.

На практике для сборки нужны три компонента: хранилище векторов, например Pinecone, Qdrant или Milvus, модель для превращения текста в вектор, эмбеддинг-модель, и сама LLM для генерации ответа. Из подводных камней: качество ответа сильно зависит от того, как документы разбиты на фрагменты, чанки, слишком крупные куски размывают релевантность поиска, слишком мелкие теряют контекст.

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме