Найти нужные куски и вставить в промпт — без переобучения модели
LLM знает только то, что было в обучении, плюс то, что ты положил в контекст. Как подключить свои документы без переобучения модели? Ответ — RAG: найти нужные куски и вставить в промпт перед ответом.
Эмбеддинг — вектор чисел, который представляет смысл текста. Похожие по смыслу фразы дают близкие векторы. «Как сбросить пароль?» и «Забыл логин» — рядом. «Кот сидел на ковре» — далеко. Близость измеряют косинусным сходством.
RAG снижает выдумки: модель опирается на твои документы, а не на догадку из обучения. Знания можно обновлять — переиндексировать файлы, не трогая веса модели. Но RAG не волшебство: если нужный chunk не нашли — модель снова может ошибиться.
Чаще всего ломается не генерация, а retrieval: ответа нет в подставленном контексте. Плохой chunking (разрезали мысль пополам) или неточный вопрос — типичные причины.
?Проверь себя
Варианты снизу — перетащи в слот или нажми. Нажми на ответ — вернуть вниз.
Твой ответ
Варианты
Целый 100-страничный файл в один промпт часто не влезает и «размывается». RAG кладёт в окно только 3–5 релевантных кусков — точнее и дешевле.