RAG (retrieval-augmented generation) – подход, при котором модель отвечает не по памяти, а по документам, найденным под конкретный вопрос. Перед тем как сформулировать ответ, система ищет в базе подходящие фрагменты – инструкции, договоры, статьи, переписку – и кладёт их в запрос вместе с вопросом. Модель работает как грамотный сотрудник с открытым справочником перед глазами.
Устроено это почти всегда одинаково: документы режут на куски по несколько абзацев, для каждого считают эмбеддинг и складывают в поисковый индекс. Вопрос переводят в такой же вектор, достают ближайшие по смыслу куски и передают модели. Хорошие реализации добавляют обычный текстовый поиск – по артикулам и точным названиям он работает лучше смыслового.
Что это даёт: ответы по собственным данным без дообучения модели, ссылка на документ-источник рядом с ответом и обновление знаний простой заменой файла. Это самый дешёвый способ сделать помощника, который знает вашу компанию.
Границы: качество ответа упирается в качество поиска. Если нужный фрагмент не нашёлся, модель ответит по общим знаниям и снова может выдумать. Устаревшие и противоречивые документы в базе дают уверенно неверные ответы, поэтому RAG снижает риск галлюцинаций, но не отменяет проверку там, где цена ошибки высока.