Представьте нового сотрудника, которому нельзя ничего рассказывать про компанию, зато можно перед каждым вопросом класть на стол нужную страницу регламента. Отвечает он только по этой странице. Ровно это и есть RAG — и переучивать модель для него не надо. Работает он буквально так: система находит в вашей базе несколько подходящих кусков текста, подкладывает их в запрос к модели и просит ответить только по ним. Три буквы расшифровываются как «генерация с опорой на найденное», и главное слово здесь — найденное.

Из этого следует всё остальное. Модель не «выучила» ваши регламенты и не «знает» компанию — она каждый раз получает пять-шесть абзацев и пересказывает их своими словами. Если поиск принёс не тот абзац, ответ будет уверенным, гладким и неправильным. Поэтому качество RAG — это на 80 % качество поиска и на 20 % качество модели, а деньги в смете уходят туда же.

Дальше — модельные расчёты по состоянию на сентябрь 2026 года при ставке инженера 3 000 ₽/час. Механику по шагам, с разбором каждого узла, мы подробно разбирали в большом материале про RAG; здесь — короткий словарный разбор: из чего состоит, во что превращается в смете и какой вопрос задать подрядчику.

Что делает RAG: четыре шага и ни одного волшебного

Что это значитRAG (retrieval-augmented generation)

Связка «поиск по вашим документам + языковая модель». Бизнесу даёт ответы со ссылкой на источник и обновляемость: поправили регламент — система отвечает по новой версии без переобучения. В смете превращается в 50–70 часов работы: подготовка базы, нарезка, хранилище, поиск и замер качества. Проверочный вопрос: покажите ответ вместе с фрагментами, на которых он построен.

  1. 1
    Документы режут на фрагменты

    База из 380 документов превращается примерно в 4 100 фрагментов по несколько абзацев. Резать надо по смыслу — по пунктам регламента, а не по числу символов, иначе условие и его исключение окажутся в разных кусках и в ответ попадёт только половина правила.

  2. 2
    Каждый фрагмент переводят в числовой отпечаток

    Это и есть эмбеддинг: близкие по смыслу тексты получают близкие отпечатки, поэтому вопрос «можно ли вернуть товар через месяц» находит пункт про четырнадцатидневный срок, где ни одного из этих слов нет. Как это устроено и почему тот же механизм промахивается мимо номера договора — в разборе про эмбеддинги и векторный поиск.

  3. 3
    На вопрос подбирают несколько фрагментов

    Обычно пять: больше — дороже и не всегда точнее. Здесь же живёт вся настройка качества: сколько фрагментов брать, добавлять ли обычный поиск по словам к поиску по смыслу, что делать, когда подходящего не нашлось вовсе.

  4. 4
    Модель отвечает только по найденному

    В запрос уходит инструкция «отвечай по приложенным фрагментам, при нехватке данных так и скажи», сами фрагменты и вопрос. На выходе — ответ и ссылки на источники. Без ссылок на источники систему принимать нельзя: проверить её иначе невозможно.

схема процессаchto-takoe-rag-prostymi-slovami--01
Схема RAG: 380 документов, 4100 фрагментов, отбор пяти фрагментов и ответ модели со ссылками

Горизонтальная схема из пяти блоков со стрелками слева направо. Первый блок — «База: 380 документов». Второй — «Нарезка: около 4 100 фрагментов». Третий — «Числовые отпечатки фрагментов». Четвёртый — «Поиск по вопросу: 5 фрагментов» с ответвлением вниз в маленький блок «подходящего нет — честный отказ». Пятый — «Модель: ответ + ссылки на источники». Над стрелкой между четвёртым и пятым блоками подпись «в модель уходят только эти 5 фрагментов». Тонкие чертёжные линии, подписи по-русски.

Модель видит не всю базу, а пять фрагментов — весь вопрос в том, те ли это пять

Почему RAG дешевле дообучения и когда его не заменяет

Второй способ научить модель вашей специфике — дообучение: собрать несколько тысяч пар «вопрос — правильный ответ» и переучить модель на них. Это другой продукт и другой бюджет. Главная разница даже не в цене запуска, а в том, что происходит, когда регламент поменялся.

ПризнакRAG (поиск по базе)Дообучение модели
Цена запуска150 000–200 000 ₽от 500 000 ₽
Срок3–8 недель6–10 недель
Что нужно от заказчикаДокументы в порядке и владелец базыРазмеченный набор из тысяч пар «вопрос — ответ»
Обновление после правки регламентаЗамена файла в базе, 0 ₽Повторный цикл обучения, снова недели и деньги
Можно показать источник ответаДа, ссылка на фрагмент документаНет, ответ растворён в весах модели
Что решает лучшеФактические вопросы по документамСтиль, формат, узкая терминология отрасли

Практический вывод простой: дообучение учит модель говорить, RAG учит её знать. Если жалоба звучит как «отвечает не по нашим правилам» — это RAG. Если «отвечает правильно, но не нашим языком и не в нашем формате» — тогда и только тогда имеет смысл обсуждать дообучение, и почти всегда поверх уже работающего поиска, а не вместо него.

Что в смете: 64 часа и 192 000 ₽

Рыночная вилка базового агента с поиском по базе знаний — 150 000–200 000 ₽ и 3–8 недель. Вот из чего эта сумма складывается в модельном проекте на 380 документов при ставке 3 000 ₽/час. Обратите внимание на пропорцию: на модель и «интеллект» не уходит почти ничего, всё уходит на подготовку и на проверку.

Модельная смета RAG на 380 документов, ставка 3 000 ₽/час
Разбор исходных документов, отсев устаревших версий16 ч — 48 000 ₽
Нарезка на фрагменты и правила разбиения по типам документов10 ч — 30 000 ₽
Векторное хранилище, загрузка базы, обновление по расписанию8 ч — 24 000 ₽
Поиск: смысловой плюс словарный, отбор и ранжирование фрагментов12 ч — 36 000 ₽
Тестовый набор: 80 вопросов с эталонными ответами10 ч — 30 000 ₽
Замер качества и подгонка настроек по результатам замера8 ч — 24 000 ₽
Итого64 часа — 192 000 ₽

Чего в этой сумме нет и что чаще всего дописывают отдельной строкой уже после подписания: подключение к каналу, где сотрудник или клиент задаёт вопрос, и разграничение прав. Второе особенно важно — если в базе лежат и публичные инструкции, и внутренние документы по зарплатам, поиск обязан учитывать, кто спрашивает, иначе система вежливо перескажет закрытый документ первому попросившему. Разграничение по ролям — это ещё 10–16 часов, то есть 30 000–48 000 ₽, и обсуждать его надо до сметы, а не после первого инцидента.

Ежемесячные расходы у RAG тоже есть, и они невелики: плата за обращения к модели и за хранилище. На потоке из примера это единицы тысяч рублей — основная часть счёта складывается не из хранения базы, а из длины запросов, и разбирается в материале про расход токенов.

Считаем отдачу на модельном потоке. Сервисная компания, 1 200 внутренних вопросов в месяц «где посмотреть условие», сотрудник тратит на поиск в регламентах в среднем 6 минут. Это 120 часов в месяц; при полной стоимости часа 700 ₽ — 84 000 ₽. Система закрывает 60 % таких вопросов, остальное уходит человеку: экономия 50 400 ₽ в месяц, вложение 192 000 ₽ окупается примерно за четыре месяца. Арифметика повторяется на калькуляторе: 1 200 × 6 ÷ 60 = 120 часов, 120 × 700 = 84 000 ₽, 84 000 × 0,6 = 50 400 ₽, 192 000 ÷ 50 400 ≈ 3,8.

Где RAG ломается: четыре случая, которые видно сразу

Разочарование в RAG почти всегда наступает по одной из четырёх причин, и все четыре видны ещё до старта — если посмотреть на документы, а не на презентацию подрядчика. Проверка занимает полчаса: откройте папку с базой, возьмите десять случайных файлов и посмотрите, сколько из них сканы, сколько существует в нескольких редакциях и сколько состоит в основном из таблиц. Эта десятка предскажет результат замера точнее, чем любое обещание в коммерческом предложении.

Что в базеЧто происходитЧто с этим делают
Сканы и фотографии без текстового слояПоиск не видит их вовсе: для системы это картинка, а не текстРаспознавание перед загрузкой, +20 000–60 000 ₽ на объём в несколько тысяч страниц
Три версии одного регламента в разных папкахСистема честно находит все три и отвечает по случайной, чаще по устаревшейОтсев версий и правило «в базе живёт только действующая редакция»
Тарифные сетки и прайсы таблицамиСтрока отрывается от шапки, и цена приезжает не из той колонкиТаблицы выносят в отдельный источник и отвечают по ним запросом к данным, а не поиском по тексту
Договоры с приложениями и допсоглашениямиНайден основной текст, а действующее условие лежит в приложенииСвязывание документа с приложениями при загрузке и обязательная выдача всех связанных фрагментов
Отдельный случай: вопрос, ответа на который в базе нет

Это не поломка поиска, а решение, которое кто-то должен принять до запуска. Правильное поведение — сказать «в базе нет данных, передаю оператору», а не собрать правдоподобный ответ из соседних фрагментов. Второе выглядит лучше на демонстрации и дороже обходится в эксплуатации — почему так получается, разобрано в материале о том, почему ИИ-агент врёт клиентам.

сравнениеchto-takoe-rag-prostymi-slovami--02
Четыре типа проблемных документов в базе знаний и что с каждым делают перед загрузкой

Таблица-схема из четырёх горизонтальных полос. Слева в каждой — пиктограмма документа: скан со смазанным текстом, три одинаковых листа с пометками «ред. 1», «ред. 2», «ред. 3», лист с таблицей из строк и колонок, лист со скрепкой и вторым листом «Приложение № 2». В центре каждой полосы — короткая подпись «поиск не видит», «отвечает по устаревшей», «строка без шапки», «условие в приложении». Справа — что делают: «распознать», «оставить действующую», «вынести в данные», «связать документы». Тонкие чертёжные линии, подписи по-русски.

Все четыре случая видно до старта — достаточно посмотреть на сами документы

Работа на вашей стороне, которую нельзя купить

Подрядчик может собрать хранилище, настроить поиск и написать инструкцию. Он не может решить за вас, какая редакция регламента действующая и кто отвечает за её обновление. Это 30–40 часов работы вашего сотрудника, и они дают больше прироста качества, чем смена модели.

В модельном замере на 80 контрольных вопросах первый прогон дал 58 верных ответов из 80. После того как из базы убрали устаревшие редакции и слили дубли — 69 из 80 на той же модели и тех же настройках поиска. Плюс одиннадцать ответов из ничего, кроме наведённого порядка. Про то, как готовить данные до внедрения, у нас есть отдельный разбор, а про то, кто должен вести базу дальше, — материал про владельца базы знаний.

графикchto-takoe-rag-prostymi-slovami--03
Доля верных ответов на 80 контрольных вопросах: 58 до чистки базы и 69 после

Диаграмма из двух вертикальных столбцов на общей шкале от 0 до 80. Левый столбец подписан «База как есть» и доходит до отметки 58, правый — «После отсева устаревших редакций и дублей» и доходит до 69. Над столбцами подписи «58 из 80» и «69 из 80». Между вершинами столбцов фигурная скобка с подписью «+11 ответов без смены модели». Внизу сноска «модельный замер на 80 контрольных вопросах, сентябрь 2026». Тонкие чертёжные линии, подписи по-русски.

Модель и настройки те же — изменилось только содержимое базы
  1. 1Как измеряется доля правильных ответов и на какой выборке? Ответ «мы протестировали, всё работает» не годится: нужен набор из 50–100 вопросов с эталонными ответами, составленный вашими людьми, и число в протоколе. Методика замера разобрана в отдельной статье.
  2. 2Что система делает с вопросом, ответа на который в базе нет? Правильный ответ — честный отказ с передачей человеку, и это поведение должно проверяться на приёмке отдельным сценарием.
  3. 3Показывает ли ответ источники? Если фрагменты, на которых построен ответ, нельзя открыть одним кликом, проверить систему невозможно, и споры с подрядчиком превращаются в обмен впечатлениями.
  4. 4Кто и как обновляет базу после запуска? Нужны сроки обновления, ответственный с вашей стороны и способ убедиться, что вчерашняя правка регламента доехала до системы.

Когда RAG не нужен

RAG — не универсальный ответ на слово «документы». Есть три ситуации, когда 192 000 ₽ уйдут впустую, и все три распознаются за полчаса.

  • Вопросов меньше 200 в месяц. При шести минутах на поиск это 20 часов и 14 000 ₽ ручной работы в месяц — окупаемость уезжает за год, и дешевле навести порядок в документах, а поиск оставить обычный.
  • Ответ считается, а не находится. Остаток на складе, цена по тарифной сетке, срок доставки — это запрос к системе учёта, а не поиск по тексту. Здесь нужна интеграция, и её состав мы разбираем в словаре терминов автоматизации.
  • База не существует как база. Если знания живут в головах и переписке, RAG соберёт ответы из обрывков и будет уверенно врать. Сначала — регламенты в письменном виде, потом поиск по ним.

И обратный признак, такой же честный: если сотрудники по десять раз в день ищут одно и то же условие в регламенте, а служба поддержки пересказывает клиентам одни и те же пять пунктов, RAG окупится быстро и предсказуемо. Порог, за которым разговор становится содержательным, — примерно от 800 однотипных вопросов в месяц при письменной базе, которую есть кому вести.

RAG покупают за модель, а платят за порядок в документах. Одиннадцать правильных ответов из восьмидесяти дала не смена модели, а удалённая старая редакция регламента.