Представьте нового сотрудника, которому нельзя ничего рассказывать про компанию, зато можно перед каждым вопросом класть на стол нужную страницу регламента. Отвечает он только по этой странице. Ровно это и есть RAG — и переучивать модель для него не надо. Работает он буквально так: система находит в вашей базе несколько подходящих кусков текста, подкладывает их в запрос к модели и просит ответить только по ним. Три буквы расшифровываются как «генерация с опорой на найденное», и главное слово здесь — найденное.
Из этого следует всё остальное. Модель не «выучила» ваши регламенты и не «знает» компанию — она каждый раз получает пять-шесть абзацев и пересказывает их своими словами. Если поиск принёс не тот абзац, ответ будет уверенным, гладким и неправильным. Поэтому качество RAG — это на 80 % качество поиска и на 20 % качество модели, а деньги в смете уходят туда же.
Дальше — модельные расчёты по состоянию на сентябрь 2026 года при ставке инженера 3 000 ₽/час. Механику по шагам, с разбором каждого узла, мы подробно разбирали в большом материале про RAG; здесь — короткий словарный разбор: из чего состоит, во что превращается в смете и какой вопрос задать подрядчику.
Что делает RAG: четыре шага и ни одного волшебного
Связка «поиск по вашим документам + языковая модель». Бизнесу даёт ответы со ссылкой на источник и обновляемость: поправили регламент — система отвечает по новой версии без переобучения. В смете превращается в 50–70 часов работы: подготовка базы, нарезка, хранилище, поиск и замер качества. Проверочный вопрос: покажите ответ вместе с фрагментами, на которых он построен.
- 1Документы режут на фрагменты
База из 380 документов превращается примерно в 4 100 фрагментов по несколько абзацев. Резать надо по смыслу — по пунктам регламента, а не по числу символов, иначе условие и его исключение окажутся в разных кусках и в ответ попадёт только половина правила.
- 2Каждый фрагмент переводят в числовой отпечаток
Это и есть эмбеддинг: близкие по смыслу тексты получают близкие отпечатки, поэтому вопрос «можно ли вернуть товар через месяц» находит пункт про четырнадцатидневный срок, где ни одного из этих слов нет. Как это устроено и почему тот же механизм промахивается мимо номера договора — в разборе про эмбеддинги и векторный поиск.
- 3На вопрос подбирают несколько фрагментов
Обычно пять: больше — дороже и не всегда точнее. Здесь же живёт вся настройка качества: сколько фрагментов брать, добавлять ли обычный поиск по словам к поиску по смыслу, что делать, когда подходящего не нашлось вовсе.
- 4Модель отвечает только по найденному
В запрос уходит инструкция «отвечай по приложенным фрагментам, при нехватке данных так и скажи», сами фрагменты и вопрос. На выходе — ответ и ссылки на источники. Без ссылок на источники систему принимать нельзя: проверить её иначе невозможно.
Горизонтальная схема из пяти блоков со стрелками слева направо. Первый блок — «База: 380 документов». Второй — «Нарезка: около 4 100 фрагментов». Третий — «Числовые отпечатки фрагментов». Четвёртый — «Поиск по вопросу: 5 фрагментов» с ответвлением вниз в маленький блок «подходящего нет — честный отказ». Пятый — «Модель: ответ + ссылки на источники». Над стрелкой между четвёртым и пятым блоками подпись «в модель уходят только эти 5 фрагментов». Тонкие чертёжные линии, подписи по-русски.
Почему RAG дешевле дообучения и когда его не заменяет
Второй способ научить модель вашей специфике — дообучение: собрать несколько тысяч пар «вопрос — правильный ответ» и переучить модель на них. Это другой продукт и другой бюджет. Главная разница даже не в цене запуска, а в том, что происходит, когда регламент поменялся.
| Признак | RAG (поиск по базе) | Дообучение модели |
|---|---|---|
| Цена запуска | 150 000–200 000 ₽ | от 500 000 ₽ |
| Срок | 3–8 недель | 6–10 недель |
| Что нужно от заказчика | Документы в порядке и владелец базы | Размеченный набор из тысяч пар «вопрос — ответ» |
| Обновление после правки регламента | Замена файла в базе, 0 ₽ | Повторный цикл обучения, снова недели и деньги |
| Можно показать источник ответа | Да, ссылка на фрагмент документа | Нет, ответ растворён в весах модели |
| Что решает лучше | Фактические вопросы по документам | Стиль, формат, узкая терминология отрасли |
Практический вывод простой: дообучение учит модель говорить, RAG учит её знать. Если жалоба звучит как «отвечает не по нашим правилам» — это RAG. Если «отвечает правильно, но не нашим языком и не в нашем формате» — тогда и только тогда имеет смысл обсуждать дообучение, и почти всегда поверх уже работающего поиска, а не вместо него.
Что в смете: 64 часа и 192 000 ₽
Рыночная вилка базового агента с поиском по базе знаний — 150 000–200 000 ₽ и 3–8 недель. Вот из чего эта сумма складывается в модельном проекте на 380 документов при ставке 3 000 ₽/час. Обратите внимание на пропорцию: на модель и «интеллект» не уходит почти ничего, всё уходит на подготовку и на проверку.
Чего в этой сумме нет и что чаще всего дописывают отдельной строкой уже после подписания: подключение к каналу, где сотрудник или клиент задаёт вопрос, и разграничение прав. Второе особенно важно — если в базе лежат и публичные инструкции, и внутренние документы по зарплатам, поиск обязан учитывать, кто спрашивает, иначе система вежливо перескажет закрытый документ первому попросившему. Разграничение по ролям — это ещё 10–16 часов, то есть 30 000–48 000 ₽, и обсуждать его надо до сметы, а не после первого инцидента.
Ежемесячные расходы у RAG тоже есть, и они невелики: плата за обращения к модели и за хранилище. На потоке из примера это единицы тысяч рублей — основная часть счёта складывается не из хранения базы, а из длины запросов, и разбирается в материале про расход токенов.
Считаем отдачу на модельном потоке. Сервисная компания, 1 200 внутренних вопросов в месяц «где посмотреть условие», сотрудник тратит на поиск в регламентах в среднем 6 минут. Это 120 часов в месяц; при полной стоимости часа 700 ₽ — 84 000 ₽. Система закрывает 60 % таких вопросов, остальное уходит человеку: экономия 50 400 ₽ в месяц, вложение 192 000 ₽ окупается примерно за четыре месяца. Арифметика повторяется на калькуляторе: 1 200 × 6 ÷ 60 = 120 часов, 120 × 700 = 84 000 ₽, 84 000 × 0,6 = 50 400 ₽, 192 000 ÷ 50 400 ≈ 3,8.
Где RAG ломается: четыре случая, которые видно сразу
Разочарование в RAG почти всегда наступает по одной из четырёх причин, и все четыре видны ещё до старта — если посмотреть на документы, а не на презентацию подрядчика. Проверка занимает полчаса: откройте папку с базой, возьмите десять случайных файлов и посмотрите, сколько из них сканы, сколько существует в нескольких редакциях и сколько состоит в основном из таблиц. Эта десятка предскажет результат замера точнее, чем любое обещание в коммерческом предложении.
| Что в базе | Что происходит | Что с этим делают |
|---|---|---|
| Сканы и фотографии без текстового слоя | Поиск не видит их вовсе: для системы это картинка, а не текст | Распознавание перед загрузкой, +20 000–60 000 ₽ на объём в несколько тысяч страниц |
| Три версии одного регламента в разных папках | Система честно находит все три и отвечает по случайной, чаще по устаревшей | Отсев версий и правило «в базе живёт только действующая редакция» |
| Тарифные сетки и прайсы таблицами | Строка отрывается от шапки, и цена приезжает не из той колонки | Таблицы выносят в отдельный источник и отвечают по ним запросом к данным, а не поиском по тексту |
| Договоры с приложениями и допсоглашениями | Найден основной текст, а действующее условие лежит в приложении | Связывание документа с приложениями при загрузке и обязательная выдача всех связанных фрагментов |
Это не поломка поиска, а решение, которое кто-то должен принять до запуска. Правильное поведение — сказать «в базе нет данных, передаю оператору», а не собрать правдоподобный ответ из соседних фрагментов. Второе выглядит лучше на демонстрации и дороже обходится в эксплуатации — почему так получается, разобрано в материале о том, почему ИИ-агент врёт клиентам.
Таблица-схема из четырёх горизонтальных полос. Слева в каждой — пиктограмма документа: скан со смазанным текстом, три одинаковых листа с пометками «ред. 1», «ред. 2», «ред. 3», лист с таблицей из строк и колонок, лист со скрепкой и вторым листом «Приложение № 2». В центре каждой полосы — короткая подпись «поиск не видит», «отвечает по устаревшей», «строка без шапки», «условие в приложении». Справа — что делают: «распознать», «оставить действующую», «вынести в данные», «связать документы». Тонкие чертёжные линии, подписи по-русски.
Работа на вашей стороне, которую нельзя купить
Подрядчик может собрать хранилище, настроить поиск и написать инструкцию. Он не может решить за вас, какая редакция регламента действующая и кто отвечает за её обновление. Это 30–40 часов работы вашего сотрудника, и они дают больше прироста качества, чем смена модели.
В модельном замере на 80 контрольных вопросах первый прогон дал 58 верных ответов из 80. После того как из базы убрали устаревшие редакции и слили дубли — 69 из 80 на той же модели и тех же настройках поиска. Плюс одиннадцать ответов из ничего, кроме наведённого порядка. Про то, как готовить данные до внедрения, у нас есть отдельный разбор, а про то, кто должен вести базу дальше, — материал про владельца базы знаний.
Диаграмма из двух вертикальных столбцов на общей шкале от 0 до 80. Левый столбец подписан «База как есть» и доходит до отметки 58, правый — «После отсева устаревших редакций и дублей» и доходит до 69. Над столбцами подписи «58 из 80» и «69 из 80». Между вершинами столбцов фигурная скобка с подписью «+11 ответов без смены модели». Внизу сноска «модельный замер на 80 контрольных вопросах, сентябрь 2026». Тонкие чертёжные линии, подписи по-русски.
- 1Как измеряется доля правильных ответов и на какой выборке? Ответ «мы протестировали, всё работает» не годится: нужен набор из 50–100 вопросов с эталонными ответами, составленный вашими людьми, и число в протоколе. Методика замера разобрана в отдельной статье.
- 2Что система делает с вопросом, ответа на который в базе нет? Правильный ответ — честный отказ с передачей человеку, и это поведение должно проверяться на приёмке отдельным сценарием.
- 3Показывает ли ответ источники? Если фрагменты, на которых построен ответ, нельзя открыть одним кликом, проверить систему невозможно, и споры с подрядчиком превращаются в обмен впечатлениями.
- 4Кто и как обновляет базу после запуска? Нужны сроки обновления, ответственный с вашей стороны и способ убедиться, что вчерашняя правка регламента доехала до системы.
Когда RAG не нужен
RAG — не универсальный ответ на слово «документы». Есть три ситуации, когда 192 000 ₽ уйдут впустую, и все три распознаются за полчаса.
- Вопросов меньше 200 в месяц. При шести минутах на поиск это 20 часов и 14 000 ₽ ручной работы в месяц — окупаемость уезжает за год, и дешевле навести порядок в документах, а поиск оставить обычный.
- Ответ считается, а не находится. Остаток на складе, цена по тарифной сетке, срок доставки — это запрос к системе учёта, а не поиск по тексту. Здесь нужна интеграция, и её состав мы разбираем в словаре терминов автоматизации.
- База не существует как база. Если знания живут в головах и переписке, RAG соберёт ответы из обрывков и будет уверенно врать. Сначала — регламенты в письменном виде, потом поиск по ним.
И обратный признак, такой же честный: если сотрудники по десять раз в день ищут одно и то же условие в регламенте, а служба поддержки пересказывает клиентам одни и те же пять пунктов, RAG окупится быстро и предсказуемо. Порог, за которым разговор становится содержательным, — примерно от 800 однотипных вопросов в месяц при письменной базе, которую есть кому вести.
RAG покупают за модель, а платят за порядок в документах. Одиннадцать правильных ответов из восьмидесяти дала не смена модели, а удалённая старая редакция регламента.
