Когда ассистент отвечает по чужому регламенту, модель почти никогда ни при чём: ей подали не тот фрагмент, и она добросовестно ответила по нему. Поиск отработал раньше модели, тихо и без сообщения об ошибке — он всегда что-то находит, потому что устроен как «выдай пять самых похожих», а не как «выдай правильный». Поэтому первый шаг разбора — не выбор другой модели и не переписывание инструкции, а проверка того, что именно поиск подал на вход.

Причин, по которым находится не тот документ, в рабочих системах шесть, и они очень разные по цене исправления. Три из них снимаются настройкой за один-три дня и не требуют трогать документы. Три остальные означают, что база собрана неудачно, и лечатся её переделкой — это две недели и совсем другие деньги. Смешивать их в одном разговоре с подрядчиком — верный способ заплатить за переделку там, где хватило бы фильтра.

Ниже — диагностика по журналу, разбор шести причин с признаками каждой, разделение исправлений на две ступени и расчёт обеих в рублях. Сквозной модельный пример тот же, что мы используем во всём разделе: производственно-торговая компания на 140 человек, внутренний ассистент по регламентам и условиям договоров, база из 380 документов, поток 6 000 обращений в месяц. Механику самого поиска мы разбирали в материале про эмбеддинги и векторный поиск, здесь она предполагается известной.

Сначала разделите вину поиска и вину модели

Это самая полезная процедура во всей статье, и она бесплатная. В журнале любой нормально собранной системы на каждое обращение пишутся два поля: какие фрагменты нашёл поиск и что модель из них собрала. Сопоставление этих двух полей разделяет ответственность однозначно, без экспертизы и без спора. Если такого журнала нет, требовать его надо до всех остальных доработок — он же понадобится при приёмке работ.

  1. 1
    Возьмите 20 жалоб подряд, а не отобранные

    Именно подряд, из последних поступивших. Отобранные примеры искажают картину в обе стороны: сотрудники запоминают самые обидные случаи, а подрядчик — самые объяснимые. Двадцати обращений хватает, чтобы увидеть повторяющийся тип ошибки; на разбор уходит около 15 минут.

  2. 2
    Для каждого посмотрите поле «найденные фрагменты»

    Вопрос ровно один: был ли среди найденного фрагмент с правильным ответом. Не «похожий», не «из того же документа», а именно тот абзац, который вы сами процитировали бы сотруднику. Ответ бинарный, и субъективности тут меньше, чем кажется.

  3. 3
    Разложите жалобы на две стопки

    Нужного фрагмента среди найденного не было — виноват поиск или сама база, и замена модели не изменит ничего. Фрагмент был, а ответ ему противоречит или добавляет лишнее — это вопрос к инструкции и к модели, и лечится он совсем другими средствами, вплоть до требования цитировать источник дословно.

  4. 4
    Посчитайте соотношение стопок

    На базах от 200 документов первая стопка обычно составляет 8 случаев из 10. Если у вас получилось наоборот и большинство ошибок во второй стопке — это редкая и хорошая новость: такие исправления дешевле. Но проверить надо, а не предположить.

схема процессаpochemu-poisk-po-baze-znaniy-oshibaetsya--01
Развилка диагностики: был ли нужный фрагмент в найденном — ветка поиска и ветка модели

Схема-развилка. Слева блок «Жалоба на ответ», стрелка ведёт к ромбу с вопросом «Был ли нужный фрагмент среди найденных?». Ветка «Нет» уходит вниз-влево к блоку «Виноват поиск или база» с подписью «около 8 случаев из 10» и тремя маленькими блоками под ним: «настройка», «метаданные», «нарезка». Ветка «Да» уходит вниз-вправо к блоку «Виноват промпт или модель» с подписью «около 2 случаев из 10» и двумя блоками: «инструкция», «требование цитаты». Внизу общая подпись: «20 жалоб подряд, 15 минут разбора». Чертёжный стиль, все подписи по-русски.

Два поля журнала разделяют вину поиска и вину модели без экспертизы и без спора

Дальше в статье речь только про первую стопку. Вторая — отдельная тема: там работают требование ссылки на пункт, запрет отвечать без найденного источника и правило отказа, которое мы разбирали в материале про ответ «не знаю» как целевое поведение.

Шесть причин, по которым находится не тот документ

Каждая причина имеет свой отпечаток в журнале, и по нему её опознают за минуту. В таблице ниже — признак, средство и срок. Обратите внимание на последний столбец: половина строк закрывается за день, и начинать надо именно с них.

ПричинаКак выглядит в журналеЧем лечитсяСрок
Размер фрагмента подобран неудачноВ найденном лежит весь раздел на восемь страниц или, наоборот, один заголовок без текстаПеренарезка базы с перекрытием и привязкой заголовков к тексту2 недели
У фрагментов нет метаданныхНа вопрос про склад в Казани в топ-5 поднимаются регламенты всех пяти филиаловПроставление полей подразделения, типа документа и даты, фильтр по ним до поиска1 день
Дубликаты и старые редакцииВ найденном две версии одного приказа, обе с пометкой «действует»Отсечение архива по статусу сразу, устранение противоречий — потом1 день и 2 недели
Поиск только векторный, без текстовогоВопросы своими словами находятся, вопросы с номером приказа или артикулом — нетДобавление обычного текстового поиска и слияние двух выдач1 день
Отраслевая лексика и внутренний сленгСотрудник пишет «косяк по сроку», в регламенте — «нарушение срока поставки»Словарь синонимов и сокращений компании, подставляемый к запросу2–3 дня
Вопрос сформулирован не как регламент«Когда платят за переработку» против «Компенсация сверхурочной работы»Переформулировка вопроса перед поиском и хранение типовых вопросов рядом с фрагментом3 дня

Чтобы разговор был предметным, нужен один замер. Методика простая: 100 реальных вопросов, для каждого вручную отмечено, в каком фрагменте лежит правильный ответ, и считается, сколько раз этот фрагмент попал в первую пятёрку выдачи. В нашем модельном примере рабочая система через три месяца эксплуатации показала 76 попаданий из 100 — при том, что на приёмке было 84, и уже тогда это было ниже рабочей нормы. Разбор 24 промахов по причинам дал распределение, которое повторяется от проекта к проекту.

графикpochemu-poisk-po-baze-znaniy-oshibaetsya--02
Разбор 24 промахов из 100: размер фрагмента 6, метаданные 5, дубликаты 5, только вектор 4

Горизонтальная столбчатая диаграмма из шести полос с числами: «Размер фрагмента» — 6, «Нет метаданных» — 5, «Дубликаты и старые редакции» — 5, «Только векторный поиск» — 4, «Отраслевая лексика» — 3, «Формулировка вопроса» — 1. Общий заголовок «24 промаха из 100 вопросов, база 380 документов». Полосы «Нет метаданных», «Только векторный поиск» и часть полосы «Дубликаты» отмечены заливкой и общей скобкой с подписью «12 промахов — чинится за три дня»; остальные отмечены скобкой «12 промахов — переделка базы или потолок». Ось X — число промахов от 0 до 8.

Три верхние причины дают 16 промахов из 24, и две из них снимаются настройкой за день
Почему было 84, а стало 76

Восемь пунктов из этих двадцати четырёх — свежая деградация, и она не поломка, а естественный ход вещей: за три месяца в базу добавили 40 документов без метаданных, дважды сменили прайс, не убрав старый, и завели второй регламент по возвратам, не отменив первый. Остальные шестнадцать были в системе с самого запуска — просто на приёмке никто не потребовал замер. Ни одно из этих действий не выглядит ошибкой в момент совершения. Именно поэтому у базы должен быть названный поимённо владелец и дата ревизии — как мы разбирали в материале про подготовку базы знаний.

Что чинится за три дня и 45 000 ₽

Три меры из шести не требуют трогать сами документы. Это важно организационно: их можно сделать силами подрядчика без вашего методиста, без остановки системы и без согласования с юристами. В модельном примере они возвращают 12 промахов из 24 — с 76 до 88 попаданий из 100.

  1. 1
    Фильтр по метаданным до поиска, а не после

    Вопрос сотрудника казанского склада ищется только по документам казанского склада и общекорпоративным — остальные четыре филиала в выдачу вообще не попадают. Технически это одна строка условия перед векторным поиском; работа состоит в том, чтобы проставить поля у существующих фрагментов. Возвращает 5 промахов.

  2. 2
    Добавление текстового поиска к векторному

    Векторный поиск ищет по смыслу и системно проигрывает на точных идентификаторах: номер приказа, артикул, дата, сумма. Обычный текстовый поиск запускается параллельно, выдачи объединяются в один список. Это стандартная схема на сентябрь 2026 года, её состав и настройки разобраны в материале про векторный поиск. Возвращает 4 промаха.

  3. 3
    Отсечение архивных редакций по статусу

    Не устранение противоречий в документах — это долго, — а всего лишь запрет поиску поднимать фрагменты с датой окончания действия в прошлом. Требует, чтобы у документов было поле статуса; если его нет, за день его заводят хотя бы для прайсов и приказов. Возвращает 3 промаха из 5, приходящихся на дубликаты.

По объёму это три дня работы инженера и около 45 000 ₽ по рыночным ставкам. Ни одна из трёх мер не требует ни другой модели, ни другого хранилища, ни переписывания регламентов. Если подрядчик в ответ на жалобы предлагает начать с замены модели или с дообучения — это повод задать вопрос, почему не сделаны эти три вещи. Разницу между дообучением и поиском по документам мы разбирали в отдельном материале про дообучение или RAG.

Что требует двух недель и 120 000 ₽

Оставшиеся 12 промахов упираются в то, как собрана база. Здесь уже нужен ваш человек: инженер не может решить, какой из двух регламентов по возвратам действует, и не может придумать, как в компании называют деталь. Это самая полезная часть работы и самая неудобная — она вскрывает организационный беспорядок, который до внедрения никто не замечал.

  • Перенарезка базы. Документы режутся заново — по смысловым разделам, с перекрытием и с заголовком, приклеенным к каждому фрагменту. Восьмистраничный раздел перестаёт быть одним куском, одинокий заголовок перестаёт быть фрагментом. Возвращает 3 промаха из 6.
  • Устранение противоречий. Два действующих регламента об одном и том же — организационная проблема, а не техническая: кто-то должен подписать отмену одного из них. Пока этого не сделано, поиск честно показывает оба, и любое техническое решение будет угадыванием. Возвращает 1 промах из 2 оставшихся.
  • Единая номенклатура и словарь. Одна и та же позиция называется в прайсе, в договоре и в чате тремя способами. Словарь синонимов и сокращений компании подставляется к запросу и к фрагментам; собирается он не программистом, а тем, кто эти слова употребляет. Возвращает 1 промах из 4.

Вместе это две недели, около 120 000 ₽ работы подрядчика и порядка 20 часов вашего предметного специалиста. Результат — 93 попадания из 100. Важно понимать, что оставшиеся 7 промахов не «недоделка»: это нормальный потолок для базы регламентов, и попытка выжать из неё 99 % обходится дороже, чем ручной разбор этих семи вопросов человеком.

сравнениеpochemu-poisk-po-baze-znaniy-oshibaetsya--03
Две ступени исправлений: три дня за 45 000 ₽ и две недели за 120 000 ₽

Сравнение в две колонки. Левая «Три дня, 45 000 ₽»: строки «Фильтр по метаданным — 5 промахов», «Текстовый поиск к векторному — 4», «Отсечение архивных редакций — 3», внизу итог «76 → 88 попаданий из 100», приписка «ваши часы не нужны». Правая «Две недели, 120 000 ₽»: строки «Перенарезка базы — 3 промаха», «Устранение противоречий — 1», «Единая номенклатура — 1», внизу итог «88 → 93 из 100», приписка «20 часов вашего специалиста». Между колонками вертикальная стрелка сверху вниз с подписью «порядок работ». Чертёжный стиль.

Порядок обратный интуиции: сначала дешёвая настройка, потом дорогая переделка
Не начинайте с переделки базы

Самая частая ошибка на этом этапе — согласиться на двухнедельную переделку сразу, потому что она звучит фундаментально. При этом первые три дня работы дают вдвое больший прирост и стоят втрое дешевле, а переделка после них идёт быстрее: часть противоречий видна уже по журналу настроенного поиска. Обратный порядок оплачивается заказчиком дважды.

Переранжирование: +2 попадания и +0,4 секунды

Что это значитПереранжирование

Дополнительный шаг между поиском и моделью. Поиск отдаёт не пять кандидатов, а двадцать, после чего отдельная небольшая модель-переранжировщик сравнивает каждого кандидата с вопросом и пересобирает порядок; модели-ответчику уходят лучшие пять из пересобранного списка. Это не замена поиску и не его настройка, а ещё один фильтр поверх него.

Шаг полезный, но его регулярно продают раньше времени. В модельном примере переранжирование добавило 2 попадания — с 93 до 95 из 100 — и обошлось в 35 000 ₽ разово. Плата за него не только денежная: к каждому ответу добавляется 0,3–0,5 секунды, потому что двадцать кандидатов надо прогнать через дополнительную модель. На внутреннем ассистенте это незаметно, в голосовом сценарии — заметно сразу.

Практическое правило: переранжирование ставится третьим, после настройки и после приведения базы в порядок. Поставленное первым, оно аккуратно переупорядочивает те же неудачные фрагменты и создаёт ощущение работы при почти нулевом эффекте. Если подрядчик предлагает его в качестве первого средства от жалоб — попросите сначала показать замер и распределение промахов по причинам.

Сколько стоит промах: считаем обе ступени

Перевести попадания в деньги просто. Вопрос, на который система не ответила или ответила по чужому документу, возвращается к живому человеку: в нашем примере это методист, около 7 минут с учётом поиска нужного пункта, ставка с налогами примерно 700 ₽/час — то есть 81,67 ₽ за вопрос. При потоке 6 000 обращений в месяц каждый процентный пункт попаданий стоит 60 вопросов и 4 900 ₽.

Две ступени исправлений на потоке 6 000 обращений в месяц
Было: 76 попаданий из 100, промахов 1 440 × 81,67 ₽117 605 ₽/мес
После трёх дней настройки: 88 из 100, промахов 720 × 81,67 ₽58 802 ₽/мес
Возврат от первой ступени, стоившей 45 000 ₽58 803 ₽/мес — окупаемость 23 дня
После двух недель переделки: 93 из 100, промахов 420 × 81,67 ₽34 301 ₽/мес
Возврат от второй ступени, стоившей 120 000 ₽24 501 ₽/мес — окупаемость 4,9 месяца
Итого165 000 ₽ работ возвращают 83 304 ₽ в месяц и окупаются за 2 месяца
графикpochemu-poisk-po-baze-znaniy-oshibaetsya--04
Лестница попаданий: 76, затем 88 после настройки, затем 93 после переделки базы

Ступенчатая диаграмма из трёх столбцов с подписями сверху: «Было — 76 из 100», «Три дня настройки — 88 из 100», «Две недели переделки — 93 из 100». Под каждым столбцом вторая строка с деньгами: «117 605 ₽/мес на ручной разбор», «58 802 ₽/мес», «34 301 ₽/мес». Между столбцами две стрелки с подписями «45 000 ₽, окупаемость 23 дня» и «120 000 ₽, окупаемость 4,9 месяца». Горизонтальная штриховая полоса на уровне 85–95 подписана «рабочая норма». Ось Y — попаданий из 100, от 60 до 100.

Первая ступень стоит втрое дешевле второй и даёт вдвое больший прирост

Две оговорки, без которых расчёт нечестен. Первая: экономия здесь не в сокращении методистов, а в возвращённом времени — если повторяющихся вопросов в компании мало и методист загружен другим, деньги останутся на бумаге. Вторая: 81,67 ₽ за вопрос — ставка внутреннего сотрудника. Если промах видит клиент, а не сотрудник, цена ошибки считается совсем иначе и обычно оказывается больше; общий подход к таким расчётам разобран в материале про измерение эффекта автоматизации.

Норма 85–95 % и как измерить её самому

Цифру попаданий нельзя брать со слов подрядчика — её надо получать самим, тем же способом и на тех же вопросах каждый раз. Замер стоит вашей стороне около четырёх часов работы одного человека в квартал и полностью снимает разговоры в жанре «нам кажется, стало хуже».

  1. 1Соберите 100 реальных вопросов из переписки и чата, не придумывая их. Обязательно включите 15–20 вопросов, ответа на которые в базе точно нет: они проверяют не поиск, а способность системы отказываться.
  2. 2Для каждого вопроса запишите, в каком документе и пункте лежит правильный ответ. Это самая долгая часть, зато делается один раз: дальше набор используется годами.
  3. 3Прогоните набор и посчитайте, в скольких случаях нужный фрагмент попал в первую пятёрку. Это и есть ваша метрика; целевое значение для базы регламентов — 85–95 %.
  4. 4Значение ниже 80 % означает, что обсуждать модель, инструкцию и переранжирование рано: сначала настройка и база. Значение выше 95 % на реальных вопросах обычно означает, что вопросы подобраны слишком удобные.
  5. 5Повторяйте замер раз в квартал и после каждого крупного пополнения базы. Падение на 5–7 пунктов — сигнал, что в базу что-то добавили без метаданных или не убрали старую редакцию.

Одно уточнение про сам показатель. Он измеряет поиск и только поиск: система может находить нужный фрагмент в 95 случаях из 100 и при этом отвечать плохо — если инструкция позволяет ей додумывать. Поэтому вместе с попаданиями всегда смотрят долю ответов со ссылкой на конкретный пункт: она должна быть равна 100 %, иначе сотрудник не сможет проверить ответ, а спор с клиентом не разберётся. Требования к качеству, которые имеет смысл записать в договор, мы собрали в материале про приёмку работ по автоматизации.

Когда чинить поиск не надо

Не всякая жалоба на ответ означает проблему поиска, и не всякая проблема поиска стоит денег. Ниже — четыре ситуации, в которых мы отговариваем от доработки.

  • База меньше 30 документов и помещается в один запрос. Если все регламенты вместе — это 15–20 страниц, поиск вообще не нужен: документы подставляются в запрос целиком, и промахов по определению нет. Порог и его арифметику мы разбирали в материале про способы подключить модель к данным компании.
  • Ответа нет ни в одном документе. Самый частый ложный диагноз: сотрудники спрашивают то, что в компании нигде не записано, и жалуются на «тупой поиск». Здесь чинится не система, а регламент — и это дешевле любой доработки.
  • Промахи приходятся на 3–5 редких тем. Если журнал показывает, что все жалобы про одно — например, про командировочные, — быстрее и дешевле добавить один хорошо написанный документ по этой теме, чем перенастраивать поиск для всей базы.
  • Система работает меньше месяца. До первого квартала эксплуатации замер нестабилен: вопросы ещё не устоялись, сотрудники подбирают формулировки. Доработка по данным первых двух недель обычно оптимизирует систему под вопросы, которых через месяц уже не будет.

И общее правило, которое экономит больше всего денег: любая доработка поиска начинается с замера и заканчивается замером на том же наборе вопросов. Без цифры до и цифры после разговор о качестве превращается в обмен впечатлениями, а счёт при этом приходит вполне конкретный.