Выборочный контроль диалогов — это регулярная процедура, в которой человек читает часть разговоров ИИ-агента с клиентами и оценивает их по короткому чек-листу. Нужна она по одной причине: ошибки агента не выглядят как ошибки. Ответ, собранный из воздуха, и ответ, процитированный из вашего регламента, написаны одинаково ровным тоном, поэтому обнаружить расхождение можно только сверкой с источником, а сверку кто-то должен делать по расписанию.

Этот контур регулярно выпадает из бюджета, и происходит это предсказуемо. На этапе внедрения обсуждают модель, базу знаний и интеграции; контроль выглядит как «руководитель будет иногда смотреть» и в смету не попадает. На третьем месяце выясняется, что смотреть надо 30–40 часов в месяц, а человека под это нет. Дальше система работает без надзора, и первым признаком проблемы становится жалоба клиента.

Ниже — рабочий регламент: четыре режима по календарю, правила отбора диалогов, чек-лист оценки из восьми пунктов, цикл исправления и расчёт часов при разных объёмах. Сквозной пример тот же, что и в остальных материалах раздела: клиентская поддержка, около 6 000 обращений в месяц, ставки — старший оператор 900 ₽/час, инженер 3 000 ₽/час, руководитель 2 500 ₽/час. Средняя оценка одного диалога по чек-листу — три минуты; это ключевой множитель всех расчётов, и на своих диалогах его стоит замерить.

Сплошной режим и где он заканчивается

Первые две недели после запуска смотреть надо максимально плотно: именно тогда всплывает всё, чего не было в тестах, — формулировки, которых не предусмотрели, вложения, которые не открываются, сценарии, где агент отвечает формально верно и не по делу. Проблема в том, что «сплошной режим» на большинстве потоков физически невыполним, и планировать его — значит планировать невыполнение.

Арифметика простая. 6 000 обращений в месяц по три минуты на диалог — это 300 часов, то есть почти два человека на полной ставке, занятых только чтением. Сплошной просмотр реалистичен примерно до 1 500 обращений в месяц: там получается 75 часов, половина ставки, и это уже требует отдельного решения. Выше этой границы «сплошной» означает не сто процентов потока, а сто процентов обязательных категорий плюс усиленная случайная выборка.

Формулировка «первые две недели смотрим всё» — обещание, а не план

Если она стоит в договоре при потоке выше 1 500 обращений в месяц, уточните, кто именно и в какие часы будет читать 200 диалогов в день. Обычно после этого вопроса режим переформулируется в честный: редкие корзины целиком, каждая вторая эскалация и 20 % случайных, что даёт 1 748 диалогов в пересчёте на месяц и около 44 часов за сами эти две недели. Это тоже много, но это выполнимо и стоит понятных денег.

ПериодСлучайная выборкаЭскалацииРедкие корзиныДиалогов в месяцЧасов в месяц
Недели 1–220 % — 1 200каждая вторая — 313все — 2351 74887 ч
Месяцы 1–210 % — 600каждая третья — 208все — 2351 04352 ч
С 3-го месяца, рабочий режим5 % — 300каждая пятая — 125все — 23566033 ч
С 7-го месяца при стабильных метриках3 % — 180каждая пятая — 125все — 23554027 ч

Часы в таблице приведены в пересчёте на полный месяц, чтобы режимы можно было сравнивать между собой: первые две недели дают половину верхней строки, около 44 часов. Что такое редкие корзины и почему эскалации приходится прореживать, разберём в следующем разделе — сначала важнее сама форма расписания.

К каждой доле в регламенте приписывается минимальный абсолютный порог — не меньше пяти случайных диалогов в день. Доля в процентах перестаёт работать на маленьких и на неравномерных потоках: три процента от спокойного вторника со 120 обращениями — это четыре диалога, и по четырём нельзя сказать ничего. Поэтому в регламенте всегда стоит пара «доля и минимум в день», а не только доля.

этапыvyborochnyy-kontrol-dialogov-ii--01
Лента режимов контроля: 87, 52, 33 и 27 часов в месяц на протяжении полугода

Горизонтальная лента времени на семь месяцев с четырьмя подписанными участками убывающей высоты: «Недели 1–2: 20 % случайных + каждая вторая эскалация + редкие корзины, 1 748 диалогов, 87 ч/мес», «Месяцы 1–2: 10 % + каждая третья эскалация, 1 043 диалога, 52 ч/мес», «С 3-го месяца: 5 % + каждая пятая эскалация, 660 диалогов, 33 ч/мес», «С 7-го месяца: 3 %, минимум 5 случайных в день, 540 диалогов, 27 ч/мес». Под каждым переходом между участками маленькая отметка «переход только при подтверждённых метриках».

Режим ослабляется только при подтверждённых метриках, а не по календарю

Правила отбора: случайная выборка плюс четыре корзины

Случайная выборка отвечает на вопрос «какой у системы средний уровень». Она не отвечает на вопрос «где она опасна», потому что опасные события редкие и в случайную выборку почти не попадают. Поэтому рабочий отбор состоит из пяти частей: случайные диалоги плюс четыре корзины, которые набираются по признакам автоматически.

Что отбираемПравилоДиалогов в месяцЧасов
Случайная выборка5 % потока, не меньше 10 в день30015 ч
Срабатывания ограничителейВсе диалоги, где сработал числовой лимит или стоп-тема251,3 ч
Диалоги с негативомВсе, где сработал признак негатива или клиент повысил тон1206 ч
Деньги без результатаВсе, где обсуждались суммы, скидки или возврат и диалог закончился ничем904,5 ч
ЭскалацииКаждая пятая из 625 передач оператору в месяц1256,3 ч
Итого66033 ч

Эскалации — единственная корзина, которую приходится прореживать. При норме 10–12 % передач человеку их набирается 625 в месяц, и смотреть все означало бы удвоить бюджет контроля. Каждая пятая даёт достаточную картину: эскалации однотипны, и повторяющиеся причины видны уже на сотне. Три остальные корзины — срабатывания ограничителей, негатив и деньги без результата, вместе 235 диалогов в месяц, — прореживать нельзя: события там редкие и каждое информативно. Именно их в таблице режимов мы называем редкими корзинами, и в любом режиме они берутся целиком.

Отдельно стоит сравнить эти 33 часа с тем, что обычно попадает в смету. В разборе трёх контуров защиты выборочный контроль оценён в 15 часов в месяц — это ровно первая строка таблицы, случайная выборка в 5 %. Четыре обязательные корзины добавляют ещё 18 часов, и именно они появляются на третьем месяце как неожиданность. Закладывать надо обе части сразу.

графикvyborochnyy-kontrol-dialogov-ii--02
Состав выборки: 300 случайных, 125 эскалаций, 120 с негативом, 90 про деньги, 25 ограничителей

Горизонтальная накопительная полоса из пяти сегментов с подписями и числами: «Случайные 5 % — 300», «Эскалации, каждая пятая — 125», «Негатив — 120», «Деньги без результата — 90», «Срабатывания ограничителей — 25». Общая длина подписана «660 диалогов, 33 часа в месяц». Под полосой отдельной скобкой выделен первый сегмент с подписью «то, что обычно закладывают в смету — 15 часов», и вторая скобка на остальные четыре — «то, что забывают — 18 часов».

Случайная выборка — меньше половины работы. Остальное отбирается по признакам

Чек-лист оценки диалога: восемь пунктов

Чек-лист нужен по той же причине, что и любой чек-лист: без него оценка сводится к впечатлению, а впечатление у разных людей и в разные дни разное. Восемь пунктов проверяются за три минуты, каждый отмечается как «да», «нет» или «не применимо». Диалог считается дефектным, если «нет» стоит хотя бы у одного из первых пяти пунктов; пункты шесть-восемь снижают качество, но не создают обязательств.

  1. 1Факт из базы. Каждое фактическое утверждение в ответе опирается на найденный фрагмент документа. Проверяется сверкой ответа с фрагментами из журнала, а не по памяти проверяющего.
  2. 2Ссылка на источник. К фактическому ответу приложена ссылка, она ведёт в конкретный документ с редакцией и пунктом, а не в раздел сайта. Ссылку надо открыть и найти в документе фразу, на которой построен ответ.
  3. 3Актуальность источника. Документ, на который сослался агент, не старше согласованного срока пересмотра. Это единственный пункт, который чаще всего указывает на процесс заказчика, а не на дефект системы.
  4. 4Отсутствие обещаний. В ответе нет сумм, процентов, сроков и слов-обязательств, не подтверждённых данными из системы. Формулировки вида «обычно занимает пару дней» считаются нарушением: клиент прочитает их как срок.
  5. 5Границы компетенции. Нет советов по здоровью, праву и налогам, нет обсуждения конкурентов, стоп-темы отработали. Если стоп-тема должна была сработать и не сработала, это дефект контура, а не диалога.
  6. 6Своевременность передачи. Диалог ушёл человеку на первом признаке, а не после трёх кругов уточнений. Проверяется по числу реплик до эскалации: больше четырёх — повод посмотреть, что мешало.
  7. 7Тон и формат. На «вы», без двойных извинений, первое предложение отвечает на вопрос, длина в согласованной норме, уточняющий вопрос не больше одного за реплику.
  8. 8Задача клиента решена. Клиент не вернулся с тем же вопросом в течение 48 часов. Единственный пункт, который проверяется не по самому диалогу, а по журналу за следующие двое суток.

Первые два пункта дают больше половины всех находок и проверяются механически, поэтому их имеет смысл частично автоматизировать: наличие ссылки в фактическом ответе система умеет отмечать сама, а проверку «есть ли фраза ответа в найденном фрагменте» можно свести к сравнению текстов. Это снимает с человека около четверти работы и не заменяет её полностью: сверка по смыслу остаётся ручной.

разбор экранаvyborochnyy-kontrol-dialogov-ii--03
Карточка оценки диалога: восемь пунктов чек-листа с отметками и полем причины дефекта

Нарисованный (не скриншот) макет карточки оценки. Сверху блок «Диалог № 4318, 12 реплик» и три поля: «Вопрос», «Найденные фрагменты (3)», «Ответ». Ниже список из восьми пронумерованных пунктов чек-листа с квадратами отметок «да / нет / н. п.»: факт из базы, ссылка на источник, актуальность источника, отсутствие обещаний, границы компетенции, своевременность передачи, тон и формат, задача решена. Первые пять пунктов объединены слева вертикальной скобкой с подписью «дефект». Внизу поле «Причина» с тремя вариантами выбора: выдумка, промах поиска, устаревший документ, и поле «В регресс-набор».

Первые пять пунктов делают диалог дефектным, последние три снижают качество

Кто смотрит и сколько это часов при разных объёмах

Смотреть должен человек, который знает предметную область и имеет право менять базу знаний: старший оператор, методист, руководитель группы. Инженер подрядчика для этой работы не подходит — он не отличит устаревший регламент от действующего. Владелец процесса тоже не подходит на роль ежедневного проверяющего: его время дороже, а работа монотонная; его место — в разборе причин и в решениях по отчёту.

Поток в месяцСлучайная выборкаЭскалацииРедкие корзиныВсегоЧасов в месяцКто смотрит
60020 % — 120все — 62все — 2320510 чРуководитель отдела в своё рабочее время
1 50010 % — 150все — 156все — 5936518 чСтарший оператор, 4–5 часов в неделю
6 0005 % — 300каждая пятая — 125все — 23566033 чВыделенный контролёр на неполный день
20 0002 % — 400каждая десятая — 208негатив прорежен вдвое — 5831 19160 чОтдельная роль плюс автоматический отбор

Обратите внимание на форму зависимости: поток вырос в 33 раза, часы контроля — в шесть. Это и делает контур подъёмным: доля случайной выборки падает по мере роста, эскалации прореживаются сильнее, а на больших объёмах подключается автоматический отбор по риску. Обратная сторона в том, что на маленьком потоке контроль стоит непропорционально дорого в пересчёте на одно обращение: 10 часов на 600 обращений — это втрое больше минут на обращение, чем 33 часа на 6 000.

Полная стоимость контура в месяц при потоке 6 000 обращений
Оценка 660 диалогов по чек-листу, 3 мин на диалог — 33 ч × 900 ₽/час29 700 ₽
Карточки дефектов и занесение вопросов в регресс-набор — 4 ч × 900 ₽/час3 600 ₽
Разбор причин с инженером и постановка задач — 2 ч × 3 000 ₽/час6 000 ₽
Месячный отчёт и решения по системе — 2 ч × 2 500 ₽/час5 000 ₽
Итого41 час и 44 300 ₽ в месяц — около 7,4 ₽ на одно обращение

Семь рублей сорок копеек на обращение сравнивать надо не с нулём, а с ценой незамеченной деградации. Один разобранный инцидент с придуманной скидкой мы считали отдельно — вышло 132 000 ₽ вместе с уступкой, простоем и срочной доработкой. Три месяца полного контроля стоят как один такой эпизод, и обнаруживает проблему контроль до того, как её обнаружит клиент. Из чего вообще складывается ежемесячная поддержка автоматизированной системы, разобрано в материале про то, сколько стоит поддержка и зачем она.

Цикл исправления: почему правки мало

Самая частая ошибка организации контроля — считать работу законченной в момент, когда дефект отправлен подрядчику. Дальше происходит понятное: правку делают, она чинит найденный случай, а через два месяца обновляется промпт или модель, и тот же дефект возвращается. Никто этого не замечает, потому что случайная выборка на него больше не попадёт. Разорвать цикл можно только одним способом — записать вопрос в набор, который прогоняется на каждом обновлении.

  1. 1
    Карточка дефекта

    Номер диалога, пункт чек-листа, по которому стоит «нет», дословная цитата проблемного места и ссылка на журнал с найденными фрагментами. Формулировки «бот ответил неправильно» недостаточно: через неделю никто не восстановит, что именно было не так.

  2. 2
    Причина из трёх

    Выдумка при пустом поиске, промах поиска или устаревший документ. Определяется по журналу за минуту, если в нём записаны найденные фрагменты; механика различения разобрана в статье про механику галлюцинаций. Причина определяет исполнителя: подрядчик, методист или владелец документа на вашей стороне.

  3. 3
    Вопрос в регресс-набор

    Исходный вопрос клиента с эталонным ответом добавляется в набор контрольных диалогов. Эталон — не дословный текст, а список обязательных и запрещённых элементов ответа: должен содержать ссылку на такой-то пункт, не должен содержать срок и процент.

  4. 4
    Правка и прогон

    Дефект считается закрытым не после ответа «поправили», а после прогона всего набора на обновлённой системе. Порядок выката правок, состав набора и правила отката разобраны в материале про версионирование и тесты промптов.

  5. 5
    Возврат в отчёт

    В месячном отчёте видно, сколько дефектов найдено, сколько закрыто прогоном и сколько висит. Строка «висит больше месяца» — самая важная в отчёте: она показывает, работает цикл или дефекты просто накапливаются в переписке.

схема процессаvyborochnyy-kontrol-dialogov-ii--04
Схема цикла: выборка, чек-лист, карточка дефекта, причина, регресс-набор, прогон, отчёт

Замкнутая круговая схема из шести блоков со стрелками по часовой стрелке: «Отбор 660 диалогов» → «Оценка по чек-листу из 8 пунктов» → «Карточка дефекта» → «Причина: выдумка / промах поиска / устаревший документ» → «Вопрос в регресс-набор с эталоном» → «Прогон набора на обновлении» → и стрелка обратно к отбору. Сбоку от блока причины три коротких ответвления с подписями исполнителей: «подрядчик», «методист», «владелец документа». В центре круга подпись «дефект закрыт только после прогона».

Цикл замыкается на прогоне набора — иначе исправленный дефект возвращается

Когда режим можно ослабить и когда вернуть

Ослабление — решение по метрикам, а не по календарю. Перейти с 5 % на 3 % случайной выборки можно, если три месяца подряд выполняются четыре условия одновременно.

  • Доля дефектных диалогов в выборке ниже 3 % — то есть меньше двадцати дефектов на 660 проверенных.
  • Ни одного дефекта по пунктам 4 и 5 чек-листа: ни обещаний, не подтверждённых системой, ни выхода за границы компетенции.
  • Доля фактических ответов без ссылки на источник — ноль. Это единственная метрика раздела, где допустим жёсткий ноль, и снимается она из журнала автоматически.
  • Доля повторных обращений по тому же вопросу в течение 48 часов не растёт и держится не выше 8 %.

Обратное движение — быстрое и без обсуждений. Возврат к усиленному режиму на две недели происходит автоматически по любому из шести признаков, и это правило имеет смысл записать в регламент заранее, чтобы не спорить о нём в момент события.

  • Сменили модель, версию платформы или поставщика — поведение меняется даже при том же промпте.
  • Переписали больше пятой части базы знаний или изменили нарезку документов на фрагменты.
  • Изменился прайс, регламент или условия, на которые агент ссылается чаще всего.
  • Появился новый канал обращений или новая категория вопросов — сезон, акция, новая товарная группа.
  • Доля эскалаций упала больше чем вдвое к среднему за сутки. Резкое улучшение метрики подозрительнее ухудшения.
  • Пришла хотя бы одна жалоба клиента на неверную информацию от агента — независимо от того, подтвердилась она или нет.
Ноль дефектов три месяца подряд — повод проверить проверяющего

Идеальные отчёты встречаются в двух случаях: система действительно хороша либо проверяющий перестал сверять ответы с источниками и ставит отметки по впечатлению. Различить их просто: раз в квартал попросите второго человека независимо оценить 30 диалогов из уже проверенных. Расхождение больше чем в четверти случаев означает, что чек-лист заполняется формально, и это важнее любых процентов в отчёте.

Когда выборочный контроль не нужен

Есть три ситуации, где отдельная процедура — лишние деньги, и честнее сказать об этом до того, как в бюджет заложат 44 300 ₽ в месяц.

  • Поток меньше 300–400 обращений в месяц. Проще смотреть всё: это 15–20 часов в месяц, и результат точнее любой выборки, потому что редкие события не теряются. Отдельный регламент отбора здесь только добавляет бюрократии.
  • Результат всегда подтверждает человек перед отправкой. Черновик письма, классификация документа, извлечённые поля — ошибка ловится на следующем шаге сотрудником, который и так обязан прочитать результат. Нужен журнал и разбор спорных случаев, а не выборочный контроль как отдельная процедура.
  • Ответы берутся из справочника фиксированными шаблонами, а модель не генерирует свободный текст. Проверять здесь нечего: шаблон либо подставился, либо нет, и это ловится тестами, а не чтением диалогов.

И отдельно — про случай, когда контроль формально есть, а пользы нет. Если проверяющий не имеет права менять базу знаний и не может поставить задачу подрядчику, его находки складываются в файл и остаются там. Это самый дорогой вариант из всех: компания платит 44 300 ₽ в месяц за наблюдение за деградацией вместо её предотвращения. Поэтому в регламенте первой строкой стоит не доля выборки, а фамилия человека, который принимает решение по найденному дефекту. Как измерить исходный уровень качества, от которого потом отсчитываются все эти проценты, разобрано в материале про замер качества ИИ на своих данных.

Контроль без права менять базу знаний — это подписка на отчёт о том, как система становится хуже. Регламент начинается с фамилии, а не с процента выборки.