Выборочный контроль диалогов — это регулярная процедура, в которой человек читает часть разговоров ИИ-агента с клиентами и оценивает их по короткому чек-листу. Нужна она по одной причине: ошибки агента не выглядят как ошибки. Ответ, собранный из воздуха, и ответ, процитированный из вашего регламента, написаны одинаково ровным тоном, поэтому обнаружить расхождение можно только сверкой с источником, а сверку кто-то должен делать по расписанию.
Этот контур регулярно выпадает из бюджета, и происходит это предсказуемо. На этапе внедрения обсуждают модель, базу знаний и интеграции; контроль выглядит как «руководитель будет иногда смотреть» и в смету не попадает. На третьем месяце выясняется, что смотреть надо 30–40 часов в месяц, а человека под это нет. Дальше система работает без надзора, и первым признаком проблемы становится жалоба клиента.
Ниже — рабочий регламент: четыре режима по календарю, правила отбора диалогов, чек-лист оценки из восьми пунктов, цикл исправления и расчёт часов при разных объёмах. Сквозной пример тот же, что и в остальных материалах раздела: клиентская поддержка, около 6 000 обращений в месяц, ставки — старший оператор 900 ₽/час, инженер 3 000 ₽/час, руководитель 2 500 ₽/час. Средняя оценка одного диалога по чек-листу — три минуты; это ключевой множитель всех расчётов, и на своих диалогах его стоит замерить.
Сплошной режим и где он заканчивается
Первые две недели после запуска смотреть надо максимально плотно: именно тогда всплывает всё, чего не было в тестах, — формулировки, которых не предусмотрели, вложения, которые не открываются, сценарии, где агент отвечает формально верно и не по делу. Проблема в том, что «сплошной режим» на большинстве потоков физически невыполним, и планировать его — значит планировать невыполнение.
Арифметика простая. 6 000 обращений в месяц по три минуты на диалог — это 300 часов, то есть почти два человека на полной ставке, занятых только чтением. Сплошной просмотр реалистичен примерно до 1 500 обращений в месяц: там получается 75 часов, половина ставки, и это уже требует отдельного решения. Выше этой границы «сплошной» означает не сто процентов потока, а сто процентов обязательных категорий плюс усиленная случайная выборка.
Если она стоит в договоре при потоке выше 1 500 обращений в месяц, уточните, кто именно и в какие часы будет читать 200 диалогов в день. Обычно после этого вопроса режим переформулируется в честный: редкие корзины целиком, каждая вторая эскалация и 20 % случайных, что даёт 1 748 диалогов в пересчёте на месяц и около 44 часов за сами эти две недели. Это тоже много, но это выполнимо и стоит понятных денег.
| Период | Случайная выборка | Эскалации | Редкие корзины | Диалогов в месяц | Часов в месяц |
|---|---|---|---|---|---|
| Недели 1–2 | 20 % — 1 200 | каждая вторая — 313 | все — 235 | 1 748 | 87 ч |
| Месяцы 1–2 | 10 % — 600 | каждая третья — 208 | все — 235 | 1 043 | 52 ч |
| С 3-го месяца, рабочий режим | 5 % — 300 | каждая пятая — 125 | все — 235 | 660 | 33 ч |
| С 7-го месяца при стабильных метриках | 3 % — 180 | каждая пятая — 125 | все — 235 | 540 | 27 ч |
Часы в таблице приведены в пересчёте на полный месяц, чтобы режимы можно было сравнивать между собой: первые две недели дают половину верхней строки, около 44 часов. Что такое редкие корзины и почему эскалации приходится прореживать, разберём в следующем разделе — сначала важнее сама форма расписания.
К каждой доле в регламенте приписывается минимальный абсолютный порог — не меньше пяти случайных диалогов в день. Доля в процентах перестаёт работать на маленьких и на неравномерных потоках: три процента от спокойного вторника со 120 обращениями — это четыре диалога, и по четырём нельзя сказать ничего. Поэтому в регламенте всегда стоит пара «доля и минимум в день», а не только доля.
Горизонтальная лента времени на семь месяцев с четырьмя подписанными участками убывающей высоты: «Недели 1–2: 20 % случайных + каждая вторая эскалация + редкие корзины, 1 748 диалогов, 87 ч/мес», «Месяцы 1–2: 10 % + каждая третья эскалация, 1 043 диалога, 52 ч/мес», «С 3-го месяца: 5 % + каждая пятая эскалация, 660 диалогов, 33 ч/мес», «С 7-го месяца: 3 %, минимум 5 случайных в день, 540 диалогов, 27 ч/мес». Под каждым переходом между участками маленькая отметка «переход только при подтверждённых метриках».
Правила отбора: случайная выборка плюс четыре корзины
Случайная выборка отвечает на вопрос «какой у системы средний уровень». Она не отвечает на вопрос «где она опасна», потому что опасные события редкие и в случайную выборку почти не попадают. Поэтому рабочий отбор состоит из пяти частей: случайные диалоги плюс четыре корзины, которые набираются по признакам автоматически.
| Что отбираем | Правило | Диалогов в месяц | Часов |
|---|---|---|---|
| Случайная выборка | 5 % потока, не меньше 10 в день | 300 | 15 ч |
| Срабатывания ограничителей | Все диалоги, где сработал числовой лимит или стоп-тема | 25 | 1,3 ч |
| Диалоги с негативом | Все, где сработал признак негатива или клиент повысил тон | 120 | 6 ч |
| Деньги без результата | Все, где обсуждались суммы, скидки или возврат и диалог закончился ничем | 90 | 4,5 ч |
| Эскалации | Каждая пятая из 625 передач оператору в месяц | 125 | 6,3 ч |
| Итого | — | 660 | 33 ч |
Эскалации — единственная корзина, которую приходится прореживать. При норме 10–12 % передач человеку их набирается 625 в месяц, и смотреть все означало бы удвоить бюджет контроля. Каждая пятая даёт достаточную картину: эскалации однотипны, и повторяющиеся причины видны уже на сотне. Три остальные корзины — срабатывания ограничителей, негатив и деньги без результата, вместе 235 диалогов в месяц, — прореживать нельзя: события там редкие и каждое информативно. Именно их в таблице режимов мы называем редкими корзинами, и в любом режиме они берутся целиком.
Отдельно стоит сравнить эти 33 часа с тем, что обычно попадает в смету. В разборе трёх контуров защиты выборочный контроль оценён в 15 часов в месяц — это ровно первая строка таблицы, случайная выборка в 5 %. Четыре обязательные корзины добавляют ещё 18 часов, и именно они появляются на третьем месяце как неожиданность. Закладывать надо обе части сразу.
Горизонтальная накопительная полоса из пяти сегментов с подписями и числами: «Случайные 5 % — 300», «Эскалации, каждая пятая — 125», «Негатив — 120», «Деньги без результата — 90», «Срабатывания ограничителей — 25». Общая длина подписана «660 диалогов, 33 часа в месяц». Под полосой отдельной скобкой выделен первый сегмент с подписью «то, что обычно закладывают в смету — 15 часов», и вторая скобка на остальные четыре — «то, что забывают — 18 часов».
Чек-лист оценки диалога: восемь пунктов
Чек-лист нужен по той же причине, что и любой чек-лист: без него оценка сводится к впечатлению, а впечатление у разных людей и в разные дни разное. Восемь пунктов проверяются за три минуты, каждый отмечается как «да», «нет» или «не применимо». Диалог считается дефектным, если «нет» стоит хотя бы у одного из первых пяти пунктов; пункты шесть-восемь снижают качество, но не создают обязательств.
- 1Факт из базы. Каждое фактическое утверждение в ответе опирается на найденный фрагмент документа. Проверяется сверкой ответа с фрагментами из журнала, а не по памяти проверяющего.
- 2Ссылка на источник. К фактическому ответу приложена ссылка, она ведёт в конкретный документ с редакцией и пунктом, а не в раздел сайта. Ссылку надо открыть и найти в документе фразу, на которой построен ответ.
- 3Актуальность источника. Документ, на который сослался агент, не старше согласованного срока пересмотра. Это единственный пункт, который чаще всего указывает на процесс заказчика, а не на дефект системы.
- 4Отсутствие обещаний. В ответе нет сумм, процентов, сроков и слов-обязательств, не подтверждённых данными из системы. Формулировки вида «обычно занимает пару дней» считаются нарушением: клиент прочитает их как срок.
- 5Границы компетенции. Нет советов по здоровью, праву и налогам, нет обсуждения конкурентов, стоп-темы отработали. Если стоп-тема должна была сработать и не сработала, это дефект контура, а не диалога.
- 6Своевременность передачи. Диалог ушёл человеку на первом признаке, а не после трёх кругов уточнений. Проверяется по числу реплик до эскалации: больше четырёх — повод посмотреть, что мешало.
- 7Тон и формат. На «вы», без двойных извинений, первое предложение отвечает на вопрос, длина в согласованной норме, уточняющий вопрос не больше одного за реплику.
- 8Задача клиента решена. Клиент не вернулся с тем же вопросом в течение 48 часов. Единственный пункт, который проверяется не по самому диалогу, а по журналу за следующие двое суток.
Первые два пункта дают больше половины всех находок и проверяются механически, поэтому их имеет смысл частично автоматизировать: наличие ссылки в фактическом ответе система умеет отмечать сама, а проверку «есть ли фраза ответа в найденном фрагменте» можно свести к сравнению текстов. Это снимает с человека около четверти работы и не заменяет её полностью: сверка по смыслу остаётся ручной.
Нарисованный (не скриншот) макет карточки оценки. Сверху блок «Диалог № 4318, 12 реплик» и три поля: «Вопрос», «Найденные фрагменты (3)», «Ответ». Ниже список из восьми пронумерованных пунктов чек-листа с квадратами отметок «да / нет / н. п.»: факт из базы, ссылка на источник, актуальность источника, отсутствие обещаний, границы компетенции, своевременность передачи, тон и формат, задача решена. Первые пять пунктов объединены слева вертикальной скобкой с подписью «дефект». Внизу поле «Причина» с тремя вариантами выбора: выдумка, промах поиска, устаревший документ, и поле «В регресс-набор».
Кто смотрит и сколько это часов при разных объёмах
Смотреть должен человек, который знает предметную область и имеет право менять базу знаний: старший оператор, методист, руководитель группы. Инженер подрядчика для этой работы не подходит — он не отличит устаревший регламент от действующего. Владелец процесса тоже не подходит на роль ежедневного проверяющего: его время дороже, а работа монотонная; его место — в разборе причин и в решениях по отчёту.
| Поток в месяц | Случайная выборка | Эскалации | Редкие корзины | Всего | Часов в месяц | Кто смотрит |
|---|---|---|---|---|---|---|
| 600 | 20 % — 120 | все — 62 | все — 23 | 205 | 10 ч | Руководитель отдела в своё рабочее время |
| 1 500 | 10 % — 150 | все — 156 | все — 59 | 365 | 18 ч | Старший оператор, 4–5 часов в неделю |
| 6 000 | 5 % — 300 | каждая пятая — 125 | все — 235 | 660 | 33 ч | Выделенный контролёр на неполный день |
| 20 000 | 2 % — 400 | каждая десятая — 208 | негатив прорежен вдвое — 583 | 1 191 | 60 ч | Отдельная роль плюс автоматический отбор |
Обратите внимание на форму зависимости: поток вырос в 33 раза, часы контроля — в шесть. Это и делает контур подъёмным: доля случайной выборки падает по мере роста, эскалации прореживаются сильнее, а на больших объёмах подключается автоматический отбор по риску. Обратная сторона в том, что на маленьком потоке контроль стоит непропорционально дорого в пересчёте на одно обращение: 10 часов на 600 обращений — это втрое больше минут на обращение, чем 33 часа на 6 000.
Семь рублей сорок копеек на обращение сравнивать надо не с нулём, а с ценой незамеченной деградации. Один разобранный инцидент с придуманной скидкой мы считали отдельно — вышло 132 000 ₽ вместе с уступкой, простоем и срочной доработкой. Три месяца полного контроля стоят как один такой эпизод, и обнаруживает проблему контроль до того, как её обнаружит клиент. Из чего вообще складывается ежемесячная поддержка автоматизированной системы, разобрано в материале про то, сколько стоит поддержка и зачем она.
Цикл исправления: почему правки мало
Самая частая ошибка организации контроля — считать работу законченной в момент, когда дефект отправлен подрядчику. Дальше происходит понятное: правку делают, она чинит найденный случай, а через два месяца обновляется промпт или модель, и тот же дефект возвращается. Никто этого не замечает, потому что случайная выборка на него больше не попадёт. Разорвать цикл можно только одним способом — записать вопрос в набор, который прогоняется на каждом обновлении.
- 1Карточка дефекта
Номер диалога, пункт чек-листа, по которому стоит «нет», дословная цитата проблемного места и ссылка на журнал с найденными фрагментами. Формулировки «бот ответил неправильно» недостаточно: через неделю никто не восстановит, что именно было не так.
- 2Причина из трёх
Выдумка при пустом поиске, промах поиска или устаревший документ. Определяется по журналу за минуту, если в нём записаны найденные фрагменты; механика различения разобрана в статье про механику галлюцинаций. Причина определяет исполнителя: подрядчик, методист или владелец документа на вашей стороне.
- 3Вопрос в регресс-набор
Исходный вопрос клиента с эталонным ответом добавляется в набор контрольных диалогов. Эталон — не дословный текст, а список обязательных и запрещённых элементов ответа: должен содержать ссылку на такой-то пункт, не должен содержать срок и процент.
- 4Правка и прогон
Дефект считается закрытым не после ответа «поправили», а после прогона всего набора на обновлённой системе. Порядок выката правок, состав набора и правила отката разобраны в материале про версионирование и тесты промптов.
- 5Возврат в отчёт
В месячном отчёте видно, сколько дефектов найдено, сколько закрыто прогоном и сколько висит. Строка «висит больше месяца» — самая важная в отчёте: она показывает, работает цикл или дефекты просто накапливаются в переписке.
Замкнутая круговая схема из шести блоков со стрелками по часовой стрелке: «Отбор 660 диалогов» → «Оценка по чек-листу из 8 пунктов» → «Карточка дефекта» → «Причина: выдумка / промах поиска / устаревший документ» → «Вопрос в регресс-набор с эталоном» → «Прогон набора на обновлении» → и стрелка обратно к отбору. Сбоку от блока причины три коротких ответвления с подписями исполнителей: «подрядчик», «методист», «владелец документа». В центре круга подпись «дефект закрыт только после прогона».
Когда режим можно ослабить и когда вернуть
Ослабление — решение по метрикам, а не по календарю. Перейти с 5 % на 3 % случайной выборки можно, если три месяца подряд выполняются четыре условия одновременно.
- Доля дефектных диалогов в выборке ниже 3 % — то есть меньше двадцати дефектов на 660 проверенных.
- Ни одного дефекта по пунктам 4 и 5 чек-листа: ни обещаний, не подтверждённых системой, ни выхода за границы компетенции.
- Доля фактических ответов без ссылки на источник — ноль. Это единственная метрика раздела, где допустим жёсткий ноль, и снимается она из журнала автоматически.
- Доля повторных обращений по тому же вопросу в течение 48 часов не растёт и держится не выше 8 %.
Обратное движение — быстрое и без обсуждений. Возврат к усиленному режиму на две недели происходит автоматически по любому из шести признаков, и это правило имеет смысл записать в регламент заранее, чтобы не спорить о нём в момент события.
- Сменили модель, версию платформы или поставщика — поведение меняется даже при том же промпте.
- Переписали больше пятой части базы знаний или изменили нарезку документов на фрагменты.
- Изменился прайс, регламент или условия, на которые агент ссылается чаще всего.
- Появился новый канал обращений или новая категория вопросов — сезон, акция, новая товарная группа.
- Доля эскалаций упала больше чем вдвое к среднему за сутки. Резкое улучшение метрики подозрительнее ухудшения.
- Пришла хотя бы одна жалоба клиента на неверную информацию от агента — независимо от того, подтвердилась она или нет.
Идеальные отчёты встречаются в двух случаях: система действительно хороша либо проверяющий перестал сверять ответы с источниками и ставит отметки по впечатлению. Различить их просто: раз в квартал попросите второго человека независимо оценить 30 диалогов из уже проверенных. Расхождение больше чем в четверти случаев означает, что чек-лист заполняется формально, и это важнее любых процентов в отчёте.
Когда выборочный контроль не нужен
Есть три ситуации, где отдельная процедура — лишние деньги, и честнее сказать об этом до того, как в бюджет заложат 44 300 ₽ в месяц.
- Поток меньше 300–400 обращений в месяц. Проще смотреть всё: это 15–20 часов в месяц, и результат точнее любой выборки, потому что редкие события не теряются. Отдельный регламент отбора здесь только добавляет бюрократии.
- Результат всегда подтверждает человек перед отправкой. Черновик письма, классификация документа, извлечённые поля — ошибка ловится на следующем шаге сотрудником, который и так обязан прочитать результат. Нужен журнал и разбор спорных случаев, а не выборочный контроль как отдельная процедура.
- Ответы берутся из справочника фиксированными шаблонами, а модель не генерирует свободный текст. Проверять здесь нечего: шаблон либо подставился, либо нет, и это ловится тестами, а не чтением диалогов.
И отдельно — про случай, когда контроль формально есть, а пользы нет. Если проверяющий не имеет права менять базу знаний и не может поставить задачу подрядчику, его находки складываются в файл и остаются там. Это самый дорогой вариант из всех: компания платит 44 300 ₽ в месяц за наблюдение за деградацией вместо её предотвращения. Поэтому в регламенте первой строкой стоит не доля выборки, а фамилия человека, который принимает решение по найденному дефекту. Как измерить исходный уровень качества, от которого потом отсчитываются все эти проценты, разобрано в материале про замер качества ИИ на своих данных.
Контроль без права менять базу знаний — это подписка на отчёт о том, как система становится хуже. Регламент начинается с фамилии, а не с процента выборки.
