Данных нужно меньше, чем принято думать, и они другие. Для классификации обращений нужна история: 200–300 случаев по каждой теме, у которых проставлен исход. Для ответов по базе знаний объём вообще не показатель — важно, закрыты ли письменно 15–20 тем, дающих большую часть потока. Для извлечения полей из документов достаточно 50–100 реальных документов каждой формы, включая плохие сканы. Ни одна из трёх задач не требует ни «озера данных», ни года накопления.
Фраза «данных у нас достаточно» означает три разных вещи: объём архива, его пригодность и готовность кого-то его отдать. Проверять надо каждую: архив на 40 000 писем способен не дать ни одного пригодного примера, а тридцать страниц регламента с датой — дать рабочего агента.
Ниже — пороги по трём типам задач, список того, что данными не является, признаки данных, с которыми агент начнёт вредить, минимальный набор для компании без накопленного архива с расчётом в рублях и проверка своей готовности за один день. Цены — по состоянию на сентябрь 2026 года.
Три типа задач — три разных порога
Порог зависит не от размера компании, а от того, что агент должен делать. Задач, из которых собирается почти любой проект, три, и путать их пороги нельзя: в одной считают случаи, в другой — покрытие тем, в третьей — формы документов. Из чего вообще собирается система и почему источник фактов в ней отделён от модели, разбирали в материале про устройство ИИ-агента.
| Тип задачи | Что должно существовать | Порог | Чем измеряется готовность |
|---|---|---|---|
| Классификация и маршрутизация обращений | История обращений с проставленной темой и исходом | 200–300 случаев на каждую тему за последний год | Доля потока, укладывающаяся в 15–20 тем, — не меньше 70 % |
| Ответы по базе знаний | Документы с датой, владельцем и однозначной формулировкой | Не объём, а покрытие: 15–20 частотных тем закрыты письменно | Доля вопросов вне базы: 18–20 % в первый месяц, 10–12 % через квартал |
| Извлечение полей из документов | Реальные документы каждой формы, включая плохие сканы и правки от руки | 50–100 документов каждой формы | Число форм, по которым набирается хотя бы 50 документов в месяц |
Число 200–300 относится к истории, а не к ручной разметке. Это ответ на вопрос «есть ли у темы частота»: тема, по которой за год набралось тридцать обращений, — не тема для агента, а исключение для человека. Разметить руками придётся заметно меньше: эталонная выборка для замера качества считается по своей методике и разобрана отдельно в материале про разметку данных.
Во второй строке привычная логика «чем больше документов, тем лучше» работает наоборот. Пятьсот страниц регламентов, где половина отменена, дают худший результат, чем сорок действующих: поиск честно находит отменённый пункт, и агент так же честно отвечает по нему. Правила нарезки и обязательные поля описаны в материале про подготовку базы знаний.
Сравнение в три вертикальные колонки на общем поле. Колонка «Классификация»: иконка стопки карточек, крупная надпись «200–300 случаев на тему», ниже мелко «исход проставлен», внизу условие «70 % потока в 15–20 темах». Колонка «Ответы по базе»: иконка документа с датой, крупная надпись «покрытие, а не объём», ниже «15–20 частотных тем закрыты письменно», внизу «вопросов вне базы: 18–20 % → 10–12 %». Колонка «Извлечение полей»: иконка бланка, крупная надпись «50–100 документов формы», ниже «включая плохие сканы», внизу «форм, где набирается 50 в месяц». Под колонками общая перечёркнутая полоса с надписью «большие данные» и подписью «ни одной из трёх задач не нужны». Чертёжный стиль, подписи по-русски.
Что данными не является, хотя так называется
На первой встрече заказчик перечисляет источники, и половина списка данными не является. Это не придирка к словам: каждый такой пункт превращается в незапланированную работу на второй неделе проекта, когда выясняется, что переносить нечего.
- Устные договорённости. «Постоянным клиентам делаем отсрочку» — это не правило, пока не записано, кому именно, на сколько дней и кто утверждает исключение. Агент не умеет спросить у коллеги в курилке.
- Регламент в голове руководителя. Проверяется одним вопросом: может ли новый сотрудник ответить клиенту, прочитав документ, и не переспрашивая? Если нет — документа нет, есть файл.
- Папка со сканами без структуры. 12 000 файлов вида «скан_2024_11_14.pdf» — это архив, а не данные. Данными они станут после разбора по формам и проверки читаемости, и это отдельная работа с отдельными часами.
- Переписка без зафиксированного результата. Тысячи диалогов в мессенджере ничему не учат, если нигде не записано, чем каждый закончился: продажей, отказом, возвратом. Без исхода это текст, а не история.
- Выгрузка из CRM с дублями и пустыми полями. Формально данные есть, фактически по ним нельзя ни посчитать частоту тем, ни собрать выборку. Что именно проверять и сколько стоит чистка — в материале про грязные данные в CRM.
Данные, с которыми агент будет вредить
Отсутствие данных останавливает проект, и это заметно сразу. Опаснее другое состояние: данных формально хватает, но внутри них противоречие. Тогда система запускается, показывает приличные метрики на демонстрации и начинает уверенно ошибаться в эксплуатации — потому что нашла источник, просто не тот.
Человек, встретив в базе два противоречащих пункта, идёт спрашивать. Агент выбирает тот, который лучше совпал с формулировкой вопроса, и отвечает без признака сомнения. Один уверенный неверный ответ про цену или срок обходится примерно в 725 ₽ вместе с разбором, повторным обращением и уступкой клиенту, и никакая настройка модели это не лечит — лечится только удалением старой версии. Как устроен механизм отказа, когда опоры нет вовсе, разбирали в материале про то, что делает агент, когда не знает ответа.
- Две редакции регламента без пометки, какая действует. Правило простое: старая версия не архивируется рядом, а убирается из индекса в тот же день.
- Прайс в базе знаний отдельно от прайса в учётной системе. Цены и сроки агент обязан брать запросом в систему, а не из текста, — иначе расхождение возникает в первый же день после изменения.
- Дубли карточек клиентов: три записи об одном контрагенте с разными условиями. Агент выберет любую и будет прав по своим данным.
- Документы без даты. Поиск не может отличить прошлогоднее условие от действующего, если в тексте нет ни даты, ни владельца, — а это два из шести обязательных полей при нарезке.
Минимальный набор для компании без архива
Компания на 40 человек редко имеет подготовленные данные, и это нормальное стартовое состояние. Минимальный набор собирается за 2–3 недели своими силами, без консультантов и без проекта по «наведению порядка в данных». Работа делится на четыре шага, и три из четырёх делает владелец процесса, а не инженер.
- 1Выгрузить обращения за три месяца и разложить на темы
Подойдёт экспорт из CRM, почты или чата — любой, где видно текст обращения и чем оно закончилось. Задача одна: получить список тем с частотой. Обычно 15–20 тем дают 70–80 % потока, а хвост редких тем остаётся человеку. Как замерить процесс до внедрения, разбирали отдельно.
- 2Написать ответ по каждой частотной теме
Один документ на тему, 15–25 строк, с датой и фамилией того, кто его утвердил. Пишет не редактор и не подрядчик, а человек, который сейчас на эти вопросы отвечает. Сорок минут на тему — реалистичная норма, если не пытаться сразу сделать красиво.
- 3Отделить факты от текста
Цены, сроки, остатки, статусы заказов в документы не переносятся. Они остаются в учётной системе, а агент получает к ним доступ на чтение через отдельный метод. Это единственный способ не поддерживать вручную вторую копию прайса.
- 4Нарезать и загрузить
Инженерная часть: разбить документы на фрагменты по 300–800 слов, проставить обязательные поля, загрузить в хранилище и проверить, что поиск возвращает нужный фрагмент на контрольных вопросах. Шесть часов на минимальный набор — рабочая оценка.
Карта связей из пяти узлов вокруг центрального блока «агент». Узел «CRM / почта / чат» — стрелка с подписью «история обращений за 3 месяца, 15–20 тем». Узел «Регламенты и ответы» — стрелка «документы с датой и владельцем, фрагменты по 300–800 слов». Узел «Учётная система» — стрелка «цены, сроки, остатки: запрос на чтение, не копия». Узел «Папка сканов» — стрелка «разобрана по формам, 50–100 документов каждой». Пятый узел «Устные договорённости» нарисован пунктиром, стрелка от него перечёркнута и подписана «данными не является». Чертёжный стиль, подписи по-русски.
Считаем стоимость этого набора по каноническим ставкам журнала: полная стоимость часа владельца процесса — 900 ₽, час инженера-подрядчика — 3 000 ₽. Поток для сравнения берём тот же, что и в соседних материалах раздела: 3 000 обращений в месяц, ручной разбор одного — 6 минут, ставка оператора 700 ₽/час.
Арифметику легко пересчитать: 22 часа по 900 ₽ дают 19 800 ₽, шесть часов инженера по 3 000 ₽ — 18 000 ₽, вместе 37 800 ₽. Разница долей 55 % и 30 % — это 750 обращений от потока в 3 000; они по шесть минут дают 75 часов, по 700 ₽ — 52 500 ₽ в месяц. Обе доли модельные, но порядок устойчивый: агент на неподготовленных данных упирается не в качество модели, а в то, что половину вопросов ему не на чем закрыть.
Диаграмма из двух столбиков на общей рублёвой шкале. Левый невысокий столбик «подготовка данных, разово — 37 800 ₽» разбит на четыре сегмента с подписями: разбор обращений 7 200 ₽, ответы по темам 9 000 ₽, сверка с учётной системой 3 600 ₽, нарезка и загрузка 18 000 ₽. Правый высокий столбик «разница в месяц — 52 500 ₽» с выноской «55 % против 30 % закрытых без человека, поток 3 000 обращений». Между столбиками горизонтальная стрелка с подписью «возврат примерно за три недели». Оси подписаны: рубли. Чертёжный стиль, подписи по-русски.
Проверка за один день: шесть вопросов
Оценить готовность данных можно до всякого подрядчика и без выгрузок в чужие руки: шесть вопросов, ответы на которые собираются за рабочий день. Каждый ответ — число или «нет».
- 1Сколько обращений в месяц и какая доля укладывается в 15–20 повторяющихся тем? Ниже 70 % задача перестаёт быть типовой, и агент будет закрывать меньшую часть потока, чем обещано в презентации.
- 2По скольким из этих тем есть письменный ответ с датой? Если меньше половины, первая работа проекта — не настройка модели, а написание документов.
- 3Откуда агент возьмёт цену, срок и остаток: есть ли выгрузка или метод в учётной системе, и как часто она обновляется? Ответ «менеджер смотрит в 1С» означает, что источника пока нет.
- 4Есть ли в базе две версии одного правила? Проверяется поиском по ключевому слову в общей папке: два файла с похожими названиями и разными числами — типичная находка первого часа.
- 5Если задача про документы: сколько разных форм и по скольким набирается хотя бы 50 штук в месяц? Формы, которых меньше, остаются человеку — и это нормальный проектный результат, а не поражение.
- 6Кто в компании может утвердить формулировку ответа так, чтобы её не переписали через неделю? Без этого человека данные собрать можно, а поддерживать их — нет; роли и часы разбираем в материале про то, кто отвечает за агента после запуска.
Если хотя бы три ответа из шести оказались отрицательными, разговор о подрядчике преждевременный: сначала две-три недели внутренней работы по списку выше. Это дешевле и быстрее, чем оплачивать те же часы инженеру по тройной ставке, и заодно даёт ответ на более общий вопрос — нужен ли компании агент вообще.
Когда данные под агента собирать не надо
Подготовка данных — работа на 28 часов, и она не всегда оправдана. Четыре случая, где её честно не начинают.
- Поток меньше 100 обращений или документов в месяц. Выборка нужного размера набирается за полгода и к моменту готовности устаревает, а разбирать всё подряд руками при таком объёме дешевле.
- Задача решается справочником и регулярным выражением: номер счёта, код товара, статус заказа. Здесь данные для агента не нужны, потому что не нужен агент — граница разбирается в материале про агента и автоматизацию по правилам.
- Процесс переписывается прямо сейчас: меняются условия, тарифы или схема работы. Собранная база устареет раньше запуска, а платить за неё придётся дважды.
- Данные есть, но их нельзя выносить за контур: медицинские, кадровые, банковские. Задача не отменяется, но начинается не со сбора, а с решения о том, где будет стоять модель, — иначе подготовка окажется работой в стол.
Агент отвечает не тем, что знает модель, а тем, что вы успели записать. Всё незаписанное для него не существует.
