Разметка данных — это когда человек заранее записывает правильный ответ на конкретный пример, чтобы потом было с чем сравнить ответ машины. Для замера качества ИИ-агента нужно 100–300 таких примеров: 20–30 на каждую категорию в задачах классификации, 100–150 на каждый тип документа в задачах извлечения полей, 200–300 вопросов в задачах ответа по базе знаний.
Слово «разметка» пришло из машинного обучения и тянет за собой ложное ожидание: кажется, что размеченные примеры чему-то научат систему и качество вырастет само. Для бизнес-задач 2026 года это почти всегда не так. Ста примеров не хватит ни на какое обучение — их хватит ровно на одно: узнать, где система стоит сейчас. Эталон нужен не модели, а вам.
Ниже — сколько примеров брать под разные задачи, кто их готовит, как проверяется согласованность двух разметчиков, во что это обходится в часах и рублях и в каких случаях разметку делать не надо вовсе.
Эталонный ответ: единственное, с чем можно сравнивать
Без эталона любой процент качества недоказуем. Спор «этот ответ правильный или нет» без заранее записанной версии всегда выигрывает тот, кто громче, и обычно это подрядчик, потому что он лучше знает, что система умеет. Записанный до прогона эталон переводит разговор из области мнений в область сверки.
Пара «вход — правильный ответ» плюс источник. Вход — реальное обращение, документ или запрос из вашего журнала. Правильный ответ — не красивый текст, а список фактов, которые обязаны в нём прозвучать, или одна метка из согласованного списка категорий. Источник — документ, пункт регламента или запись в учётной системе, откуда факты взяты. Четвёртым полем ставится пометка, будет ли ошибка на этом примере критической.
Требование «назови источник» на первый взгляд лишнее, а на практике это самая полезная часть разметки. Примерно на каждом пятом примере предметный специалист обнаруживает, что источника нет: ответ существует только в голове опытного сотрудника, в переписке или в двух противоречащих друг другу документах. Такой пример — не провал разметки, а её главный результат: вы нашли дыру в базе знаний до того, как в неё провалился агент. Как этот эталон потом используется в замере, мы разбирали в методике измерения качества на своих данных.
Схема одной карточки эталонного примера, разложенной на четыре подписанных поля сверху вниз: «Вход: реальное обращение из журнала», «Обязательные факты: 2–4 пункта списком», «Источник: документ, пункт регламента или запись в учёте», «Критическая ошибка на этом примере: да / нет». Справа от карточки отходят две стрелки: одна к блоку «сверка с ответом системы», вторая к блоку «источника нет — дыра в базе знаний, примерно каждый пятый пример». Чертёжный стиль, подписи по-русски.
Сколько примеров нужно под разные задачи
Общее правило одно: не меньше 20 примеров на каждую категорию, тип документа или тему, по которой вы хотите увидеть отдельную цифру. На двадцати примерах погрешность доли составляет около ±13 п.п. — этого хватает, чтобы заметить категорию, где система откровенно проваливается, и не хватает, чтобы сравнить две работающие между собой. Дальше объём определяется тем, на сколько частей вы хотите разложить результат.
| Задача | Минимум, чтобы вообще что-то увидеть | Рабочий объём для замера | Время на один пример |
|---|---|---|---|
| Классификация обращений по 8 категориям | 160 примеров — по 20 на категорию | 240 — по 30 на категорию | 1–2 минуты |
| Извлечение полей из документа одного типа | 60 документов | 100–150 на каждый тип документа | 5–8 минут при 10–12 полях |
| Ответ по базе знаний | 100 вопросов | 200–300 вопросов на 6–8 тем | 5–8 минут |
| Тональность отзыва: позитив, негатив, нейтраль | 90 отзывов — по 30 на класс | 200 отзывов | 30–60 секунд |
| Поиск нужного документа по запросу | 60 запросов | 100–150 запросов | 3–5 минут |
Из таблицы следует неочевидное: дорожает не объём выборки, а дробность отчёта. Замер «в целом по классификации» стоит 160 примеров, замер «по каждой из восьми категорий отдельно» — те же 160, но результат по каждой категории будет с погрешностью ±13 п.п. Чтобы получить по категориям приличную точность, нужно уже 400–500 примеров. Поэтому список категорий, по которым вы хотите видеть отдельные цифры, полезно сократить до трёх-четырёх самых денежных — остальные смотреть общей строкой.
Согласованность двух разметчиков — потолок вашей системы
После того как разметка готова, 20% примеров независимо размечает второй предметный специалист — обычно это 40–50 карточек. Считается доля совпадений. Смысл процедуры не в контроле за первым человеком, а в проверке самой задачи: если два ваших сотрудника расходятся в четверти случаев, то однозначного правильного ответа у задачи просто нет, и требовать 95% от машины бессмысленно.
| Тип задачи | Норма совпадения двух разметчиков | Что означает результат ниже нормы |
|---|---|---|
| Классификация по чётким категориям | 85% и выше | Категории пересекаются, границы не описаны |
| Извлечение полей из документов | 90% и выше | Не описано, что делать с нестандартными формами |
| Ответ по базе знаний | 80% и выше | В документах есть противоречия либо тем больше, чем кажется |
| Тональность отзыва | 75% и выше | Норма ниже, потому что оценка тона субъективна по природе |
| Любая задача | ниже 70% | Проблема в инструкции, а не в людях. Систему измерять рано |
Если два опытных сотрудника независимо дают одинаковый ответ в 78% случаев, то потолок для агента — примерно те же 78%, и никакая модель его не пробьёт: оставшиеся 22% — это не ошибки, а неопределённость самой задачи. Практический вывод: сначала доводится до ума регламент и инструкция, и только потом ставится требование к системе. Обратный порядок даёт бесконечный спор о качестве, в котором обе стороны правы.
Расхождения разбираются вместе, за один заход. Каждое несовпадение обсуждается, формулировка инструкции уточняется, два-три разобранных случая добавляются прямо в инструкцию как образцы, а спорные примеры, по которым договориться не удалось, откладываются в отдельную корзину и в подсчёт долей не входят. Доля таких примеров — самостоятельный показатель: больше 5% означает, что задача поставлена нечётко и её надо переформулировать до замера.
Горизонтальные полосы с нормами совпадения двух разметчиков: «Извлечение полей — 90%», «Классификация — 85%», «Ответ по базе знаний — 80%», «Тональность отзыва — 75%». Вся область ниже отметки 70% залита штриховкой и подписана «инструкция негодная, систему измерять рано». Отдельная пунктирная линия на уровне 78% подписана «потолок системы = согласованность людей». Ось значений — проценты от 50 до 100.
Кто размечает и как не сорвать ему основную работу
Разметку делает предметный специалист: старший оператор поддержки, методист, бухгалтер по первичке, юрист — тот, кто ежедневно решает эту задачу руками. Не подрядчик, не системный администратор и не сотрудник, который участвовал в настройке системы: знание внутреннего устройства заставляет непроизвольно формулировать эталон в терминах того, что система умеет.
- Один человек на задачу, второй — только на контрольные 20%. Делить основную разметку между двумя людьми можно лишь после того, как согласованность измерена и оказалась в норме, иначе получатся две разные разметки, склеенные в одну таблицу.
- Полтора-два часа в день, а не сплошной день. 50 часов разметки при полутора часах в день — это семь недель, при двух часах — пять. График «выдели человека на неделю целиком» проваливается всегда: к третьему часу качество разметки падает, и первые сто карточек потом приходится переделывать.
- Инструкция на одну страницу пишется до старта: что считать правильным, что делать с неоднозначными случаями, какие ошибки критические. Без неё разметчик придумывает правила по ходу дела, и первая половина выборки размечается не по тем правилам, что вторая.
- Готовые примеры-образцы — три штуки, разобранные вместе с руководителем. Это дешевле любых объяснений и снимает большую часть вопросов в первый же час.
В обращениях клиентов есть имена, телефоны, номера заказов, иногда данные о здоровье. Перед выгрузкой в таблицу для разметки данные обезличиваются — как именно, мы разбирали в материале об обезличенных данных для тестового контура. Если разметку делает внешний подрядчик, оформляется поручение обработки с перечнем действий и сроком; отдавать выгрузку исполнителям с биржи фриланса без договора нельзя ни в каком виде. Наши требования к работе с данными заказчика описаны на странице безопасности.
Часы и деньги: 100 примеров против 500
Считаем по модельным ставкам: предметный специалист — 900 ₽/час, руководитель или владелец процесса — 2 500 ₽/час. Задача — эталонные ответы по базе знаний, 6 минут на пример.
Разница в цене одного примера объясняется постоянной частью. Инструкция и разбор расхождений стоят 12 500 ₽ при ста примерах и 17 500 ₽ при пятистах — почти одинаково, но в первом случае это 125 ₽ на пример, а во втором 35 ₽. Отсюда практическое правило: если вы всё равно садитесь размечать, брать 100 примеров вместо 250 экономит не так много, как кажется, а точность теряет заметно.
Две составные колонки, ось Y — рубли за один эталонный пример от 0 до 250. Левая колонка «100 примеров, всего 23 300 ₽»: нижний сегмент «разметка и сверка — 108 ₽», верхний «инструкция и разбор — 125 ₽», итог 233 ₽. Правая колонка «500 примеров, всего 67 000 ₽»: нижний сегмент «разметка и сверка — 99 ₽», верхний «инструкция и разбор — 35 ₽», итог 134 ₽. Каждый сегмент подписан числом.
Когда разметка не нужна
Разметка — это десятки часов работы человека, которого не хватает и без того, поэтому отказ от неё иногда правильное решение. Четыре случая, в которых мы сами советуем не начинать.
- Задача решается правилом. Номер счёта достаётся регулярным выражением, категория товара — справочником, срок доставки — запросом в учётную систему. Правило проверяется десятком примеров, размечать двести незачем, а ИИ там вообще лишний.
- Меньше 100 обращений или документов в месяц. Выборка в 200 примеров набирается за два месяца и к моменту готовности устаревает. При таком потоке дешевле смотреть все случаи подряд раз в неделю.
- Разовая задача. Если надо обработать 200 договоров один раз и больше к этому не возвращаться, разметка и замер съедят больше времени, чем ручная обработка. Автоматизация окупается на повторяемости, а не на объёме.
- У самих людей нет однозначного ответа. Совпадение двух специалистов ниже 70% означает, что сначала нужен регламент и обучение сотрудников, а измерение системы бессмысленно: вы будете сравнивать её с эталоном, которого нет.
И отдельно про соблазн, который возникает почти у всех: «раз уж размечаем, давайте сразу под дообучение модели». Дообучение требует не сотен, а тысяч примеров, отдельного контура для проверки и повторяется при каждой смене версии модели. Для типовых задач бизнеса — ответы по регламентам, классификация обращений, извлечение полей — это в 2026 году почти всегда лишнее: ту же задачу дешевле решает поиск по корпоративной базе знаний с подстановкой найденных фрагментов в ответ. Разметка при этом всё равно нужна, но только как эталон для замера — те самые 100–300 примеров, а не тысячи.
Разметка не улучшает систему. Она делает видимым то, насколько система хуже вашего лучшего сотрудника.
