Пилот распознавания решает ровно одну задачу: получить долю документов, прошедших без единой правки, на вашем потоке. Всё остальное — сроки, смета, выбор вендора — считается уже из этой цифры, и ошибка в ней на пятнадцать процентных пунктов двигает окупаемость проекта на месяцы. Никакая презентация вендора эту цифру не заменяет, потому что у вендора другие сканы, другие контрагенты и другие справочники.
Две недели — реалистичный срок для пилота на одном типе документа. Меньше не получается из-за эталонной разметки, больше не нужно: если за десять рабочих дней не удалось получить измеримый результат, проблема не в сроке, а в том, что документы или справочники не готовы. Быстрый трёхдневный замер точности мы описывали отдельно в материале про реальную точность распознавания; здесь — полный пилот с пересчётом экономики и решением о продолжении.
Ниже — план по дням, правила сбора честной выборки, три измеряемые величины, критерии продолжения и остановки, назначенные до старта, и рыночная цена такого пилота.
План на десять рабочих дней
Порядок здесь важнее содержания. Самая частая ошибка — начать с прогона, увидеть красивый результат на первых двадцати документах и потерять две недели на настройку того, что и так работало.
- 1Дни 1–2. Сбор выборки
Берётся сплошной срез реального потока за две последние недели: 200 документов подряд, без отбора. Фиксируется, из какого источника пришёл каждый — скан 300 dpi, скан 200 dpi, фотография, PDF из почты. Это и есть главная работа этапа: не найти документы, а сохранить пропорции входа.
- 2Дни 3–4. Эталонная разметка
Человек вручную вводит все поля по каждому документу «как должно быть». 200 документов по 6 минут — это 20 часов оператора и 14 000 ₽ по ставке 700 ₽/час. Дорого и скучно, но без эталона сравнивать нечего: любой разбор потом сведётся к спору о том, что считать ошибкой.
- 3День 5. Первый прогон и срез
Документы прогоняются через контур без всякой доводки, результат сравнивается с эталоном по каждому полю. Это ваша базовая линия — цифра «из коробки», к которой вы будете возвращаться, чтобы понимать, сколько дала настройка.
- 4Дни 6–7. Разбор ошибок и настройка
Ошибки раскладываются по причинам: качество входа, нестандартная вёрстка бланка, отсутствие контрагента в справочнике, неоднозначное поле. Настраивается только то, что относится к вёрстке и правилам извлечения. Чинить качество входа настройкой нельзя — это отдельная работа со сканером и с поставщиками.
- 5День 8. Повторный прогон
Тот же массив, те же 200 документов, тот же эталон. Разница между первым и вторым прогоном показывает потолок настройки: если она меньше 5 процентных пунктов, дальше вкладываться в правила бессмысленно, надо работать со входом.
- 6День 9. Замер минут проверки
Живой человек проверяет 60 документов из выборки в том интерфейсе, в котором будет работать потом, и мы засекаем время. Отдельно — документы без правок и документы с правками: разница между ними обычно в разы и именно она определяет экономику.
- 7День 10. Расчёт и решение
Полученные доли подставляются в формулу окупаемости и сверяются с критериями, записанными до старта. Решение принимается в этот день, а не через месяц раздумий: чем дольше пауза, тем сильнее выборка расходится с реальным потоком.
Горизонтальная лента времени на 10 рабочих дней, семь дорожек: сбор выборки (дни 1–2), эталонная разметка (дни 3–4, помечена как самая дорогая, 20 часов и 14 000 ₽), первый прогон (день 5), разбор ошибок и настройка (дни 6–7), повторный прогон (день 8), замер минут проверки (день 9), расчёт и решение (день 10). Под каждой дорожкой — что остаётся заказчику на выходе. Слева от ленты вертикальная пометка: «критерии остановки записаны до дня 1». Подписи по-русски, чертёжный стиль.
Честная выборка: почему 200 и почему без отбора
Число 200 берётся не из красоты. Доля документов без правки — это доля, и точность её измерения зависит от размера выборки. При наблюдаемой доле около 70 % на 200 документах доверительный интервал составляет примерно ±6 процентных пунктов; на 50 документах он расширяется до ±13, а решение о проекте на полмиллиона рублей по такому замеру принимать нельзя — с равным успехом можно бросить монету.
- Сплошной срез, а не отбор. Берутся все документы подряд за период. Как только кто-то начинает «выбирать хорошие примеры для теста», пилот превращается в демонстрацию, а его результат — в цифру из презентации, только оплаченную вами.
- Пропорции источников сохраняются. Если в реальном потоке 15 % документов — фотографии с телефона, в выборке их тоже должно быть 15 %. Именно эта доля потом двигает итоговый результат сильнее всего.
- Брак включается специально. Помятые, с печатью поверх текста, со сшивкой, с рукописной припиской на полях. Это не «нерепрезентативные случаи», а ваш обычный вторник.
- При нескольких типах — по 60–80 документов на тип. Общая выборка в 200 штук, размазанная на пять типов, не даёт измеримой цифры ни по одному из них. Либо сокращайте число типов в пилоте, либо увеличивайте выборку.
- Документы фиксируются как есть. Никакого предварительного пересканирования и подчистки — иначе вы измерите качество будущего процесса, которого ещё нет.
Схема повторяется из проекта в проект: подрядчик просит «прислать примеры документов», бухгалтер выбирает двадцать самых аккуратных, все радуются 95 % точности, а на промышленном потоке получают 70 %. Формально никто не солгал. Разницу в 25 процентных пунктов оплачивает заказчик — очередью проверки, которой не было в смете. Это одна из восьми типовых ошибок, которые мы собрали в материале про ошибки внедрения распознавания.
Что именно измеряем: три величины
Слово «точность» без уточнения бесполезно, потому что за ним прячутся три разные цифры, и различаются они в разы. В протоколе пилота должны стоять все три.
| Величина | Как считается | Зачем нужна |
|---|---|---|
| Точность по полям | Доля правильно извлечённых значений от общего числа полей во всей выборке | Показывает, где именно ломается извлечение — по конкретным полям, а не вообще |
| Доля документов без единой правки | Документы, в которых верны все поля, к общему числу документов | Главная величина: именно она определяет объём очереди проверки и всю экономику |
| Минуты на проверку | Отдельно для документов без правок и для документов с правками | Переводит доли в часы, а часы — в рубли. Без неё расчёт окупаемости невозможен |
Разрыв между первой и второй величиной кратный и это арифметика, а не пессимизм: если в документе 12 полей и каждое извлекается с точностью 98 %, то вероятность, что верны сразу все двенадцать, — около 78 %. Поэтому вендор честно называет 98 %, а вы честно видите очередь проверки на четверть потока.
Третья величина замеряется на людях и в реальном интерфейсе. Типовые ориентиры: документ без правок оператор пролистывает за 0,3 минуты, документ с правкой занимает 2,6 минуты. Разница почти девятикратная, и именно из-за неё доля без правки важнее любой точности по полям.
Чего ждать по цифрам: зависимость от входа
До пилота полезно понимать порядок величин, чтобы отличить нормальный результат от плохого. Доля документов, проходящих без правки, определяется в первую очередь качеством входа, а не выбором вендора.
| Источник документа | Документов без правки | Что с этим делать |
|---|---|---|
| Скан 300 dpi, ровный лист | 88 % | Рабочий режим, к которому стоит приводить весь поток |
| Скан 200 dpi | 74 % | Поднять разрешение на сканере — самая дешёвая правка в проекте |
| Ровное фото с телефона | 58 % | Допустимо для полевых сотрудников, но не для основного потока |
| Фото с бликом или тенью | 30 % | Возвращать на переснятие: проверка дороже пересъёмки |
| Рукописный текст | 0–15 % | Не распознавать вовсе, вводить руками или менять форму документа |
Итоговая цифра пилота — взвешенная по вашей смеси источников. Для модельного потока из 55 % сканов 300 dpi, 25 % сканов 200 dpi, 15 % ровных фото и 5 % фото с бликом получается 0,55 × 88 % + 0,25 × 74 % + 0,15 × 58 % + 0,05 × 30 % = 77,1 % документов без правки. Это и есть то число, которое надо подставлять в расчёт окупаемости вместо вендорских 94 %.
Столбиковая диаграмма. Пять столбцов по источникам с подписями долей: «Скан 300 dpi — 88 %», «Скан 200 dpi — 74 %», «Ровное фото — 58 %», «Фото с бликом — 30 %», «Рукопись — 0–15 %» (последний столбец нарисован диапазоном). Поверх диаграммы горизонтальная пунктирная линия на отметке 77,1 % с подписью «взвешенная доля при смеси 55/25/15/5». Ось Y — доля документов без единой правки, в процентах. Подписи по-русски.
Пересчёт экономики по итогам пилота
Финальный день пилота — это подстановка измеренных долей в ту же формулу, по которой считалась предварительная смета. Модельный поток — 2 400 накладных в месяц, ставка оператора 700 ₽/час, коэффициент реализации часов 0,6, постоянные расходы контура 31 376 ₽ и переменные 7,15 ₽ на документ.
Сравните с предварительной сметой. В ней проверка закладывалась в 0,42 минуты на документ, что соответствует примерно 94 % документов без правки, и окупаемость выходила 9,3 месяца. Пилот дал 77,1 % и 10,9 месяца. Проект остался выгодным, но полтора месяца окупаемости — это разница, из-за которой стоило потратить две недели и 137 000 ₽. В половине случаев эта же арифметика показывает, что проект начинать не надо, и тогда пилот экономит уже сотни тысяч.
Критерии остановки записываются до старта
Это единственное правило, нарушение которого превращает пилот в ритуал. Если условия успеха формулируются после того, как получены цифры, они всегда подгоняются под цифры — не из злого умысла, а потому, что за две недели работы к проекту привыкают.
| Показатель | Продолжаем | Останавливаемся |
|---|---|---|
| Доля документов без единой правки | 70 % и выше | Ниже 55 % |
| Минуты на документ с правкой | До 2,5–3 минут | Больше 4 минут |
| Ошибки в критичных полях: сумма, ИНН, номер | Меньше 15 % всех ошибок | Больше трети всех ошибок |
| Расчётная окупаемость | До 12 месяцев | Больше 18 месяцев |
| Прирост от настройки между прогонами | 5 процентных пунктов и выше | Меньше 2 пунктов при плохом входе |
Отдельно про третью строку. Ошибка в наименовании позиции стоит минуты правки, ошибка в сумме или ИНН — искажённой отчётности и, возможно, спора с контрагентом. Поэтому доля ошибок в критичных полях считается отдельно от общей: контур с точностью 85 %, который ошибается только в наименованиях, лучше контура с точностью 92 %, который путает суммы.
Сколько стоит пилот и что он обязан оставить
Пилот на одном типе документа и выборке в 200 штук — это примерно 40 часов инженера и 20 часов оператора на разметку: около 137 000 ₽ по ставкам 3 000 ₽ и 700 ₽ за час, плюс несколько тысяч на обработку двух прогонов. Рыночная вилка — 90 000–200 000 ₽. Пилот на нескольких типах и десятках тысяч документов — это другой жанр: от 500 000 ₽ и 4–6 недель.
Дешевле не значит лучше. Пилот за 30 000 ₽ почти всегда означает, что эталонной разметки в нём нет, а результат оценивается на глаз — то есть покупается не измерение, а впечатление. Проверять надо не цену, а состав того, что остаётся у вас после.
- 1Размеченная выборка из 200 документов. Она же становится регрессионным набором: через полгода на ней проверяют, не деградировал ли контур после обновления модели.
- 2Протокол замера с методикой. Что считалось, как считалось, какие поля признавались критичными. Через год повторить замер должно быть возможно без участия того же подрядчика.
- 3Таблица точности по каждому полю. Не одна цифра «точность 88 %», а список: сумма, дата, номер, ИНН, наименование позиции, количество, цена — с точностью по каждому.
- 4Требования к скану на одну страницу. Разрешение, формат, что делать с помятыми и с бликами. Это документ для тех, кто сканирует, а не для инженера.
- 5Настройки извлечения, которые переносятся дальше. Пилот, после которого всё настраивается заново с нуля, оплачен зря; правила и обученные модели обязаны переезжать в промышленный контур.
- 6Расчёт по вашим ставкам и вашему объёму. С прозрачной арифметикой, которую вы можете повторить на калькуляторе и оспорить построчно.
Когда пилот не нужен
Есть три ситуации, в которых две недели и 137 000 ₽ можно не тратить, — и в двух из них ответ известен заранее.
- Поток ниже порога окупаемости. Если документов меньше тысячи в месяц, результат пилота не изменит решения: даже при точности 95 % контур не выйдет в операционный ноль. Считать надо сначала объём, потом точность — методика в материале про окупаемость OCR по объёму.
- Документ можно получать данными, а не картинкой. Если поставщик присылает PDF, а может присылать электронный документ через оператора ЭДО, пилот распознавания измеряет качество решения задачи, которой не должно существовать. Договориться об обмене почти всегда дешевле.
- На вход идут рукописные документы. При доле без правки 0–15 % проверять придётся практически всё. Здесь пилот подтвердит очевидное, а решение всё равно будет одно: менять форму документа или вводить руками.
И обратная сторона. Если справочники контрагентов и номенклатуры в беспорядке, пилот покажет плохой результат не по вине распознавания: машина не сможет подставить контрагента, которого в справочнике три версии. В этом случае пилот стоит отложить на пару недель и сначала навести порядок в данных — как это делается, разбирали в материале про подготовку данных перед внедрением. Иначе вы измерите качество своих справочников и назовёте это точностью OCR.
Пилот стоит своих денег ровно тогда, когда вы заранее готовы услышать от него «нет».
