Обещанные «99 % точности» — это, как правило, точность по символам, и к вашему процессу она отношения почти не имеет. Бизнес интересует другая величина: какая доля документов проходит от приёма до проводки без единого прикосновения человека. На одном и том же потоке эти два числа расходятся в разы — 99,4 % по символам легко соседствует с 78 % документов без правки. Обе цифры честные, просто вторую в презентации не показывают, потому что она выглядит скромнее.

Разберём три способа измерения и то, почему разрыв между ними кратный, дадим реалистичные диапазоны по типам документов и по качеству скана, а главное — покажем, что делать с остатком ошибок. Потому что ноль ошибок не даст никто, а вот разница между «ошибку поймали и она стоила полторы минуты» и «ошибку нашли на квартальной сверке» измеряется десятками тысяч рублей в месяц.

Все расчёты модельные, на прозрачных вводных, состояние рынка — на сентябрь 2026 года. Ставки во всей статье одни: бухгалтер 540 ₽/час с налогами и взносами, инженер 3 000 ₽/час, главный бухгалтер и руководитель 1 200 ₽/час усреднённо. Диапазоны точности — ориентиры, которые мы видим на пилотах, а не гарантия: свою цифру вы узнаете только на своих документах.

Три метрики, между которыми разрыв в разы

Слово «точность» в разговоре о распознавании означает как минимум три разные величины, и путаница между ними — причина большинства разочарований после запуска. Разложим их по тому, кто ими пользуется.

МетрикаЧто именно считаетКто её называетТипичное значение
Точность по символамДоля верно распознанных знаков от общего числа знаков на страницеВендор в презентации и в маркетинговых материалах98,5–99,8 % на ровных сканах
Точность по полюДоля полей, извлечённых целиком верно: ИНН, номер, дата, сумма, строка таблицыИнженер при приёмке и при отладке94–99 % в зависимости от поля
Доля документов без правкиДоля документов, где верны все поля сразу и человек вообще не потребовалсяБухгалтерия — потому что именно она переводится в часы и в деньги55–95 % в зависимости от типа и качества
Доля незамеченных ошибокДоля документов, где ошибка есть, но система не пометила поле как сомнительное и пропустила его в проводкуОбычно никто, и это главная проблема0,1–1,5 %, и именно её надо нормировать

Четвёртая строка — не бонус к трём предыдущим, а самая важная из четырёх. Ошибка, которую система заметила и отправила человеку, стоит полторы минуты работы и не выходит за пределы бухгалтерии. Ошибка, которую она пропустила молча, живёт до акта сверки с поставщиком или до закрытия квартала и стоит на два порядка дороже. Требовать в договоре «99 % точности» бессмысленно; требовать «не более 0,3 % незамеченных ошибок в критичных полях» — осмысленно и проверяемо.

графикrealnaya-tochnost-raspoznavaniya--01
Четыре столбца метрик на одном потоке: 99,4 %, 96,0 %, 78 % и 0,9 % незамеченных ошибок

Столбчатая диаграмма из четырёх столбцов на одном и том же потоке документов. Столбец 1 «По символам — 99,4 %», столбец 2 «По полям — 96,0 %», столбец 3 «Документов без правки — 78 %», столбец 4 нарисован отдельно и красным, снизу вверх от нулевой линии: «Незамеченные ошибки — 0,9 %». Первые три подписаны «то, что называют», четвёртый — «то, что стоит денег». Ось Y — проценты от 0 до 100. Подписи по-русски, чертёжная графика.

Один поток, одна система, четыре разные цифры. В договор идёт последняя, а не первая

Почему разрыв кратный: это арифметика, а не пессимизм

Причина разрыва между метриками не в том, что кто-то приукрашивает. Она в том, что документ считается верным, только если верны все его поля сразу, а поле — только если верны все его знаки. Вероятности перемножаются, и на длинных полях это даёт обвал. Возьмём мысленный эксперимент: пусть ошибки распознавания независимы и никакими проверками не ловятся.

Точность по символуИНН, 10 знаковРасчётный счёт, 20 знаковНаименование позиции, 40 знаковДокумент из 14 полей, ~210 знаков
99,0 %90,4 %81,8 %66,9 %12 %
99,5 %95,1 %90,5 %81,8 %35 %
99,8 %98,0 %96,1 %92,3 %66 %
99,95 %99,5 %99,0 %98,0 %90 %

Правый нижний угол таблицы объясняет, почему разница между вендором с 99,8 % и вендором с 99,0 % не «на восемь десятых процента», а в пять с половиной раз по конечному результату. Он же объясняет, почему на длинных документах — УПД с двумя десятками реквизитов, ТОРГ-12 с тридцатью позициями — доля документов без правки принципиально ниже, чем на коротком счёте: полей больше, произведение меньше.

Реальность, к счастью, устроена лучше этой модели, и ровно по двум причинам. Первая: ошибки не независимы. Плохо пропечатанный участок губит целую зону страницы сразу, а не по знаку тут и там, поэтому распределение получается не гладким, а двугорбым — документ либо проходит целиком чисто, либо разваливается. Практический вывод из этого приятный: работать надо не с «повышением точности вообще», а с двумя-тремя причинами, которые роняют плохую половину.

Из той же арифметики следует правило, которое экономит деньги на любом проекте: не требуйте полей больше, чем вам действительно нужно. Документ считается прошедшим без правки, только если верны все поля сразу, поэтому каждое лишнее обязательное поле удлиняет очередь проверки, ничего не добавляя учёту. Если подписант, номер спецификации и адрес грузополучателя в вашей учётной системе не используются — не вносите их в нормируемые требования, извлекайте справочно. На типовом счёте отказ от четырёх необязательных полей поднимает долю документов без правки на 3–6 процентных пунктов и не стоит ни рубля.

Вторая причина: ошибки ловятся внешними правилами. У ИНН есть контрольный разряд, у расчётного счёта — контрольная сумма по БИК, у документа — арифметика (количество × цена = сумма строки, сумма строк = итог), у контрагента — справочник, у договора — номер, который либо есть у этого контрагента, либо нет. Каждая такая проверка не повышает точность распознавания ни на процент, но переводит ошибку из категории «незамеченная» в категорию «помеченная». Вся инженерия качества в распознавании — про этот перевод, а не про модели.

графикrealnaya-tochnost-raspoznavaniya--02
Кривые доли чистых документов при 99, 99,5 и 99,8 процента по символу и росте числа полей

Линейный график. Ось X — число извлекаемых полей в документе от 5 до 30. Ось Y — доля документов, в которых верны все поля, от 0 до 100 %. Три убывающие кривые с подписями «99,0 % по символу», «99,5 %» и «99,8 %». На отметке 14 полей вертикальная штриховая линия с подписью «типовой счёт» и точками 12 %, 35 % и 66 % на трёх кривых. На отметке 26 полей вторая линия с подписью «УПД». Внизу ремарка: «модель без проверок — реальные системы вытягивают это четвёртым слоем». Подписи по-русски.

Чем больше полей в документе, тем ниже доля чистых. Поэтому у счёта и у УПД разные нормы

Реалистичные диапазоны по типам документов

Ниже — ориентиры, которые мы видим на пилотах в 2026 году на российских системах распознавания при исправно настроенном слое проверки. Это диапазоны, а не гарантии, и внутри каждой строки разброс между двумя компаниями обычно больше, чем разброс между двумя вендорами на одной и той же компании. Читать таблицу нужно как рамку ожиданий: если вам обещают выше верхней границы — просите померить, если получилось ниже нижней, дело почти всегда в первом слое, то есть в качестве входящих изображений.

Тип документаКак приходитТочность по полюДокументов без правки
Счёт на оплатуPDF с текстовым слоем из учётной системы поставщика99,5–100 %92–98 %
Счёт на оплатуСкан 300 dpi, плоский сканер98,5–99,5 %82–93 %
Акт выполненных работ, свободная формаСкан 300 dpi96,5–99 %70–85 %
УПД или счёт-фактураСкан 300 dpi98–99,5 %72–88 %
ТОРГ-12 с двадцатью и более позициямиСкан 300 dpi97–99 %55–75 %
Банковская выпискаPDF из клиент-банка99,5–100 %95–99 %
Любой из перечисленныхРовное фото с телефона при дневном свете95–98,5 %45–70 %
Любой из перечисленныхФото с бликом, тенью или перекосом85–95 %15–45 %
Любой из перечисленныхКопия с копии, печать поверх текста, факс82–94 %20–45 %
Накладная, заполненная от рукиСкан 300 dpi60–85 % по отдельным полям0–15 %

Отдельная строка разговора — что происходит с документом, который система уверенно прочитала, но который вообще не должен был попасть в этот поток. Здесь помогает не точность, а классификация типа до распознавания: она отсеивает посторонние файлы и раскладывает поток по маршрутам, и на разнородном входящем потоке её ставят первой. Состав и цену этой задачи мы разбирали на странице решения «Классификация документов».

Три вывода, которые из таблицы следуют сразу. Первый: тип документа задаёт потолок, и обещать по ТОРГ-12 с тридцатью позициями те же 95 %, что по счёту, никто не может — полей больше. Второй: качество входа двигает результат сильнее, чем выбор вендора: одна и та же строка «счёт на оплату» даёт 92–98 % в текстовом PDF и 15–45 % на кривом фото. Третий: нормировать надо по типам раздельно, иначе средняя цифра по потоку скрывает и хорошие, и катастрофические участки.

сравнениеrealnaya-tochnost-raspoznavaniya--03
Полосы доли документов без правки по типам: от 95-99 % у выписки до 0-15 % у рукописной

Горизонтальная линейчатая диаграмма: строки — типы документов, длина полосы — диапазон доли документов без правки. Строки сверху вниз: «Банковская выписка, PDF — 95–99 %», «Счёт, PDF с текстом — 92–98 %», «Счёт, скан 300 dpi — 82–93 %», «УПД, скан — 72–88 %», «Акт свободной формы — 70–85 %», «ТОРГ-12, 20+ позиций — 55–75 %», «Фото с телефона ровное — 45–70 %», «Фото с бликом — 15–45 %», «Рукописная накладная — 0–15 %». Полосы показывают вилку, а не одно значение. Подписи по-русски, ось X в процентах.

Норма точности бывает только по типу документа. Средняя цифра по всему потоку не значит ничего

Качество скана решает больше, чем выбор вендора

Самый частый сценарий провала пилота выглядит так: сравнили трёх вендоров, выбрали лучшего, запустились — и получили вдвое меньше обещанного. Причина почти никогда не в вендоре. Сравнение проводили на аккуратной выборке, которую собрал главный бухгалтер, а в бой пошёл настоящий поток, где треть документов сфотографирована на телефон в машине.

  • Разрешение ниже 300 dpi. На 200 dpi мелкий шрифт в табличной части перестаёт читаться устойчиво, и доля документов без правки падает на 8–20 процентных пунктов. Это не лечится ни моделью, ни деньгами.
  • Перекос 2–3°. Строки таблицы перестают выстраиваться в ряды, извлечение позиций разваливается сильнее, чем извлечение шапки. Автоматическое выравнивание помогает, но не полностью.
  • Печать или штамп поверх суммы. Синий оттиск через сумму итога — почти гарантированная отправка документа в очередь. Дешёвое организационное решение: попросить крупных поставщиков ставить печать в отведённое поле.
  • Тень и блик на фотографии. Две главные причины провала снимков с телефона, и обе устраняются инструкцией на полстраницы, а не софтом.
  • Копия с копии. Каждое поколение копирования съедает контраст мелкого шрифта; на третьем поколении разбор табличной части становится лотереей.
Сканер и полстраницы регламента дешевле сорока часов доработки

Потоковый сканер на 40–60 страниц в минуту стоит 60 000–150 000 ₽. Вместе с регламентом «сканируем в 300 dpi, чёрно-белым, без наклона, каждый документ отдельным файлом» он поднимает долю документов без правки на 10–25 процентных пунктов. Сорок часов доработки извлечения полей стоят 120 000 ₽ и такой прибавки не дают никогда. Прежде чем платить за улучшение моделей, посмотрите, чем и как в вашей компании сканируют документы — и кто это делает.

Есть и вторая половина того же разговора — кто именно сканирует. Если документы фотографирует кладовщик на бегу, а счета пересылает менеджер из машины, регламент не сработает, пока у этого действия нет владельца и удобного способа. Работающий вариант — точка приёма: одно место, один потоковый сканер, один ответственный и правило для поставщиков «присылайте документ файлом, а не бумагой». Перевод даже трети потока из фотографий в текстовый PDF поднимает долю документов без правки сильнее, чем любая доработка распознавания, и стоит переписки с контрагентами, а не денег.

графикrealnaya-tochnost-raspoznavaniya--04
Доля документов без правки по качеству входа: 95 % у текстового PDF и 30 % у плохого фото

Столбчатая диаграмма для одного типа документа (счёт на оплату) при пяти способах поступления. Столбцы слева направо: «PDF с текстовым слоем — 95 %», «Скан 300 dpi — 88 %», «Скан 200 dpi — 74 %», «Ровное фото с телефона — 58 %», «Фото с бликом и перекосом — 30 %». Над крайними столбцами скобка с подписью «разброс 65 процентных пунктов на одной и той же системе». Ось Y — доля документов без правки, 0–100 %. Подписи по-русски, чертёжная графика.

Одна система, один тип документа, пять способов получить его на вход. Разброс — 65 процентных пунктов

Как замерить на своих документах за три дня

Демонстрация вендора на его наборе документов не говорит о вашем потоке ничего. Единственный способ получить свою цифру — замер на своей сплошной выборке. Он делается до подписания договора на внедрение и стоит около одной восьмой проекта — вилки по направлениям и состав типовых бюджетов собраны на страницах «Цены» и «Бюджеты», и от них удобно считать эту долю применительно к своему случаю.

  1. 1
    Сплошная выборка 200 документов

    Берите подряд всё, что пришло за две последние недели, а не «показательные» экземпляры. Косые фотографии, копии с копий и счета от мелких поставщиков должны попасть в выборку ровно в той пропорции, в какой они приходят в жизни. Если выборку формирует вендор — замер бессмыслен.

  2. 2
    Эталонная разметка

    Для каждого документа выпишите руками верные значения 12–15 полей: реквизиты сторон, номер, дату, суммы, ставку, банковские реквизиты, договор. Около трёх минут на документ, десять часов работы. Без эталона сравнивать результат не с чем, и любой спор с подрядчиком превращается в спор о вкусах.

  3. 3
    Прогон через две-три системы

    Обязательно один и тот же набор документов во всех системах. Разные наборы у разных вендоров делают сравнение бессмысленным, а именно так его обычно и проводят.

  4. 4
    Подсчёт четырёх чисел

    Считайте раздельно: точность по полю (по каждому полю отдельно, а не в среднем), долю документов, где верны все поля, долю документов, ушедших в очередь, и долю документов, где ошибка есть, но поле не помечено как сомнительное. Четвёртое число — главное, и оно единственное, которое вендор вам сам не посчитает.

  5. 5
    Разбор двадцати худших

    Возьмите двадцать документов с наибольшим числом ошибок и найдите причину поимённо: перекос, разрешение, печать поверх суммы, редкая форма, рукописная вставка. Больше половины причин чинится регламентом сканирования, а не покупкой софта, — и это самая полезная страница отчёта о замере.

Сколько стоит честный замер на своей выборке
Сплошная выборка 200 документов, выгрузка и обезличивание: 3 ч × 540 ₽/час1 620 ₽
Эталонная разметка: 200 документов × 3 минуты, 10 ч × 540 ₽/час5 400 ₽
Прогон через две системы и сведение результатов: 8 ч × 3 000 ₽/час24 000 ₽
Разбор двадцати худших случаев и отчёт о причинах: 4 ч × 3 000 ₽/час12 000 ₽
Итого43 020 ₽ и три рабочих дня — против проекта на 350 000 ₽, который иначе начинается вслепую

Что делать с остатком ошибок

Ноль ошибок не даст никто, и это не оговорка в договоре, а свойство задачи. Инженерный ответ на остаток — не «повысить точность», а разложить поток на корзины так, чтобы каждая ошибка попадала туда, где её дёшево поймать.

Что это значитПорог уверенности

Число от нуля до единицы, ниже которого извлечённое значение считается сомнительным и документ уходит человеку. Порог не измеряет правильность — он измеряет, насколько уверенно система прочитала знак или собрала поле. Настраивается он не «по науке», а по вашей экономике: чем дороже пропущенная ошибка, тем выше порог и тем длиннее очередь проверки.

  1. 1
    Корзина первая: автоматический проход

    Все поля выше порога уверенности, все внешние проверки сошлись — документ создаётся в учётной системе без человека. В работающем конвейере на смешанном потоке сюда попадает 75–90 % документов, и именно эта доля переводится в сэкономленные часы.

  2. 2
    Корзина вторая: очередь проверки

    Хотя бы одно поле ниже порога или не сошлась хотя бы одна проверка. Человек видит скан рядом с формой, подсвеченное спорное поле и конкретную претензию — «сумма строк меньше итога на 1 200 ₽». Он правит одно значение, а не вводит документ заново: полторы-две с половиной минуты вместо шести.

  3. 3
    Корзина третья: возврат

    Изображение негодное — разрешение ниже минимума, страница обрезана, документ не того типа. Такие уходят на пересканирование или на запрос оригинала у поставщика, не тратя ни токенов, ни времени проверяющего. Отдельная корзина нужна, чтобы брак изображений не растворялся в общей очереди и был виден на панели.

  4. 4
    Поверх корзин: сплошной контроль критичных событий

    Независимо от уверенности всегда проверяются человеком документы, где сумма выше установленного лимита, контрагент новый, документ первый по договору или сумма отличается от заказа больше чем на согласованный процент. Это правило живёт не в модели, а в коде — его нельзя обойти высокой уверенностью.

схема процессаrealnaya-tochnost-raspoznavaniya--05
Схема трёх корзин: автопроход 85 %, очередь проверки 15 %, возврат, плюс сплошной контроль

Схема сверху вниз. Блок «Документ после проверок» → ромб «Все поля выше порога и проверки сошлись?». Ветка «да» → блок «Автоматический проход, 75–90 % потока» → «Учётная система». Ветка «нет» → блок «Очередь проверки, 1,5–2,5 мин на документ». Отдельная ветка «изображение негодное» → блок «Возврат на пересканирование». Сбоку, поверх ромба, отдельный блок «Сплошной контроль: сумма выше лимита, новый контрагент, первый документ по договору» со стрелкой напрямую в «Очередь проверки» и подписью «обходит порог». Подписи по-русски, чертёжная графика.

Порог уверенности делит поток на три корзины. Четвёртое правило работает поверх порога и обходит его

Сколько должна стоить очередь проверки

Очередь проверки — расход, и владельцы регулярно спрашивают, нельзя ли её сократить или, наоборот, проверять всё подряд для надёжности. Оба варианта проигрывают. Посчитаем на потоке 3 000 документов в месяц, где 1,2 % документов уходят в проводку с незамеченной ошибкой.

Что стоит квартал незамеченных ошибок при потоке 3 000 документов в месяц
Разбор расхождений на актах сверки: 108 документов за квартал × 25 мин × 540 ₽/час24 300 ₽
Исправление проводок и повторное закрытие периода: 16 ч × 540 ₽/час8 640 ₽
Три оплаченных дубля по 85 000 ₽: возврат средств и переписка, 3 × 4 ч × 540 ₽/час6 480 ₽
Задержка закрытия квартала на три дня: главный бухгалтер и руководитель, 12 ч × 1 200 ₽/час14 400 ₽
Итого53 820 ₽ за квартал, около 17 900 ₽ в месяц — притом что сами дубли вернулись и прямых потерь денег не было

Теперь другая чаша весов. Проверка одного документа в очереди занимает полторы минуты и стоит 13,5 ₽ при ставке 540 ₽/час. Посмотрим, как меняются суммарные потери в зависимости от того, какую долю потока мы отправляем человеку.

Доля потока в очередьЧасов в месяцСтоимость очередиОценка потерь на незамеченных ошибкахИтого в месяц
0 %00 ₽30 000 ₽30 000 ₽
5 %3,82 000 ₽22 000 ₽24 000 ₽
15 %11,36 100 ₽11 000 ₽17 100 ₽
30 %22,512 200 ₽6 500 ₽18 700 ₽
60 %45,024 300 ₽3 000 ₽27 300 ₽
100 %75,040 500 ₽1 500 ₽42 000 ₽

Оставшиеся после очереди ошибки ловит следующий рубеж — регулярная сверка проведённых документов с контрагентами и с банковскими выписками. Это отдельная задача со своей ценой и своими сроками, мы описали её состав на странице решения «Автоматическая сверка документов». Держать её в голове полезно уже при проектировании порога: чем плотнее сверка, тем спокойнее можно опустить долю очереди и сэкономить часы бухгалтерии.

Кривая имеет минимум, и он лежит в районе 15–20 % потока. Слева от минимума экономия на проверке оплачивается сверками и уточнениями. Справа — вы платите за проверку документов, которые и так были верны. Последняя строка отдельно поучительна: сплошной контроль не даёт нуля, потому что человек на монотонной проверке тоже ошибается — по нашим наблюдениям на приёмке это 0,3–1 ошибка на сто документов. Сравнивать машину надо с этой цифрой, а не с воображаемым безошибочным сотрудником.

Главное свойство хорошей системы — не точность, а совпадение сомнения с ошибкой

Пятнадцать процентов потока, отобранных случайно, поймают пятнадцать процентов ошибок. Те же пятнадцать процентов, отобранных по низкой уверенности и по несошедшимся проверкам, поймают 60–80 %. Разница между хорошей и посредственной системой распознавания измеряется именно этим, а не десятыми долями точности в презентации. При сравнении вендоров спрашивайте не «какая у вас точность», а «какая доля ваших ошибок попадает в очередь».

графикrealnaya-tochnost-raspoznavaniya--06
U-образная кривая суммарных потерь с минимумом 17 100 рублей при доле очереди 15 процентов

График с осью X «доля потока, отправляемая в очередь проверки» от 0 до 100 % и осью Y в рублях в месяц от 0 до 45 000. Три линии: восходящая «стоимость очереди» (0 → 40 500 ₽), нисходящая «потери на незамеченных ошибках» (30 000 → 1 500 ₽) и жирная U-образная «итого», с отмеченной точкой минимума 17 100 ₽ при 15 %. Точка минимума подписана «оптимум». Справа у отметки 100 % ремарка «сплошной контроль: 42 000 ₽ и всё равно не ноль — человек тоже ошибается». Подписи по-русски.

Сплошной контроль дороже ошибок, которые он ловит. Минимум — около 15–20 % потока в очередь

Критичные поля: где ошибка стоит дороже всего

Не все поля равны. Ошибка в наименовании позиции стоит недоразумения, ошибка в расчётном счёте — недели на возврат платежа. Поэтому порог уверенности задают не один на документ, а по полям, и на критичные ставят заведомо жёстче.

ПолеЧем ловится ошибкаЧего стоит незамеченная ошибка
Сумма к оплатеСумма строк табличной части, сверка с заказом или договором, лимит суммыПереплата поставщику либо недоплата и просрочка с пенями по договору
ИНН контрагентаКонтрольный разряд по алгоритму ФНС, справочник контрагентов, действующий статус в ЕГРЮЛДокумент висит на чужом контрагенте: разъезжаются сверки, появляются вопросы к вычету
Расчётный счёт и БИККонтрольная сумма счёта по БИК, справочник БИК Банка РоссииПлатёж уходит не туда. Возврат занимает от недели, а иногда требует переписки с банком получателя
Номер и дата документаФормат, попадание в открытый период, поиск дубля по связке ИНН + номер + дата + суммаДвойная оплата одного счёта либо потерянный документ, всплывающий на закрытии
Ставка и сумма налогаПересчёт суммы налога от итога по ставке, справочник ставок, отдельная ветка для документов без налогаРасхождение в отчётности и уточнёнка. Особенно частая ошибка после изменения ставок
Номер и дата договораСправочник договоров именно этого контрагента, срок действияРасход не привязан к проекту или объекту — ломается управленческий учёт и распределение затрат
Строки табличной частиКоличество × цена = сумма строки, сопоставление со справочником номенклатуры, история закупокНеверная себестоимость и неверные остатки на складе — ошибка расходится дальше по учёту

Точность — не константа: что с ней происходит через полгода

Цифра, измеренная на приёмке, — снимок конкретного состава потока в конкретный месяц. Через полгода состав другой: пришли новые поставщики со своими бланками, старые поменяли формы, склад начал фотографировать документы на телефон вместо сканера, а в справочнике номенклатуры завели три варианта одной и той же позиции. Доля документов без правки при этом дрейфует, и почти всегда вниз — если за ней никто не смотрит.

Дрейф бывает двух видов, и лечатся они разными людьми. Медленный: доля очереди растёт на процент-полтора в месяц равномерно по всему потоку — это почти всегда справочники, номенклатура распухла и сопоставление перестало быть однозначным. Резкий: по одному поставщику доля очереди за неделю прыгает с 5 до 40 % — он поменял бланк. Первое чинит хозяин справочников за несколько часов, второе — инженер за пару часов. Оба случая чинятся быстро при одном условии: их видно.

  • Доля документов без правки за неделю и за месяц, с трендом. Одно число, которое смотрит руководитель.
  • Та же доля в разрезе поставщиков и типов документов — резкий рост по одному поставщику виден сразу и означает новый бланк.
  • Доля незамеченных ошибок по выборочной сверке: тридцать случайных проведённых документов в месяц сверяются с оригиналом вручную. Это около 45 минут работы и единственный способ увидеть то, чего система про себя не знает.
  • Распределение потока по источнику и качеству входа. Если доля фотографий выросла с 5 до 20 %, цифры упадут не по вине системы, и чинить надо не её.
  • Список форм, по которым за месяц выросло число исключений, — рабочая очередь задач для поддержки на следующий месяц.

Стоимость такого надзора — 3–4 часа в месяц вместе с выборочной сверкой, то есть меньше 2 200 ₽ при ставке 540 ₽/час. Он окупается первым же пойманным дрейфом. Компании, которые надзор не завели, обычно узнают о деградации от главного бухгалтера в конце квартала — через три месяца после того, как она началась, и уже вместе с накопленными расхождениями в сверках.

Как записать требование к точности в договор

Формулировка «система обеспечивает точность распознавания не менее 99 %» бесполезна для обеих сторон. В ней не сказано, по чему считать, на какой выборке, кто её формирует, что считается ошибкой и что происходит с ошибкой дальше. На приёмке такая строка превращается в спор, который выигрывает тот, кто упрямее.

  • Назовите метрику явно: доля документов, прошедших от приёма до записи в учётную систему без правки человеком. Не «точность», не «качество распознавания».
  • Назовите выборку и того, кто её формирует: 300 документов сплошного входящего потока за две произвольные недели, выборку формирует заказчик. Иначе замер делается на удобных документах.
  • Разделите цель по типам: счета из PDF с текстовым слоем — не менее 92 %, сканы счетов и актов 300 dpi — не менее 80 %, УПД — не менее 72 %, фотографии с телефона — измеряем, но не нормируем.
  • Впишите отдельным жёстким пунктом долю незамеченных ошибок в критичных полях — сумма, ИНН, расчётный счёт, номер и дата: не более 0,3 % документов. Каждый такой случай разбирается, и правило проверки дописывается за счёт исполнителя.
  • Назовите минимальное качество входа, ниже которого исполнитель не отвечает: разрешение, отсутствие перекоса свыше нормы, один документ — один файл. Без этого пункта спор всегда упирается в то, кто виноват в кривых сканах.
  • Перенесите замер на третий месяц эксплуатации, а не на день сдачи. Первые недели уходят на пополнение справочников, и цифра в день сдачи не отражает установившийся режим.
  • Опишите порядок разбора: журнал, где по каждому документу видно, что вернуло распознавание, какие проверки сработали и кто что правил. Без журнала спор о причине ошибки неразрешим в принципе.
сравнениеrealnaya-tochnost-raspoznavaniya--07
Сравнение формулировок в договоре: расплывчатое требование 99 процентов и проверяемое по типам

Две карточки-документа рядом, одинаковые по вёрстке, стилизованные под приложение к договору. Левая с заголовком «Обычная формулировка» и текстом «Система обеспечивает точность распознавания не менее 99 %», внизу красная пометка «непроверяемо: не названы метрика, выборка и что считать ошибкой». Правая с заголовком «Проверяемая формулировка» и списком строк: «Метрика: доля документов без правки», «Выборка: 300 документов, формирует заказчик», «Счёт из PDF — не менее 92 %», «Скан счёта 300 dpi — не менее 80 %», «Незамеченные ошибки в критичных полях — не более 0,3 %», «Замер на третий месяц эксплуатации». Внизу зелёная пометка «принимается по числам». Подписи по-русски, без реальных названий компаний.

Слева — строка, по которой невозможно принять работу. Справа — по которой можно

Последнее, о чём стоит договориться на берегу, — что делает исполнитель, если цифра не набралась. Наша позиция описана на странице «Гарантии»: дефект извлечения и дефект проверок мы правим за свой счёт и переизмеряем, а качество входящих изображений и наполнение справочников честно остаются на стороне заказчика. Формулировать это надо до подписания, потому что после первого неудачного замера любая договорённость выглядит как уступка.

Когда мерить не нужно, потому что дешевле нанять оператора

Замер и договорные метрики имеют смысл, только если проект в принципе окупается. Ниже случаи, в которых честный ответ — не автоматизировать, и мы говорим это до договора.

  • Поток меньше 640 документов в месяц. Постоянные расходы — поддержка, инфраструктура, часы на справочники — около 30 000 ₽ в месяц и съедают всю экономию. Оператор на неполный день закрывает такой объём дешевле.
  • Ставка обработки существенно ниже 540 ₽/час. При 210 ₽/час порог окупаемости уезжает с 640 примерно до 2 100 документов в месяц. Ваша ставка влияет на решение сильнее, чем любое свойство технологии.
  • Документы заполнены от руки целиком. Доля документов без правки — от нуля до 15 %, человек всё равно перечитает каждый, и вы платите и за распознавание, и за оператора.
  • Некому вести справочники. Очередь проверки живёт на актуальной номенклатуре, договорах и контрагентах. Если этим не занимается конкретный человек с выделенными часами, очередь не сокращается со временем, а растёт — и весь расчёт разваливается.
  • Документы нужны один раз: разовая оцифровка архива без последующего потока. Конвейер окупается потоком, а потока не будет.
  • В компании нет согласия о том, кто принимает и согласовывает документ. Распознавание в этом случае просто ускорит поступление документов в место, где они и так застревают.

И честная оборотная сторона: часть выигрыша посчитать заранее нельзя, и мы держим её за пределами таблиц как запас прочности. Скорость закрытия месяца, отсутствие поиска оригиналов перед проверкой, дисциплина по срокам оплаты, исчезнувший вопрос «а где счёт от вторника» — всё это реальные эффекты, которые владельцы называют главными через полгода после запуска. Но обещать их числом мы не будем, потому что честно померить их до внедрения невозможно.

Требовать от распознавания нуля ошибок — то же самое, что требовать его от человека. Требовать надо, чтобы ни одна ошибка в критичном поле не прошла молча.