Проекты распознавания документов проваливаются не разнообразно, а очень однотипно: платформу выбрали до замера на своих документах, вход не тронули, справочники не почистили, проверку человеком не заложили, а объём посчитали в документах вместо строк. Хорошая новость в том, что семь из восьми ошибок видны ещё в смете и техническом задании, то есть до того, как потрачен первый рубль.

Ниже — восемь ошибок с признаком каждой на старте, ценой в рублях и способом исправления. Расчёты модельные, на потоке 3 000 документов в месяц, ставка бухгалтера 844 ₽/час и инженера 3 000 ₽/час, ориентиры — на сентябрь 2026 года.

Ошибка 1. Платформу выбрали до замера на своих документах

Признак на старте: в смете уже стоит название вендора, а выборки из своих документов ещё нет. Проблема не в вендоре — российские решения на 2026 год сопоставимы между собой, — а в том, что разброс результата между двумя компаниями на одном продукте больше, чем между двумя продуктами на одной компании. Ваша цифра зависит от качества сканов, состава поставщиков и длины документов, а не от логотипа в презентации.

Чинится дешевле всего: 200 своих документов, эталонная разметка, прогон в двух-трёх системах, сравнение по полям. Это неделя работы и она отвечает на вопрос, на который презентация не отвечает никогда. Как читать полученные цифры и почему «99 %» и «78 %» — это одно и то же измерение с разных сторон, разобрано в материале о реальной точности распознавания.

Ошибка 2. Чинили распознавание вместо входа

Признак на старте: в проекте есть строка «доработка моделей извлечения» и нет ни строки про то, чем и как в компании сканируют. Между тем качество изображения двигает результат сильнее, чем любая доработка, и разница здесь не в проценты, а в разы.

Как приходит документДоля документов без единой правкиДоля документов в очереди проверки
Скан 300 dpi, плоский или потоковый сканер88 %12 %
Скан 200 dpi74 %26 %
Ровное фото с телефона при дневном свете58 %42 %
Фото с бликом, тенью или перекосом30 %70 %
Документ, заполненный от руки0–15 %85–100 %

Сорок часов доработки извлечения стоят 120 000 ₽ и дают единицы процентных пунктов. Потоковый сканер за 95 000 ₽ и регламент «сканируем 300 dpi, документ кладём ровно» переводят поток из третьей строки таблицы в первую — это тридцать процентных пунктов. Подробный разбор того, что и на сколько чинится на входе, — в материале о плохих сканах, печатях и рукописном тексте.

графикoshibki-vnedreniya-ocr--01
Столбцы доли документов без правки: 88, 74, 58, 30 процентов и 0–15 у рукописи

Столбчатая диаграмма из пяти убывающих столбцов, ось Y — доля документов, прошедших без единой правки, от 0 до 100 %. Столбцы: «скан 300 dpi — 88 %», «скан 200 dpi — 74 %», «ровное фото — 58 %», «фото с бликом — 30 %», «рукопись — 0–15 %» (последний нарисован диапазоном). Над первым и четвёртым столбцами выноска «разница 58 процентных пунктов — это вход, а не вендор». Подписи по-русски, чертёжная графика.

Одна и та же система на одном и том же документе. Разница только в том, чем его сняли

Ошибка 3. Справочники не почистили до внедрения

Признак на старте: на вопрос «сколько дублей в справочнике контрагентов» никто не может ответить. Между тем распознанный ИНН сопоставляется именно со справочником, и каждый дубль превращает однозначное решение в вилку выбора, а вилку — в документ, ушедший человеку.

Цена грязного справочника контрагентов на потоке 3 000 документов
Справочник на 1 400 записей, дублей 18 %252 записи
Доля документов в очереди растёт с 17 % до 34 %+510 документов в месяц
510 документов × 1,5 минуты = 12,75 часа × 844 ₽10 761 ₽ в месяц
Чистка: 40 часов бухгалтера × 844 ₽33 760 ₽
Плюс 8 часов инженера на выгрузку и склейку дублей по ИНН × 3 000 ₽24 000 ₽
ИтогоРазовые 57 760 ₽ возвращаются за 5,4 месяца и снимают 10 761 ₽ ежемесячно. Делается это до внедрения, а не после

То же самое верно для номенклатуры, только дороже: там сопоставляется каждая строка табличной части, а не один реквизит. Общий разбор того, какие данные и в каком виде нужны до старта любого проекта, — в материале о данных перед внедрением.

Ошибка 4. Не заложили проверку человеком

Признак на старте: в техническом задании нет слова «очередь» и нет норматива незамеченных ошибок. Логика заказчика понятна — если точность высокая, зачем платить оператору. Арифметика с этой логикой не согласна.

  • Без очереди проверки в учёт уходит около 1,1 % документов с ошибкой в критичном поле — 33 документа из 3 000 в месяц.
  • Одна такая ошибка стоит примерно 1 100 ₽: 40 минут разбора на сверке плюс усреднённый прямой убыток. Итого 36 300 ₽ в месяц.
  • Очередь проверки по порогу уверенности стоит 17 766 ₽ работы оператора и оставляет 0,25 % — 8 250 ₽ ошибок.
  • Отказ от проверки экономит 17 766 ₽ и стоит 28 050 ₽. Чистый проигрыш — 10 284 ₽ в месяц, и это без учёта репутационной цены платежа, ушедшего не тому получателю.

Норматив, который стоит писать в приёмку вместо «точности 99 %», — не выше 0,3 % незамеченных ошибок по критичным полям. Три схемы контроля с минутами и деньгами разобраны отдельно в материале о проверке распознанного человеком.

Ошибка 5. Пилот прошёл на идеальных документах

Признак на старте: выборку для пилота собирал подрядчик или её отбирал бухгалтер — «вот эти поприличнее». Результат предсказуем: цифра пилота красивая, а на потоке система работает вдвое хуже, и виноватыми оказываются все.

На отобранных сканах 300 dpi выходит 88 % документов без правки. Сплошной поток за три произвольных дня на типичном составе — 150 сканов 300 dpi, 70 сканов 200 dpi, 60 ровных фото и 20 снимков с бликом — даёт 75 %. Тринадцать процентных пунктов разницы означают, что очередь длиннее вдвое: 12 % против 25 % потока. На 3 000 документах это 390 лишних документов, 9,75 часа и 8 229 ₽ в месяц, которых нет в смете.

Правило честной выборки

Выборка для пилота — это сплошной входящий поток за три произвольных дня, включая нечитаемое, посторонние файлы, дубли и документы не того типа. Отобранных «представительных» документов не бывает: отбор всегда идёт в сторону лучшего, даже когда его делают добросовестно. Если подрядчик готов считать точность только на присланной вами подборке — это признак, а не удобство.

Ошибка 6. Считали документы, а не строки

Признак на старте: объём в смете указан одним числом — «около 3 000 документов в месяц». Между тем счёт на три строки и ТОРГ-12 на тридцать — это один документ в отчёте и совершенно разная работа: полей больше, вероятность чистого прохода ниже, минут в очереди больше.

Тип документаСтрок табличной частиПолей всегоМинут в очереди на документДоля документов в очереди
Счёт на оплату3171,212 %
Акт выполненных работ2141,118 %
УПД или счёт-фактура12382,626 %
ТОРГ-1230744,841 %

Посчитаем смету двумя способами на одном и том же потоке из 1 200 счетов, 600 актов, 900 УПД и 300 накладных ТОРГ-12. По счётной строке «3 000 документов по 1,2 минуты у 12 % потока» выходит 7,2 часа и 6 077 ₽ в месяц. По типам с их реальными долями очереди — 24,8 часа и 20 931 ₽. Смета ошиблась почти в три с половиной раза, и обнаружится это на третьем месяце эксплуатации, когда очередь перестанет разгребаться за час в день.

сравнениеoshibki-vnedreniya-ocr--02
Сравнение счёта на 3 строки и ТОРГ-12 на 30 строк: 1,2 и 4,8 минуты в очереди

Сравнение двух колонок. Левая «Счёт на оплату»: 3 строки табличной части, 17 полей, 1,2 минуты в очереди, 12 % документов в очередь. Правая «ТОРГ-12»: 30 строк, 74 поля, 4,8 минуты, 41 % в очередь. Под колонками общая полоса с двумя цифрами: «смета по числу документов — 6 077 ₽ в месяц» и «смета по типам и строкам — 20 931 ₽ в месяц», между ними подпись «разница в 3,5 раза». Подписи по-русски, чертёжная графика.

Один документ в отчёте — четырёхкратная разница в работе. Смета по числу документов ошибается кратно

Ошибка 7. Распознавали то, что приходит по ЭДО

Признак на старте: объём назван общим числом, а по каналам поступления поток не раскладывали. Это самая обидная из восьми ошибок, потому что она означает оплату работы, которую делать не нужно вовсе.

У оптовой компании на 800 входящих документов типичный расклад такой: 310 приходят через ЭДО, 190 — PDF с текстовым слоем из учётной системы поставщика, 220 — сканы, 80 — фотографии. У документа из Диадока, 1С-ЭДО или Saby ЭДО есть машиночитаемый файл и подпись отправителя: распознавать там нечего. Он загружается в учётную систему штатным механизмом, и правильный ответ здесь — настроить обмен и роуминг, а не читать картинку. Как это устроено, разобрано в материале о том, что нужно для старта ЭДО.

PDF с текстовым слоем — тоже отдельный случай: там извлекается готовый текст, точность по полю 99,5–100 %, и тарифицироваться как скан этот документ не должен. После такой разборки настоящих картинок остаётся 300 из 800, и это меняет смету, выбор способа стыковки и иногда сам ответ на вопрос, нужен ли проект. Разложить разнородный входящий поток по маршрутам помогает классификация документов на входе — её ставят первой, до всякого извлечения полей.

Ошибка 8. Не сняли метрики до старта

Признак на старте: на вопрос «сколько минут занимает ввод одного счёта» отвечают «ну минут пять, наверное». Через полгода работающий проект признают неудачным просто потому, что сравнивать оказалось не с чем, — и это самая частая причина, по которой у автоматизации документооборота дурная репутация.

  1. 1Время ввода, замеренное секундомером на 30 документах каждого типа. Названное и замеренное расходятся примерно в полтора раза, причём в обе стороны.
  2. 2Объём по журналу за три месяца с разбивкой по типам, каналам поступления и средней длине табличной части.
  3. 3Доля ошибок сейчас: выборка из 100 введённых вручную документов, сверенная с оригиналами по критичным полям. Без этой цифры доказать улучшение нечем.
  4. 4Срок закрытия месяца в рабочих днях и число документов, введённых после срока.
  5. 5Что именно произойдёт с освобождёнными часами: какая вакансия не будет открыта, какие сверхурочные не будут оплачены. Как это влияет на порог окупаемости, показано в разборе окупаемости распознавания на разных объёмах.

Когда проект не надо начинать вовсе

Часть ошибок не исправляется по ходу — они означают, что проект в этом виде начинать не стоит. Проверьте смету и техническое задание по пяти признакам: любой из них по отдельности лечится, а три сразу означают, что до эксплуатации дело не дойдёт.

  • В смете назван вендор, но нет строки «пилот на 200 ваших документах». Подписывать такое — покупать чужую цифру точности вместо своей.
  • В техническом задании нет очереди проверки и норматива незамеченных ошибок. Значит, контроль в проект не заложен, и ошибки пойдут прямо в учёт.
  • Объём указан одним числом без разбивки по типам и каналам. Смета в этом случае ошибается кратно, и обнаружится это уже в эксплуатации.
  • Не назван владелец процесса приёма документов. Распознавание просто быстрее доставит документ туда, где он и так застревает. Сначала маршрут и ответственный, потом техника.
  • Поток настоящих сканов меньше 790 документов в месяц. Ниже этого порога постоянные расходы контура съедают экономию при любом качестве внедрения — считать надо по картинкам, а не по всем входящим документам.

Почти всё, что ломает проект распознавания, можно увидеть в смете. Читать её надо до подписания, а не на приёмке.