Больше половины проблем распознавания решается не сменой платформы, а сменой способа получения документа. Одна и та же система на ровном скане 300 dpi даёт 88 % документов, прошедших без правки, на скане 200 dpi — 74 %, на аккуратном фото с телефона — 58 %, а на фото с бликом и перекосом — 30 %. Разброс в 58 процентных пунктов возникает до того, как в дело вступает хоть одна модель, и никакая доработка извлечения его не закрывает.
Разберём по факторам: что именно и на сколько роняет результат, что из этого чинит предобработка, а что не чинит ничего и никогда. Дадим требования к скану на одну страницу — их имеет смысл распечатать и повесить рядом со сканером. И честно скажем, где распознавание сдаётся: рукописные бланки, копии третьего поколения и правки шариковой ручкой поверх печатного текста.
Расчёты модельные, арифметика открытая — пересчитайте под свои объёмы. Ставки одни во всей статье: бухгалтер 844 ₽/час — это полная стоимость часа с взносами, надбавками и рабочим местом, посчитанная по методике полной стоимости часа сотрудника, — и инженер 3 000 ₽/час. Состояние рынка — на сентябрь 2026 года. Диапазоны точности — ориентиры пилотов, а не гарантия: свою цифру вы узнаете только на своих документах.
Пять факторов и цена каждого в процентных пунктах
Возьмём одну систему, один тип документа — счёт на оплату с восемью позициями — и будем менять только способ, которым он попадает на вход. Отсчёт ведём от ровного скана 300 dpi, где доля документов без единой правки составляет 88 %.
| Что не так со входом | Документов без правки | Потеря | Чинится ли программно |
|---|---|---|---|
| Ровный скан 300 dpi, чёрно-белый | 88 % | — | Эталон |
| Разрешение 200 dpi | 74 % | −14 п.п. | Нет: информации в файле уже нет |
| Наклон 3° при нормальном разрешении | 80 % | −8 п.п. | Да, выравнивание возвращает 5–7 п.п. |
| Печать или штамп поверх суммы и итога | 76 % | −12 п.п. | Частично, 2–4 п.п. |
| Копия с копии, третье поколение | 68 % | −20 п.п. | Частично, 6–10 п.п. |
| Ровное фото с телефона при дневном свете | 58 % | −30 п.п. | Частично: выпрямление перспективы |
| Фото с бликом, тенью и перекосом | 30 % | −58 п.п. | Почти нет |
| Бланк, заполненный от руки | 0–15 % | −73 п.п. и ниже | Нет |
Из таблицы следуют два вывода, которые стоят дороже любого сравнения вендоров. Первый: разница между двумя системами распознавания на одном и том же входе обычно измеряется единицами процентных пунктов, а разница между двумя входами на одной системе — десятками. Второй: потери не складываются линейно, а усиливают друг друга. Наклон на скане 300 dpi стоит 8 пунктов, наклон на фотографии в 160 dpi стоит вдвое больше, потому что мелкий шрифт в табличной части уже на грани различимости, и любое смазывание переводит его за грань.
Отдельно про разрешение, потому что это самая частая надежда заказчика. Апскейл со 150 до 300 dpi не добавляет ни одного процентного пункта: увеличение картинки не создаёт информацию, которой в файле нет. Модели повышения чёткости иногда делают изображение приятнее на глаз и при этом дорисовывают знаки — то есть превращают явную нечитаемость в уверенную ошибку. Для бухгалтерских документов это худший обмен из возможных.
Столбчатая диаграмма, ось Y — доля документов без правки от 0 до 100 %. Столбцы слева направо с подписями: «Ровный скан 300 dpi — 88 %», «Наклон 3° — 80 %», «Печать поверх суммы — 76 %», «Скан 200 dpi — 74 %», «Копия с копии — 68 %», «Ровное фото — 58 %», «Фото с бликом — 30 %», «Рукописный бланк — 0–15 %». Первый столбец подписан «эталон», последние два выделены контрастно. Над диаграммой скобка от первого до седьмого столбца с подписью «разброс 58 процентных пунктов на одной и той же системе». Подписи по-русски, чертёжная графика.
Требования к скану, которые помещаются на одну страницу
Ниже — тот самый лист, который надо распечатать и положить у сканера, а копию отправить поставщикам, которые присылают бумагу. Он не содержит ничего сложного и закрывает основную часть потерь из предыдущей таблицы.
- 1Разрешение — 300 dpi, не ниже. Это рабочий минимум для табличной части; для документов с мелким шрифтом в позициях — 400 dpi.
- 2Цветность — чёрно-белый или градации серого. Цвет включаем только там, где он несёт смысл: цветная печать, подпись, маркировка партии.
- 3Один документ — один файл. Многостраничный документ — один файл со страницами по порядку. Пачка из семи счетов одним PDF на сорок страниц — самая частая причина того, что поля второго документа уезжают в первый.
- 4Формат — PDF или JPEG с качеством не ниже 85. Не пересохранять уже сжатый файл повторно: каждое пересохранение съедает контраст мелкого шрифта.
- 5Лист по направляющей сканера, без наклона. Допуск — 1°; на трёх градусах строки таблицы перестают выстраиваться в ряды.
- 6Все четыре угла листа в кадре, поля не обрезаны. Обрезанный край — это потерянная колонка или потерянный итог.
- 7Печати и штампы — в отведённые поля. Оттиск через сумму, номер или ИНН почти гарантированно отправляет документ в очередь проверки.
- 8Не сканировать копию с копии. Если оригинала нет — запрашивать у контрагента файл, а не третье поколение ксерокса.
- 9Имя файла по шаблону «дата_контрагент_тип». Это не эстетика: по имени файла восстанавливается маршрут, когда что-то пошло не так.
Лист требований, повешенный над сканером, меняет поведение примерно на три недели. Работает другое — точка приёма: одно место, один потоковый сканер, один ответственный человек и правило для поставщиков «присылайте файлом, а не бумагой». Если документы фотографирует кладовщик на бегу, а счета пересылает менеджер из машины, регламент не сработает, пока у этого действия нет хозяина и удобного способа. Перевод даже трети потока из фотографий в ровный скан даёт больше, чем любая доработка распознавания, и стоит переписки, а не денег.
Что предобработка вытягивает, а что нет
Между приёмом файла и распознаванием текста стоит слой подготовки изображения — мы разбирали его как первый из четырёх в статье о том, как машина читает документ. Этот слой не всесилен, и полезно понимать, где проходит его граница, чтобы не платить за чудо.
| Приём | Против чего работает | Сколько возвращает | Где бесполезен |
|---|---|---|---|
| Выравнивание перекоса | Наклон листа в сканере, повёрнутая страница | 5–7 п.п. из 8 | Если строки уже слились из-за низкого разрешения |
| Выпрямление перспективы | Трапеция на снимке с руки | 8–15 п.п. на фотографиях | На сильном изгибе страницы и на смазанном кадре |
| Бинаризация и удаление фона | Серый фон копии, тонирование бланка, муар | 6–10 п.п. на копиях | Если фон темнее самого текста |
| Снятие цветного оттиска | Синяя печать поверх суммы | 2–4 п.п. | На чёрном штампе и на оттиске, закрывающем знак целиком |
| Удаление шума и разделение слипшихся знаков | Грязь сканера, точечный шум факса | 2–5 п.п. | На потере тонких элементов букв |
| Повышение разрешения | Ничего | 0 п.п. | Всегда: информации в файле не появляется, а модели дорисовки создают уверенные ошибки |
| Осветление пересвета | Блик от лампы, засветка вспышкой | 0–3 п.п. | Практически всегда: выбитые в белый пиксели не восстанавливаются |
Читается таблица так: предобработка спасает от геометрии и фона и не спасает от отсутствия информации. Косой, серый и грязноватый скан вытягивается почти полностью. Малый размер знака, выбитый в белый участок и смазанный кадр не вытягиваются ничем — там нечего восстанавливать. Поэтому в разговоре с подрядчиком полезно разделять два вопроса: «что вы делаете с изображением на входе» и «на каком входе вы отказываетесь работать». Второй ответ честнее первого.
Две пары карточек «до/стало». Верхняя пара: слева схематичный счёт, наклонённый на 3°, с серым фоном и точечным шумом, подпись «68 %»; справа тот же счёт выпрямлен, фон белый, подпись «85 %», между ними стрелка «выравнивание + бинаризация». Нижняя пара: слева счёт с крупным белым пятном пересвета поверх строки итога, подпись «30 %»; справа то же изображение с чуть притемнённым фоном, пятно осталось белым, подпись «32 %», между ними стрелка «осветление пересвета» и красная пометка «восстанавливать нечего». Чертёжная графика, подписи по-русски, без реальных реквизитов.
Считаем в строках и правках: во что обходится плохой вход
Доля документов без правки — удобная метрика для сравнения, но плохая для сметы. Работа человека измеряется не документами, а конкретными действиями: найти подсвеченное поле, сверить с оригиналом, исправить знак. У одного документа таких действий может быть ноль, а может быть шесть. Поэтому считаем в строках табличной части и в правках.
Модельная компания: оптовая торговля, поток 3 000 входящих документов в месяц, в среднем 8 позиций в табличной части — итого 24 000 строк. Сорок процентов документов приходят фотографиями из мессенджеров и почты, остальные — сканами разного качества. Считаем месяц в таком режиме и месяц после наведения порядка на входе.
Обратите внимание на третью строку обоих расчётов. Возврат на пересканирование стоит дороже правки не потому, что это сложно, а потому, что документ к этому моменту уже уехал: оригинал у поставщика, бумага в другой папке, а человек, который сканировал, занят другим. Шесть минут — это оптимистично, и именно эта строка обычно вызывает у бухгалтерии больше всего раздражения при запуске конвейера.
Теперь та же арифметика с другой стороны — во что обходится починка входа и что она возвращает. Сравним два способа потратить деньги на одну и ту же цель: привести в порядок вход или доработать извлечение полей.
Альтернатива, которую предлагают чаще: 40 часов инженера на доработку извлечения полей — 120 000 ₽. Прибавка к доле документов без правки на грязном входе — 2–4 процентных пункта, возьмём три. Это 90 документов из очереди в месяц, полторы минуты на каждый, 2,25 часа и 1 899 ₽ в месяц. Окупаемость — 63 месяца, то есть никогда: за пять лет у вас поменяются и поставщики, и формы, и сама система.
Если подрядчик начинает проект с обсуждения моделей, а не с вопроса «покажите, как документы к вам попадают» — это плохой знак. Правильный первый шаг — разложить месячный поток по способам поступления: ЭДО, PDF с текстовым слоем, ровные сканы, плохие сканы, фотографии. Из этой раскладки сразу видно, сколько денег лежит в организации процесса и сколько остаётся собственно на распознавание.
Две вертикальные карточки рядом. Левая «Точка приёма: сканер и регламент»: строки «Вложение — 104 376 ₽», «Возврат — 15 445 ₽ в месяц», «Окупаемость — 6,8 месяца», внизу зелёная пометка «плюс исчезают возвраты на пересканирование». Правая «Доработка извлечения полей»: строки «Вложение — 120 000 ₽ за 40 часов», «Возврат — 1 899 ₽ в месяц», «Окупаемость — 63 месяца», внизу красная пометка «за это время поменяются формы поставщиков». Между карточками вертикальная разделительная линия. Чертёжная графика, подписи по-русски.
Рукописный текст: где приемлемо, а где нет
Рукопись — не единый случай, и обобщение «рукописное не распознаётся» одновременно и верно, и вредно. Разложим по тому, что именно написано от руки.
| Что написано от руки | Точность по полю | Что с этим делать |
|---|---|---|
| Печатные цифры в отдельных клетках: номер, дата, количество | 80–92 % | Извлекать, но всегда через очередь проверки: подтверждение быстрее ввода |
| Печатные заглавные буквы в клетках: фамилия, адрес | 70–88 % | Извлекать справочно, для поиска и регистрации, а не для проводки |
| Связный рукописный текст шариковой ручкой | 40–70 % | Не извлекать: проверка займёт больше времени, чем ввод с нуля |
| Подпись и её расшифровка | Как текст не распознаётся | Фиксировать факт наличия подписи, значение не извлекать |
| Рукописная правка поверх печатного значения | Печатное читается уверенно, правка теряется | Самый опасный случай — нужно отдельное правило, см. предупреждение ниже |
| Бланк, заполненный от руки целиком | 0–15 % документов без правки | Вводить руками или переводить приёмку на планшет с выбором из справочника |
Кладовщик получил 8 коробок вместо 10, зачеркнул «10» и написал рядом «8». Система уверенно прочитала печатную «10» — уверенность высокая, контрольные суммы сходятся, документ уходит в проводку без единого сигнала. Это не ошибка распознавания в обычном смысле: система прочитала ровно то, что напечатано. Лечится это не точностью, а правилом: любая обнаруженная рукописная пометка в зоне печатных значений отправляет документ человеку независимо от уверенности. Норматив, который стоит записать в договор, — не более 0,3 % документов с незамеченной ошибкой в критичных полях, и правки поверх печати попадают ровно в эту метрику.
Практический вывод по рукописным складским документам: не пытаться распознать их целиком. Работающий вариант — извлекать два-три ключевых поля для регистрации и поиска, а содержание либо вводить руками, либо убирать почерк из процесса вовсе. Второе почти всегда дешевле: терминал сбора данных или планшет с выбором позиции из справочника закрывает задачу на приёмке, и мы разбирали её отдельно как распознавание складских документов — с честной оговоркой, что для рукописных бланков правильный ответ лежит в замене бланка, а не в чтении картинки.
Фото с телефона: когда допустимо и как его принимать
Запретить фотографии нельзя: водитель на разгрузке, монтажник на объекте и кладовщик на приёмке физически не имеют доступа к сканеру. Значит, канал надо не запрещать, а обустраивать — и отделять его в учёте, чтобы средняя цифра по потоку не скрывала провал.
- 1Съёмка на плоскости, а не на весу
Лист кладётся на стол или на любую ровную поверхность. Снимок с рук на весу даёт изгиб страницы, а изгиб — единственная геометрическая беда, которую выпрямление перспективы не чинит.
- 2Свет сбоку, камера не между лампой и листом
Блик от потолочной лампы и тень от собственной руки — две главные причины провала снимков. Обе устраняются шагом в сторону и обе стоят 28 процентных пунктов доли документов без правки.
- 3Все четыре угла листа в кадре
Кадрировать по краю листа, а не по содержимому. Обрезанный угол — потерянная колонка табличной части или потерянный итог; система при этом не знает, что чего-то не хватает.
- 4Одна страница — один снимок
Ни панорам, ни двух страниц в одном кадре. Разделение слипшихся документов — самая частая незаметная поломка на пилотах: поля второго документа тихо уезжают в первый.
- 5Контроль качества на входе, пока документ ещё в руках
Бот или приложение проверяет резкость, засветку, наклон и долю листа в кадре и просит переснять сразу. Это ключевой пункт: пересъёмка через десять секунд стоит десять секунд, а возврат на пересканирование через два дня стоит шесть минут и раздражение.
И отдельная строка учёта: канал фотографий нормируется отдельно от сканов или не нормируется вовсе. Записывать в договор одну цифру на весь поток, где смешаны текстовые PDF и снимки из машины, — верный способ получить спор на приёмке. Как разложить требования по типам и по каналам, мы подробно разобрали в материале о том, что стоит за реальной точностью распознавания.
Схема слева направо. Блок «Снимок с телефона» → ромб «Резкость, засветка, наклон, все четыре угла в кадре — в норме?». Ветка «нет» → блок «Просьба переснять сразу, 10 секунд» со стрелкой обратно к «Снимку». Ветка «да» → блок «Выпрямление перспективы» → «Распознавание» → ромб «Все проверки прошли?» → «Учётная система» либо «Очередь проверки, 1,5 минуты». Внизу отдельной строкой красный блок «Без контроля на входе: возврат на пересканирование через 2 дня — 6 минут». Подписи по-русски, чертёжная графика.
Когда читать картинку не надо вовсе
Самая дешёвая обработка скана — та, которой не было. Прежде чем считать проект, разложите месячный поток на четыре части, и две из них с распознаванием не связаны никак.
- Документы из ЭДО. Контур.Диадок, Saby ЭДО и 1С-ЭДО отдают структурированный файл с подписью: его не читают картинкой, а загружают. Точность стопроцентная, стоимость нулевая. Если контрагент уже в ЭДО, а вы сканируете от него бумагу — правильный ответ звучит как «настройте обмен», а не «улучшите распознавание»; порядок подключения разобран в материале как устроен ЭДО и что нужно для старта.
- PDF со встроенным текстовым слоем. Счёт, выгруженный из учётной системы поставщика и присланный письмом, уже содержит готовый текст. Распознавать его — платить за воздух. Проверяется за секунду: если текст в PDF выделяется мышью, слой есть.
- Регулярная выгрузка от крупного поставщика. Если один контрагент даёт 400 документов в месяц, дешевле один раз договориться о выгрузке реестра файлом, чем ежемесячно распознавать четыреста картинок. Обычно это переписка на неделю и ноль рублей — вместо строки в смете на весь срок жизни системы.
- Собственные документы, которые вы же и печатали. Их исходники лежат в вашей учётной системе. Сканировать свой же счёт, чтобы прочитать его обратно, — распространённее, чем кажется, и всегда признак того, что сломан не документооборот, а маршрут внутри компании.
В обычной оптовой компании эти четыре куска вместе дают 30–50 % входящего потока. Если подрядчик считает цену за страницу на весь объём — вы платите за то, что можно не покупать. Требуйте раскладку и считайте проект по остатку: именно в нём живут те самые плохие сканы, ради которых всё и затевается.
Где граница: документы, которые дешевле вводить руками
И честная оборотная сторона. Есть документы, на которых конвейер проигрывает человеку при любой настройке, и говорить об этом надо до договора, а не на приёмке.
- Бланки, заполненные от руки целиком: складские накладные, заявки, путевые листы. Доля документов без правки 0–15 %, человек перечитывает каждый, и вы платите дважды.
- Документы, которых меньше полусотни в месяц от одного контрагента. Шаблон под форму окупается от 250–300 документов в месяц, ниже — не окупается никогда, а без шаблона редкая форма стабильно уходит в очередь.
- Разовая оцифровка архива без последующего потока. Конвейер окупается потоком; подрядная оцифровка или временный оператор здесь честно дешевле.
- Сезонный поток: два месяца по 3 000 документов и десять по 200. Считать надо по среднегодовому объёму, иначе система десять месяцев в году стоит и потребляет поддержку.
- Компании, где никто не отвечает за приём документа. Распознавание в этом случае просто быстрее доставит документ в место, где он и так застревает. Сначала маршрут и владелец процесса, потом техника.
Где именно проходит порог по объёму и как он сдвигается от вашей ставки часа — разложено отдельно в материале о цене распознавания одного документа. Коротко: при ставке 844 ₽/час операционный ноль наступает на 425 документах в месяц, при 540 ₽/час — на 675, а при 210 ₽/час — на 2 200. Ваша ставка влияет на решение сильнее, чем любое свойство технологии.
Прежде чем платить за улучшение моделей, посмотрите, чем и как в вашей компании сканируют документы — и кто именно это делает.
