Классический RPA-робот умеет вводить данные, но не умеет читать: для него документ — это набор полей в известных местах экрана или файла. Как только форма перестаёт быть одинаковой, сценарий останавливается. Интеллектуальная обработка добавляет к роботу два слоя перед ним — распознавание и извлечение полей — и расширяет его на живой поток: сканы, документы новых поставщиков, письма в свободной форме.
Плата за это расширение — характер результата. Шаблонный ввод либо срабатывает, либо падает, и оба состояния очевидны. Извлечение полей моделью выдаёт значение с оценкой уверенности, то есть иногда ошибается молча. Поэтому связка проектируется не как «робот стал умнее», а как конвейер с очередью на ручную проверку и понятным правилом, кто за какое звено отвечает.
Ниже — три слоя и их поведение, сравнение с шаблонным вводом по типам документов, расчёт на 1 200 документах в месяц, настройка порога уверенности с ценой каждого варианта и список российских компонентов на сентябрь 2026 года.
Три слоя связки: чтение, извлечение, действие
Разделение на слои нужно не для стройности, а потому, что каждый слой ломается по своей причине и чинится своими руками. Смешивать их в одну строку сметы — верный способ через полгода не понимать, почему выросли расходы.
- 1Слой первый: распознавание
Превращает изображение в текст с координатами: разворачивает страницу, чистит фон, находит строки и таблицы. Ломается от качества съёмки, печатей поверх текста и сканов в низком разрешении, а не от смены формы документа. Тарифицируется чаще всего постранично — ориентир 3–4,50 ₽ за страницу либо от 150 000 ₽ в год за модуль. Механика этого слоя подробно разобрана в материале о том, как машина читает документ.
- 2Слой второй: извлечение полей
Определяет тип документа и достаёт реквизиты: номер, дату, контрагента, суммы, позиции таблицы. Здесь два подхода — шаблон под конкретную форму и обучаемая модель, которая ищет поля по смыслу и переживает изменение вёрстки. Именно этот слой выдаёт оценку уверенности по каждому полю, и именно он определяет размер очереди на ручную проверку. Сравнение подходов по точности и воспроизводимости — в разборе языковой модели против классического OCR.
- 3Слой третий: действие робота
Открывает форму в учётной системе, подставляет извлечённые значения, сверяет контрагента и договор со справочником, сохраняет документ непроведённым и кладёт исходный файл в архив. Этот слой не изменился: он по-прежнему хрупок к перерисовке экрана и по-прежнему требует контрольной суммы на выходе. Внутри платформ распознавание может быть встроенным модулем — как это устроено у российских вендоров, разобрано в сравнении RPA-платформ.
Схема слева направо из четырёх блоков со стрелками: «Документ: скан, файл, письмо» → «Слой 1. Распознавание: изображение в текст» → «Слой 2. Извлечение полей: тип документа и реквизиты, оценка уверенности» → «Слой 3. Робот: ввод в учётную систему, документ непроведён». От второго блока вверх отходит стрелка к блоку «Очередь ручной проверки — 18 % документов, 11 часов в месяц» с подписью «уверенность ниже 0,95». От третьего блока вниз отходит стрелка к блоку «Контрольная сумма: принято = проведено». Под каждым слоем подпись причины поломки: «качество съёмки», «новая форма и редкие поля», «перерисовка экрана». Приглушённая палитра, чертёжная штриховка, подписи по-русски.
Что именно даёт добавление двух слоёв, видно на типах документов. Шаблонный робот закрывает только верхние две строки таблицы; всё остальное до появления распознавания либо вводилось руками, либо не автоматизировалось вовсе.
| Что приходит | Робот по шаблону | Робот с распознаванием и моделью |
|---|---|---|
| Выгрузка из чужой системы строгой формы | Работает: поля на одних и тех же местах | Не нужна, слой лишний |
| Счёт от постоянного поставщика | Работает, пока форма не изменилась | Работает и после смены вёрстки |
| Счёт от нового поставщика | Не работает: шаблона нет | Работает, поля находятся по смыслу |
| Скан или фотография документа | Не работает | Работает, качество зависит от съёмки |
| Письмо с заявкой в свободной форме | Не работает | Работает только с подтверждением человеком |
Расчёт: 1 200 документов в месяц
Вводные: 1 200 входящих документов в месяц, чуть меньше двух страниц в среднем — 2 000 страниц. Ручной ввод занимает 6 минут на документ, то есть 120 часов, и считается по полной стоимости часа бухгалтера 844 ₽. Робот работает в типовой конфигурации, срок жизни сценария 24 месяца, владение взято по общей методике кластера. Порог уверенности выставлен на 0,95.
Две строки в этом расчёте обычно забывают, и обе относятся к людям. Очередь ручной проверки никуда не исчезает — она уменьшается и становится предсказуемой, но 11 часов в месяц кто-то тратит. Выборочный контроль прошедших документов тоже обязателен: без него молчаливая ошибка извлечения обнаруживается при закрытии периода. Как устроено ценообразование самого распознавания и почему постраничная тарификация на потоке дороже, чем кажется, разобрано в материале про стоимость распознавания документа.
Правило разделения ответственности
Модель предлагает, робот исполняет, человек подтверждает спорное. Ни один из троих не делает работу двух других.
Это не лозунг, а способ проектирования: правило превращается в три технических ограничения, которые проверяются на приёмке. Нарушение любого из них возвращает вас к системе, где ошибку невозможно локализовать.
- 1Модель не совершает действий. Она возвращает значения полей и оценку уверенности, но не нажимает кнопок и не проводит документов. Всё, что модель предложила, попадает в систему только через робота и только по правилу, записанному в сценарии.
- 2Робот не выносит суждений. Он не решает, правильный ли перед ним документ и та ли это номенклатура. Его задача — сверить извлечённые значения со справочниками, ввести совпавшее и отправить в очередь всё, что не совпало.
- 3Человек не становится узким местом. Если на подтверждение уходит больше четверти потока, экономия исчезает, а проверяющий перестаёт читать и начинает нажимать «согласен». Как выстраивают такую развилку, разобрано в материале про человека в контуре принятия решений.
Порог уверенности и очередь на ручную проверку
Порог — это число, ниже которого документ не идёт в учёт автоматически, а уходит человеку. Он единственный по-настоящему управляемый параметр связки, и настраивается он не «на глаз», а по замеру на собственной выборке за первый месяц. Цифры ниже модельные, для потока в 1 200 документов при трёх минутах на проверку одного.
| Порог уверенности | Уходит на ручную проверку | Часов проверки в месяц | Ошибок доходит до учёта на 1 000 документов |
|---|---|---|---|
| 0,98 | 31 % | 19 | менее 1 |
| 0,95 | 18 % | 11 | около 2 |
| 0,90 | 11 % | 7 | около 5 |
| 0,80 | 7 % | 4 | около 12 |
График с двумя кривыми на общей оси X «порог уверенности» со значениями 0,80, 0,90, 0,95, 0,98. Левая ось — «часов ручной проверки в месяц», тёмная растущая кривая через точки 4, 7, 11, 19. Правая ось — «ошибок на 1 000 документов», светлая убывающая кривая через точки 12, 5, 2, менее 1. Точка 0,95 выделена кружком и подписана «рабочая настройка модельного расчёта». Внизу подпись «поток 1 200 документов, 3 минуты на проверку одного». Чертёжная сетка, приглушённая палитра, подписи по-русски.
Единого правильного порога не существует, потому что цена ошибки у полей разная. Поэтому на практике его задают не на документ целиком, а на группы полей, и отдельно решают, где нужен сплошной контроль независимо от уверенности модели.
- Сплошной контроль всегда — банковские реквизиты и сумма к оплате, количество в отгрузочных документах, коды маркировки, любые данные, уходящие в государственную систему, и всё, что выше порога существенности компании.
- Выборочный контроль допустим — там, где ошибка ловится дальше по цепочке: наименование для поиска, комментарий, дата документа при наличии сверки периода, служебные признаки.
- Отдельная ветка для новых поставщиков и новых форм. Первые пять документов от нового контрагента проходят через человека независимо от уверенности: именно на них модель ошибается чаще всего.
- Контрольная сумма на выходе. Число принятых документов и общая сумма сверяются с тем, что появилось в учёте; расхождение блокирует следующий запуск. Это защита не от модели, а от тихого сбоя робота.
Чем это делают в России на сентябрь 2026 года
Компоненты собираются в связку из разных источников, и это нормально: платформа робота, движок распознавания и модель извлечения полей вполне могут быть от трёх разных поставщиков. Важно заранее понять, кто отвечает за стык.
- Sherpa IDP — интеллектуальная обработка документов внутри экосистемы Sherpa RPA. Вариант для тех, кому важно, чтобы за робота и за чтение отвечал один поставщик.
- Content AI — российский преемник ABBYY: ContentReader PDF вместо FineReader, ContentCapture вместо FlexiCapture. Зрелый потоковый ввод с шаблонами и обучением.
- Smart Engines — распознавание УПД, счетов-фактур, актов, ТОРГ-12, банковских выписок и платёжных документов, в том числе на мобильной съёмке.
- 1С:Распознавание первичных документов — самый короткий путь, если весь поток и так приходит в 1С и типы документов типовые.
- GigaChat и YandexGPT — для извлечения полей из неструктурированного текста: писем, заявок, нестандартных форм, где шаблон не построить.
Договор, анкета, заявка от физического лица содержат персональные данные, и отправка их во внешний сервис — это обработка с участием третьего лица со всеми требованиями 152-ФЗ: локализация, согласия, поручение обработки. Решается это либо моделью на своём сервере, либо обезличиванием перед отправкой, либо отказом от облачного слоя на этом типе документов. Что именно уезжает наружу и как это ограничить, разобрано в материале про данные компании в облачном ИИ.
Когда связку делать не надо
Четыре ситуации, в которых добавление слоёв чтения к роботу не окупится или создаст больше проблем, чем решит.
- Документы приходят через ЭДО. Данные уже структурированы, читать нечего. Здесь не нужен ни слой распознавания, ни чаще всего сам робот: работает штатная загрузка.
- Поток меньше 300 документов в месяц. При 6 минутах на документ это 30 часов и 25 320 ₽ — ниже стоимости владения одним роботом даже без слоя распознавания. Дешевле оставить ручной ввод и заняться источником документов.
- Формы строго одинаковые и не меняются. Шаблонный ввод справится дешевле и предсказуемее: за распознавание вы заплатите постранично, ничего не получив взамен.
- Цена ошибки в поле выше стоимости всей операции. Платёжные реквизиты, коды маркировки, налоговые показатели. Здесь либо сплошной контроль человеком — и тогда экономия близка к нулю, — либо операция остаётся ручной.
И то, что стоит проговорить до начала проекта. Добавление модели к роботу не делает сценарий надёжнее — оно делает его применимее. Хрупкость никуда не уходит: третий слой по-прежнему кликает по чужому экрану и по-прежнему ломается от его перерисовки, а к этому добавляется новый класс проблем — молчаливая ошибка извлечения. Поэтому первый вопрос перед такой связкой остаётся прежним: точно ли у источника документов нет обмена данными, при котором читать вообще ничего не придётся.
