Классический RPA-робот умеет вводить данные, но не умеет читать: для него документ — это набор полей в известных местах экрана или файла. Как только форма перестаёт быть одинаковой, сценарий останавливается. Интеллектуальная обработка добавляет к роботу два слоя перед ним — распознавание и извлечение полей — и расширяет его на живой поток: сканы, документы новых поставщиков, письма в свободной форме.

Плата за это расширение — характер результата. Шаблонный ввод либо срабатывает, либо падает, и оба состояния очевидны. Извлечение полей моделью выдаёт значение с оценкой уверенности, то есть иногда ошибается молча. Поэтому связка проектируется не как «робот стал умнее», а как конвейер с очередью на ручную проверку и понятным правилом, кто за какое звено отвечает.

Ниже — три слоя и их поведение, сравнение с шаблонным вводом по типам документов, расчёт на 1 200 документах в месяц, настройка порога уверенности с ценой каждого варианта и список российских компонентов на сентябрь 2026 года.

Три слоя связки: чтение, извлечение, действие

Разделение на слои нужно не для стройности, а потому, что каждый слой ломается по своей причине и чинится своими руками. Смешивать их в одну строку сметы — верный способ через полгода не понимать, почему выросли расходы.

  1. 1
    Слой первый: распознавание

    Превращает изображение в текст с координатами: разворачивает страницу, чистит фон, находит строки и таблицы. Ломается от качества съёмки, печатей поверх текста и сканов в низком разрешении, а не от смены формы документа. Тарифицируется чаще всего постранично — ориентир 3–4,50 ₽ за страницу либо от 150 000 ₽ в год за модуль. Механика этого слоя подробно разобрана в материале о том, как машина читает документ.

  2. 2
    Слой второй: извлечение полей

    Определяет тип документа и достаёт реквизиты: номер, дату, контрагента, суммы, позиции таблицы. Здесь два подхода — шаблон под конкретную форму и обучаемая модель, которая ищет поля по смыслу и переживает изменение вёрстки. Именно этот слой выдаёт оценку уверенности по каждому полю, и именно он определяет размер очереди на ручную проверку. Сравнение подходов по точности и воспроизводимости — в разборе языковой модели против классического OCR.

  3. 3
    Слой третий: действие робота

    Открывает форму в учётной системе, подставляет извлечённые значения, сверяет контрагента и договор со справочником, сохраняет документ непроведённым и кладёт исходный файл в архив. Этот слой не изменился: он по-прежнему хрупок к перерисовке экрана и по-прежнему требует контрольной суммы на выходе. Внутри платформ распознавание может быть встроенным модулем — как это устроено у российских вендоров, разобрано в сравнении RPA-платформ.

схема процессаrpa-i-ii-obrabotka-dokumentov--01
Схема связки: распознавание, извлечение полей, ввод роботом и очередь ручной проверки

Схема слева направо из четырёх блоков со стрелками: «Документ: скан, файл, письмо» → «Слой 1. Распознавание: изображение в текст» → «Слой 2. Извлечение полей: тип документа и реквизиты, оценка уверенности» → «Слой 3. Робот: ввод в учётную систему, документ непроведён». От второго блока вверх отходит стрелка к блоку «Очередь ручной проверки — 18 % документов, 11 часов в месяц» с подписью «уверенность ниже 0,95». От третьего блока вниз отходит стрелка к блоку «Контрольная сумма: принято = проведено». Под каждым слоем подпись причины поломки: «качество съёмки», «новая форма и редкие поля», «перерисовка экрана». Приглушённая палитра, чертёжная штриховка, подписи по-русски.

Очередь на проверку — не сбой конвейера, а его штатная ветка

Что именно даёт добавление двух слоёв, видно на типах документов. Шаблонный робот закрывает только верхние две строки таблицы; всё остальное до появления распознавания либо вводилось руками, либо не автоматизировалось вовсе.

Что приходитРобот по шаблонуРобот с распознаванием и моделью
Выгрузка из чужой системы строгой формыРаботает: поля на одних и тех же местахНе нужна, слой лишний
Счёт от постоянного поставщикаРаботает, пока форма не измениласьРаботает и после смены вёрстки
Счёт от нового поставщикаНе работает: шаблона нетРаботает, поля находятся по смыслу
Скан или фотография документаНе работаетРаботает, качество зависит от съёмки
Письмо с заявкой в свободной формеНе работаетРаботает только с подтверждением человеком

Расчёт: 1 200 документов в месяц

Вводные: 1 200 входящих документов в месяц, чуть меньше двух страниц в среднем — 2 000 страниц. Ручной ввод занимает 6 минут на документ, то есть 120 часов, и считается по полной стоимости часа бухгалтера 844 ₽. Робот работает в типовой конфигурации, срок жизни сценария 24 месяца, владение взято по общей методике кластера. Порог уверенности выставлен на 0,95.

Месяц работы связки против ручного ввода
Ручной ввод: 1 200 документов по 6 минут, 120 часов по 844 ₽101 280 ₽/мес
Владение unattended-роботом в типовой конфигурации38 600 ₽/мес
Распознавание: 2 000 страниц по 3,50 ₽7 000 ₽/мес
Очередь ручной проверки: 18 % документов, 216 штук по 3 минуты, 11 часов9 284 ₽/мес
Выборочный контроль прошедших: 5 % от 984 документов, 2 часа1 688 ₽/мес
Итого связка56 572 ₽/мес
ИтогоЧистый эффект 44 708 ₽ в месяц, или 536 496 ₽ в год. Разработка сценария и настройка извлечения в эту сумму уже включены через амортизацию

Две строки в этом расчёте обычно забывают, и обе относятся к людям. Очередь ручной проверки никуда не исчезает — она уменьшается и становится предсказуемой, но 11 часов в месяц кто-то тратит. Выборочный контроль прошедших документов тоже обязателен: без него молчаливая ошибка извлечения обнаруживается при закрытии периода. Как устроено ценообразование самого распознавания и почему постраничная тарификация на потоке дороже, чем кажется, разобрано в материале про стоимость распознавания документа.

Правило разделения ответственности

Модель предлагает, робот исполняет, человек подтверждает спорное. Ни один из троих не делает работу двух других.

Это не лозунг, а способ проектирования: правило превращается в три технических ограничения, которые проверяются на приёмке. Нарушение любого из них возвращает вас к системе, где ошибку невозможно локализовать.

  1. 1Модель не совершает действий. Она возвращает значения полей и оценку уверенности, но не нажимает кнопок и не проводит документов. Всё, что модель предложила, попадает в систему только через робота и только по правилу, записанному в сценарии.
  2. 2Робот не выносит суждений. Он не решает, правильный ли перед ним документ и та ли это номенклатура. Его задача — сверить извлечённые значения со справочниками, ввести совпавшее и отправить в очередь всё, что не совпало.
  3. 3Человек не становится узким местом. Если на подтверждение уходит больше четверти потока, экономия исчезает, а проверяющий перестаёт читать и начинает нажимать «согласен». Как выстраивают такую развилку, разобрано в материале про человека в контуре принятия решений.

Порог уверенности и очередь на ручную проверку

Порог — это число, ниже которого документ не идёт в учёт автоматически, а уходит человеку. Он единственный по-настоящему управляемый параметр связки, и настраивается он не «на глаз», а по замеру на собственной выборке за первый месяц. Цифры ниже модельные, для потока в 1 200 документов при трёх минутах на проверку одного.

Порог уверенностиУходит на ручную проверкуЧасов проверки в месяцОшибок доходит до учёта на 1 000 документов
0,9831 %19менее 1
0,9518 %11около 2
0,9011 %7около 5
0,807 %4около 12
графикrpa-i-ii-obrabotka-dokumentov--02
Зависимость от порога уверенности: очередь проверки против числа ошибок в учёте

График с двумя кривыми на общей оси X «порог уверенности» со значениями 0,80, 0,90, 0,95, 0,98. Левая ось — «часов ручной проверки в месяц», тёмная растущая кривая через точки 4, 7, 11, 19. Правая ось — «ошибок на 1 000 документов», светлая убывающая кривая через точки 12, 5, 2, менее 1. Точка 0,95 выделена кружком и подписана «рабочая настройка модельного расчёта». Внизу подпись «поток 1 200 документов, 3 минуты на проверку одного». Чертёжная сетка, приглушённая палитра, подписи по-русски.

Порог не выбирают один раз: его пересматривают после первого месяца замеров

Единого правильного порога не существует, потому что цена ошибки у полей разная. Поэтому на практике его задают не на документ целиком, а на группы полей, и отдельно решают, где нужен сплошной контроль независимо от уверенности модели.

  • Сплошной контроль всегда — банковские реквизиты и сумма к оплате, количество в отгрузочных документах, коды маркировки, любые данные, уходящие в государственную систему, и всё, что выше порога существенности компании.
  • Выборочный контроль допустим — там, где ошибка ловится дальше по цепочке: наименование для поиска, комментарий, дата документа при наличии сверки периода, служебные признаки.
  • Отдельная ветка для новых поставщиков и новых форм. Первые пять документов от нового контрагента проходят через человека независимо от уверенности: именно на них модель ошибается чаще всего.
  • Контрольная сумма на выходе. Число принятых документов и общая сумма сверяются с тем, что появилось в учёте; расхождение блокирует следующий запуск. Это защита не от модели, а от тихого сбоя робота.

Чем это делают в России на сентябрь 2026 года

Компоненты собираются в связку из разных источников, и это нормально: платформа робота, движок распознавания и модель извлечения полей вполне могут быть от трёх разных поставщиков. Важно заранее понять, кто отвечает за стык.

  • Sherpa IDP — интеллектуальная обработка документов внутри экосистемы Sherpa RPA. Вариант для тех, кому важно, чтобы за робота и за чтение отвечал один поставщик.
  • Content AI — российский преемник ABBYY: ContentReader PDF вместо FineReader, ContentCapture вместо FlexiCapture. Зрелый потоковый ввод с шаблонами и обучением.
  • Smart Engines — распознавание УПД, счетов-фактур, актов, ТОРГ-12, банковских выписок и платёжных документов, в том числе на мобильной съёмке.
  • 1С:Распознавание первичных документов — самый короткий путь, если весь поток и так приходит в 1С и типы документов типовые.
  • GigaChat и YandexGPT — для извлечения полей из неструктурированного текста: писем, заявок, нестандартных форм, где шаблон не построить.
Облачная модель и документы с персональными данными — отдельное решение

Договор, анкета, заявка от физического лица содержат персональные данные, и отправка их во внешний сервис — это обработка с участием третьего лица со всеми требованиями 152-ФЗ: локализация, согласия, поручение обработки. Решается это либо моделью на своём сервере, либо обезличиванием перед отправкой, либо отказом от облачного слоя на этом типе документов. Что именно уезжает наружу и как это ограничить, разобрано в материале про данные компании в облачном ИИ.

Когда связку делать не надо

Четыре ситуации, в которых добавление слоёв чтения к роботу не окупится или создаст больше проблем, чем решит.

  • Документы приходят через ЭДО. Данные уже структурированы, читать нечего. Здесь не нужен ни слой распознавания, ни чаще всего сам робот: работает штатная загрузка.
  • Поток меньше 300 документов в месяц. При 6 минутах на документ это 30 часов и 25 320 ₽ — ниже стоимости владения одним роботом даже без слоя распознавания. Дешевле оставить ручной ввод и заняться источником документов.
  • Формы строго одинаковые и не меняются. Шаблонный ввод справится дешевле и предсказуемее: за распознавание вы заплатите постранично, ничего не получив взамен.
  • Цена ошибки в поле выше стоимости всей операции. Платёжные реквизиты, коды маркировки, налоговые показатели. Здесь либо сплошной контроль человеком — и тогда экономия близка к нулю, — либо операция остаётся ручной.

И то, что стоит проговорить до начала проекта. Добавление модели к роботу не делает сценарий надёжнее — оно делает его применимее. Хрупкость никуда не уходит: третий слой по-прежнему кликает по чужому экрану и по-прежнему ломается от его перерисовки, а к этому добавляется новый класс проблем — молчаливая ошибка извлечения. Поэтому первый вопрос перед такой связкой остаётся прежним: точно ли у источника документов нет обмена данными, при котором читать вообще ничего не придётся.