Мультимодальная модель — это модель, которая принимает на вход не только текст, но и изображение или звук, а отвечает по-прежнему текстом. Для бизнеса это означает ровно одно: можно задать вопрос по фотографии, скану или скриншоту, не описывая словами, что на них изображено. Полезно это в трёх сценариях; в остальных мультимодальность делает запрос дороже и результат менее предсказуемым, чем у специализированного инструмента.
Разговор о ней обычно съезжает на цену токенов, и это ложный след. На реальных потоках разница в счёте между «с картинкой» и «без картинки» измеряется тысячей рублей в месяц. Деньги лежат в другом месте — в доле результатов, которые придётся смотреть человеку. Именно её и определяет выбор маршрута, а не тариф провайдера.
Дальше — три сценария, где универсальная модель действительно выигрывает; где её обыгрывает специализированный распознаватель и почему; модельный расчёт по фотоотчётам со стройки и способ пересчитать его на свои файлы; отдельно про звук, который устроен принципиально иначе; и правило выбора в одну строку.
Три места, где мультимодальность действительно нужна
Общее у всех трёх — вход, форму которого нельзя предсказать заранее. Никто не знает, под каким углом прораб сфотографирует армирование и что попадёт в кадр. Именно эту неопределённость универсальная модель переносит лучше любого настроенного шаблона.
- 1Фотоотчёт с объекта или из точки
Прораб присылает снимки этапа, торговый представитель — выкладку на полке, водитель — состояние груза при приёмке. Модель отвечает на вопрос словами: виден ли этап, есть ли явное нарушение, соответствует ли выкладка планограмме. Чего от неё не ждать — измерений: «сколько метров» и «какой процент полки» надёжно считает не она, а компьютерное зрение под конкретную задачу.
- 2Скан, на котором споткнулся распознаватель
Печать поверх текста, перекос, фотография документа с телефона под лампой, нестандартный бланк поставщика. Такие документы в потоке первички составляют меньшинство, но именно они и уходят в ручную очередь. Мультимодальная модель здесь работает не вместо распознавателя, а вторым эшелоном — по тем страницам, которые основной инструмент вернул с низкой уверенностью.
- 3Скриншот от клиента в поддержке
Клиент присылает картинку с ошибкой вместо описания. Раньше это означало обязательного оператора: текстовый бот такое обращение просто не понимал. Мультимодальная модель читает надпись на скриншоте, определяет экран и либо отвечает по базе знаний, либо честно передаёт человеку — но уже с расшифровкой того, что было на картинке.
Второй сценарий — самый частый в работе и самый дешёвый из трёх, потому что модель обрабатывает не весь поток, а хвост. Если распознаватель возвращает с низкой уверенностью 8 % страниц, то на потоке 5 000 страниц в месяц через модель проходит 400 листов, а не пять тысяч: при цене запроса около 0,7 ₽ это 280 ₽ в месяц. Для сравнения, те же 400 листов ручного ввода по 3 минуты на лист — это 20 часов и 14 000 ₽ по ставке 700 ₽/час. Модель снимает часть этой очереди, а не всю: её результат всё равно смотрят выборочно.
Где специализированный инструмент точнее и дешевле
Как только формат входа становится постоянным, универсальность превращается в недостаток. Распознаватель под конкретный тип документа знает, где на бланке лежит ИНН, и возвращает поле с признаком уверенности; мультимодальная модель каждый раз читает лист заново и с равной вежливостью отдаёт и верное значение, и придуманное. На российском рынке по состоянию на сентябрь 2026 года эту работу делают Content AI (преемник ABBYY: ContentReader PDF и ContentCapture), Smart Engines и 1С:Распознавание первичных документов — их сравнение мы разбирали в отдельном материале.
| Что на входе | Формат | Что брать | Почему |
|---|---|---|---|
| УПД, счета-фактуры, ТОРГ-12, банковские выписки | Постоянный, число шаблонов конечно | Специализированный распознаватель | Цена за страницу предсказуема, поля привязаны жёстко, есть признак уверенности по каждому |
| Договоры контрагентов со спецификациями | Полупостоянный: структура своя у каждого | Гибрид: распознавание в текст, затем модель для извлечения условий | Разметка страницы стабильна, а формулировки условий — нет |
| Фотоотчёты с объектов и точек продаж | Непредсказуемый | Мультимодальная модель | Ни ракурс, ни состав кадра заранее не известны, шаблон настроить не на что |
| Скриншоты от клиентов в поддержке | Непредсказуемый | Мультимодальная модель | Задача — понять смысл экрана, а не извлечь фиксированный набор полей |
| Рукописные пометки, мятые чеки, снимки с телефона | Плохой и разный | Сначала пилот на 200 своих файлах, потом решение | Разброс качества настолько велик, что решать по чужим цифрам нельзя |
Сравнение в две колонки, пять подписанных строк. Левая колонка «Специализированный распознаватель»: «формат входа — постоянный», «цена — предсказуемая, за страницу», «поля — привязаны жёстко», «уверенность — по каждому полю отдельно», «настройка — под каждый новый тип документа». Правая колонка «Мультимодальная модель»: «формат входа — любой», «цена — за токены, зависит от разрешения», «поля — как попросили в запросе», «уверенность — не сообщает», «настройка — не требуется». Под колонками общая подпись во всю ширину: «Постоянный формат — левая колонка. Непредсказуемый — правая». Чертёжный стиль, подписи по-русски.
Распознаватель возвращает по каждому полю признак уверенности, и по нему строится очередь ручной проверки. Мультимодальная модель отдаёт ответ ровно одним тоном — и когда прочитала правильно, и когда не прочитала вовсе. Поэтому в её маршруте очередь проверки строится не по уверенности, а по выборке: смотрят фиксированную долю результатов. Как считается размер этой выборки, разобрано в материале про реальную точность распознавания.
Что картинка добавляет к счёту
Модельный пример: строительная компания, 10 объектов, по 10 снимков с каждого ежедневно — 3 000 фотоотчётов в месяц. Модель отвечает на два вопроса: виден ли на снимке заявленный этап и есть ли явное нарушение. Тарифы те же, что и в наших остальных расчётах по состоянию на сентябрь 2026 года: 0,20 ₽ за 1 000 входных токенов и 0,60 ₽ за 1 000 выходных.
Эти 1 020 ₽ и есть настоящий масштаб спора о токенах на среднем потоке. Для сравнения — соседняя строка того же процесса. Если прорабу приходится смотреть глазами 10 % снимков по минуте на каждый, это 5 часов в месяц, или 3 500 ₽ по полной ставке 700 ₽/час. Если доля проверки окажется 30 %, будет 15 часов и 10 500 ₽. Разница между двумя вариантами маршрута — 7 000 ₽ в месяц, вшестеро больше всей разницы по токенам. Какая доля получится у вас, честно узнаётся только на пилоте: обе границы взяты как рабочие ориентиры, а не как измеренный результат.
Столбчатая диаграмма из четырёх подписанных столбцов, ось в рублях в месяц от 0 до 11 000. Столбцы: «Запросы без картинки — 1 140 ₽», «Запросы с картинкой — 2 160 ₽», «Ручная проверка 10 % — 3 500 ₽», «Ручная проверка 30 % — 10 500 ₽». Между первыми двумя столбцами фигурная скобка с подписью «1 020 ₽», между третьим и четвёртым — скобка с подписью «7 000 ₽», вторая скобка заметно крупнее. Внизу сноска: «3 000 снимков в месяц, ставка сотрудника 700 ₽/час, тарифы сентября 2026». Чертёжный стиль, подписи по-русски.
В расчёте только одно неизвестное — сколько токенов весит ваша картинка. У каждого провайдера изображение тарифицируется по-своему: обычно оно нарезается на плитки, и итог зависит от разрешения. Загрузите десять типовых снимков, посмотрите в ответе провайдера израсходованные входные токены, возьмите среднее и подставьте вместо 1 700. Остальная арифметика — из разбора токенов и стоимости запросов.
Звук устроен иначе: это два шага, а не один
С картинкой модель работает напрямую. Со звуком — почти никогда: между записью и языковой моделью стоит отдельный шаг расшифровки речи, и у него собственная цена и собственная точность. Путать эти два шага дорого, потому что ошибка первого не лечится качеством второго: модель не может восстановить слово, которого не услышал распознаватель.
- 1Запись. Качество канала определяет всё остальное. Гарнитура даёт один результат, громкая связь в цехе — принципиально другой, и никакая настройка модели этой разницы не компенсирует.
- 2Расшифровка речи. По рынку на сентябрь 2026 года — 1,5–4 ₽ за минуту. В наших расчётах по речевой аналитике поток 900 звонков по 6 минут при ставке 2 ₽/мин даёт 10 800 ₽ в месяц только на этом шаге.
- 3Словарь терминов. Названия товаров, бренды, фамилии и аббревиатуры подставляются в распознаватель списком. Это самый дешёвый способ поднять точность на вашей лексике — как собрать такой словарь, мы описывали отдельно.
- 4Языковая модель. Работает уже с текстом расшифровки и стоит как обычный текстовый запрос. Здесь появляются резюме звонка, извлечение договорённостей и заполнение полей карточки.
Про точность стоит говорить числами. На чистой записи с гарнитуры реалистичный ориентир — 5–12 % ошибок по словам; на телефонном канале с шумом и наложением голосов он уходит заметно выше, и мы подробно разбирали этот разрыв в материале про точность распознавания русской речи. Практический вывод для сметы: ошибки распределяются неравномерно и собираются в кучу на плохих записях, поэтому доля полностью пригодных расшифровок всегда ниже, чем следует из среднего процента.
Правило выбора в одну строку
Если у входа есть постоянный формат — берите специализированный инструмент. Если формат непредсказуем — мультимодальную модель. Обратите внимание: речь про формат, а не про тип файла. Скан УПД и фотография стены оба являются картинками, но первый приходит в конечном числе шаблонов, а вторая — в бесконечном.
На смешанном потоке правило применяется не к потоку целиком, а к каждому входу отдельно, и развилка ставится один раз — сразу на приёме. Практический порядок работ такой: выписать все входы процесса списком, у каждого честно ответить, конечно ли число форм, и только после этого выбирать инструменты. Если сортировку не сделать заранее, вся пачка неизбежно уедет в один маршрут — обычно в универсальный, потому что он запускается быстрее, — и ручная проверка вырастет там, где её можно было не иметь совсем.
Схема потока данных слева направо. Слева четыре входных блока: «Скан УПД», «Фото с объекта», «Скриншот клиента», «Запись звонка». Все, кроме записи звонка, сходятся в ромб-развилку с подписью «формат постоянный?». Ветка «да» ведёт в блок «Распознаватель: Content AI, Smart Engines, 1С:Распознавание», от него стрелка «поля с признаком уверенности». Ветка «нет» ведёт в блок «Мультимодальная модель», от него стрелка «ответ словами, уверенность не сообщается». Запись звонка идёт отдельной нижней дорожкой через два последовательных блока: «Расшифровка речи, 1,5–4 ₽/мин» → «Языковая модель». Все три маршрута сходятся в блок «Очередь проверки человеком», подписанный «по уверенности — сверху, по выборке — снизу», и дальше в блок «Учётная система». Чертёжный стиль, все подписи по-русски.
Когда мультимодальность не нужна вовсе
Универсальная модель — это не апгрейд, а другой инструмент со своей областью. Четыре ситуации, где переход на неё ухудшит результат при росте цены.
- Поток однороден, а распознаватель уже работает. Замена настроенного маршрута на модель означает потерю признака уверенности по полям — то есть потерю способа строить очередь проверки. Экономия на лицензии не покроет этой потери.
- Нужны измерения, а не суждения. Количество коробок в кадре, процент заполнения полки, размер дефекта — задачи компьютерного зрения, а не языковой модели. Она ответит уверенно и мимо.
- Картинку можно не отправлять. Если из системы уже приходит номер, статус и сумма, отправлять их скриншотом вместо текста — это платить за перевод данных в картинку и обратно.
- Речь идёт о персональных данных на снимках. Фото документов, пропусков и медицинских бланков, уходящие в облачную модель, — это трансграничная передача, если контур не в России. Что с этим делать, разобрано в материале про приватность запросов к языковой модели.
Мультимодальность отвечает на вопрос «а что вообще на этом изображении». Если ответ вы знаете заранее, платить за вопрос не нужно.
