Российская модель заменяет зарубежную на большинстве задач, ради которых компании вообще берут языковые модели, и разница там не видна без измерительного стенда. Заменяет не везде: есть один класс задач, где разрыв реальный и его не закрыть промтом. Разбирать это имеет смысл не в терминах «умнее — глупее», а по классам работы, потому что от класса зависит и разрыв, и способ его обойти.

Все оценки ниже — на сентябрь 2026 года. Отдельно напомним ограничение, которое часто пытаются обойти вместо того, чтобы принять: прямая оплата OpenAI и Anthropic из России невозможна, доступ идёт через посредников, и это юридический и операционный риск, а не рабочая рекомендация. Три типовые схемы такого доступа и цена их отключения разобраны в материале про серые схемы доступа к зарубежным моделям.

Четыре класса задач и разрыв по каждому

Классы отличаются тем, что именно определяет качество результата. В первых трёх это не модель, и потому замена в них проходит незаметно.

Класс задачЧто определяет результатРазрыв с зарубежной модельюЧто делать
Классификация и извлечение из текстаТочность описания полей и категорий1–2 процентных пунктаБрать российскую, время тратить на описание полей
Генерация типовых текстовПримеры в промте и правила стиляЗаметен только на длинных текстахТри-четыре образца в промте закрывают разницу
Ответы по базе знанийКачество поиска и полнота базыПрактически не виденВкладываться в базу и поиск, а не в модель
Многошаговые агенты с инструментамиУстойчивость на длинной цепочке шаговПринципиальныйРезать цепочку и проверять каждый шаг снаружи

Первый класс — самый массовый и самый неблагодарный для продавцов моделей. Разбор входящей почты, классификация обращений, извлечение полей из счетов и накладных: здесь качество упирается в то, насколько внятно описаны категории и что считать «датой документа», когда их в файле три. Похожие задачи мы разбирали в решениях классификация документов и обработка электронной почты — модель там не главный компонент.

Второй класс — генерация типовых текстов: коммерческие предложения по шаблону, описания товаров, ответы клиентам на повторяющиеся вопросы, короткие письма. Здесь разница между моделями заметна на длинных связных текстах и почти не заметна на коротких формах, а качество определяют три-четыре образца в промте и явные правила стиля. Признак, что дело не в модели: если тексты правит редактор, посмотрите, что именно он правит. Когда правки однотипны — не тот тон, не та структура, лишние обороты, — их снимает промт, а не смена поставщика модели.

Третий класс — ответы по базе знаний. Модель здесь отвечает только за последний шаг: сформулировать ответ по найденным фрагментам. Всё остальное делает поиск, и именно он определяет, будет ли ответ верным. Практическая проверка занимает полчаса: возьмите двадцать вопросов, на которые система ответила неверно, и посмотрите, был ли нужный фрагмент вообще среди найденных. Если в половине случаев не был — задача не в модели, а в базе и в поиске по ней, и смена модели не сдвинет ничего.

Число, ради которого стоило проводить замер

Задача: разложить письма закупщика на девять категорий и вытащить шесть полей. На 100 реальных письмах первая версия промта дала полноту извлечения 78 %. Переписанное описание полей — с примерами, правилами разрешения конфликтов и явным «чего делать не надо» — подняло её до 89 %. Замена российской модели на зарубежную через посредника дала 91 %. Одиннадцать пунктов против двух: разница между хорошим и плохим описанием процесса больше, чем разница между моделями.

сравнениеrossiyskie-modeli-vmesto-zarubezhnyh--01
Четыре класса задач и разрыв: от одного-двух пунктов до принципиального в агентах

Четыре горизонтальные полосы разной длины, длина пропорциональна величине разрыва. Сверху вниз: «Классификация и извлечение — 1–2 пункта», «Генерация типовых текстов — заметен на длинных», «Ответы по базе знаний — почти не виден», «Многошаговые агенты — принципиальный» (самая длинная полоса, выделена штриховкой). Справа от каждой полосы подпись «что решает результат»: описание полей, примеры в промте, качество поиска, длина цепочки. Чертёжный стиль, подписи по-русски.

В трёх классах из четырёх результат определяет не модель

Из чего выбирают: модели по назначению и размещению

Рейтингов «лучшая модель» мы не составляем: место в лидерборде не переносится на вашу задачу, и почему именно — разобрано в материале про то, как выбрать языковую модель для бизнеса. Полезнее таблица по назначению и способу размещения.

Что этоГде размещаетсяДля чего обычно берут
GigaChat 3 (Lite, Pro, Max)ОблакоКлассификация, извлечение, генерация типовых текстов
GigaChat 3.1 UltraОблакоДлинные документы и цепочки посложнее
GigaChat EnterpriseOn-premise, облако или гибридКогда данные не должны выходить за периметр компании
YandexGPT 5 и Yandex AI StudioОблакоСборка агентов, векторное хранилище, поиск по базе знаний
T-Lite и T-Pro (Т-Банк)Своё железоНебольшие задачи на скромных ресурсах
Cotype Pro (МТС)Облако или контурКорпоративные задачи на русском языке
Qwen 3, Llama 4, DeepSeek, Mistral через OllamaСвой сервер в РоссииКогда нужен полный контроль над данными и версией

Последняя строка стоит отдельного пояснения, потому что её часто понимают как «бесплатно». Открытые модели разворачиваются через Ollama, векторное хранилище обычно делается на pgvector, и лицензии действительно ничего не стоят. Стоит всё остальное: видеокарты, электричество, обновления, дежурство. Полная цена среднего контура — 89 700 ₽ в месяц, то есть 8,97 ₽ за обращение при потоке 10 000 обращений против 1,04 ₽ в облаке. Пять признаков, при которых эта разница оправдана, разобраны в материале про то, когда нужна модель в своём контуре.

Что это значитГлавный аргумент локальной модели

Не качество ответов, а отсутствие трансграничной передачи персональных данных. Модель на своём сервере в России означает, что содержимое запроса не покидает периметр и не проходит через третье лицо. Дополнительный довод на сентябрь 2026 — вступающее в силу регулирование ИИ с требованиями к маркировке машинного контента и к обработке персональных данных: локальный контур упрощает и то, и другое.

Где разрыв действительно есть

Четвёртый класс — агент, который сам решает, какие действия выполнить: сходить в учётную систему, сверить остаток, посчитать, написать письмо, проверить себя. Здесь важна не одна реплика, а способность не сбиться на длинной цепочке. Российские модели на таких сценариях пока уступают заметно, и промтом это не закрывается.

Полезнее, впрочем, посмотреть на арифметику цепочки, потому что она бьёт всех. Пусть надёжность одного шага равна 92 % — это хороший показатель для любой модели. Тогда вероятность довести цепочку до конца без вмешательства человека равна 0,92 в степени числа шагов.

Доля цепочек, доведённых до конца, при надёжности шага 92 %
Три шага: 0,92 × 0,92 × 0,9278 %
Пять шагов66 %
Восемь шагов51 %
Разница между тремя и восемью шагами27 пунктов
Прирост от смены модели на замере ста примеров2 пункта
ИтогоСокращение цепочки вдвое даёт больше, чем любая смена модели

Отсюда три приёма, которыми задача перестраивается так, что разрыв перестаёт быть критичным. Первый: резать длинную цепочку на короткие с фиксированным результатом на выходе каждой. Второй: выносить маршрут наружу — пусть последовательность шагов определяют правила в коде, а модель отвечает только за содержательные операции. Третий: проверять результат детерминированно там, где это возможно: сверять сумму с документом, сопоставлять контрагента со справочником, валидировать формат ИНН. Проверка кодом стоит копейки и не зависит от модели вообще.

графикrossiyskie-modeli-vmesto-zarubezhnyh--02
Доля доведённых цепочек: 78 процентов при трёх шагах, 66 при пяти, 51 при восьми

График с одной убывающей кривой. По горизонтальной оси — число шагов в цепочке от 1 до 10, по вертикальной — доля доведённых до конца цепочек от 0 до 100 %. На кривой выделены и подписаны три точки: 3 шага — 78 %, 5 шагов — 66 %, 8 шагов — 51 %. Сбоку короткий вертикальный отрезок с подписью «прирост от смены модели — 2 пункта» для масштаба. Чертёжный стиль, подписи по-русски.

Надёжность шага 92 %, а результат зависит от того, сколько их подряд

Как проверить замену на своих данных за неделю

Единственный честный способ ответить на вопрос «хватит ли нам российской модели» — измерить на своих данных. Не на демонстрации подрядчика, не на публичном тесте и не на десяти примерах, придуманных за обедом.

  1. 1
    Собрать 100 реальных примеров и разметить их руками

    Примеры берутся из живого потока за последний месяц, включая неудобные: письма с вложениями не по теме, документы со сканами, обращения на двух языках. Размечает предметный эксперт — тот, кто сегодня делает эту работу руками. Сто примеров по четыре минуты — 6,7 часа по ставке 2 000 ₽, то есть 13 400 ₽.

  2. 2
    Прогнать двух кандидатов на одном промте

    Стенд, единый промт, одинаковые условия, фиксация версии модели и даты. Восемь часов инженера по 3 000 ₽ — 24 000 ₽. Кандидатов именно двое: текущее решение и предполагаемая замена. Сравнивать сразу пятерых бессмысленно, пока не понятно, какая метрика важна.

  3. 3
    Разобрать расхождения глазами

    Не итоговый процент, а конкретные примеры, где модели разошлись. Три часа эксперта — 6 000 ₽. Обычно на этом шаге выясняется, что половина «ошибок» — это спорная разметка, и промт надо переписать обеим моделям, а не менять одну на другую.

  4. 4
    Принять решение по письменным критериям

    Критерии формулируются до замера, а не после. Рабочий набор: главная метрика не хуже текущей больше чем на 3 процентных пункта, ноль ошибок в дорогих полях (сумма, ИНН, срок), оценивает предметный эксперт, а не инженер. Решение фиксируется одной страницей с датой, версиями моделей и метриками.

Суммарно 43 400 ₽ и четыре рабочих дня на одну задачу и двух кандидатов. Полная методика выбора модели — шесть критериев, три кандидата, счёт за токены и стоимость будущей миграции — стоит около 66 000 ₽ и разобрана отдельно. Замена уже работающего решения дешевле, потому что половина вопросов на неё уже отвечена.

Чего в замере быть не должно

Первое: оценки инженера вместо оценки предметного эксперта — инженер систематически принимает правдоподобный ответ за верный. Второе: примеры, подобранные под демонстрацию, — берите подряд из потока. Третье: сравнение по одному числу без разбора расхождений. Четвёртое: молчаливая замена промта между прогонами — тогда вы меряете промт, а не модель.

Когда менять модель не надо

Четыре ситуации, в которых смена модели не даст ничего, а времени и денег заберёт как полноценный проект.

  • Текущая система работает и оплачивается без посредников. Если доступ легальный и стабильный, а данных клиентов в запросах нет, менять нечего. Разумное действие — заложить адаптер, чтобы смена модели стоила дни, а не месяцы; когда переход вообще не нужен, разобрано в материале про то, когда переходить на отечественное ПО не надо.
  • Проблема в базе знаний, а не в модели. Если система отвечает неверно на вопросы, ответа на которые нет ни в одном документе, замена модели ничего не изменит. Сначала корпоративная база знаний и поиск по ней, потом разговор о модели.
  • Ошибки идут из одного и того же места. Три категории писем из девяти дают 80 % ошибок — значит дело в описании этих трёх категорий. Сначала промт и примеры, потом сравнение моделей: иначе вы измерите свой промт двумя разными приборами.
  • Нет ни одного размеченного примера. Без сотни размеченных вручную случаев сравнение превращается в обмен впечатлениями. Разметка — это работа предметного эксперта на день, и её всё равно придётся сделать, потому что без неё не принять и результат внедрения.

И вывод, который стоит проверить на своей задаче, прежде чем спорить о моделях. В трёх классах из четырёх качество определяет не модель, а то, насколько внятно описан процесс: какие категории существуют, что считать датой документа, что делать при конфликте данных. Российские модели закрывают эти три класса полностью. Четвёртый класс закрывается не выбором модели, а сокращением цепочки — и это тоже работа с процессом, а не с технологией.

карта связейrossiyskie-modeli-vmesto-zarubezhnyh--03
Схема локального контура: приложение, Ollama с моделью и pgvector внутри периметра компании

Схема связей с явной рамкой периметра компании. Внутри рамки три узла со стрелками между ними: «Приложение и правила маршрута», «Модель на своём сервере (Ollama)», «Векторное хранилище (pgvector)». Внизу внутри рамки — «Учётная система и документы». Наружу за рамку выходит одна перечёркнутая стрелка с подписью «трансграничная передача». Сбоку подпись «89 700 ₽ в месяц, 8,97 ₽ за обращение против 1,04 ₽ в облаке». Чертёжный стиль, подписи по-русски.

Граница периметра — то, ради чего локальный контур покупают

Модель отвечает за то, чтобы понять текст. За то, чтобы в тексте было что понимать, отвечает описание процесса — и разница здесь на порядок больше.