Российская модель заменяет зарубежную на большинстве задач, ради которых компании вообще берут языковые модели, и разница там не видна без измерительного стенда. Заменяет не везде: есть один класс задач, где разрыв реальный и его не закрыть промтом. Разбирать это имеет смысл не в терминах «умнее — глупее», а по классам работы, потому что от класса зависит и разрыв, и способ его обойти.
Все оценки ниже — на сентябрь 2026 года. Отдельно напомним ограничение, которое часто пытаются обойти вместо того, чтобы принять: прямая оплата OpenAI и Anthropic из России невозможна, доступ идёт через посредников, и это юридический и операционный риск, а не рабочая рекомендация. Три типовые схемы такого доступа и цена их отключения разобраны в материале про серые схемы доступа к зарубежным моделям.
Четыре класса задач и разрыв по каждому
Классы отличаются тем, что именно определяет качество результата. В первых трёх это не модель, и потому замена в них проходит незаметно.
| Класс задач | Что определяет результат | Разрыв с зарубежной моделью | Что делать |
|---|---|---|---|
| Классификация и извлечение из текста | Точность описания полей и категорий | 1–2 процентных пункта | Брать российскую, время тратить на описание полей |
| Генерация типовых текстов | Примеры в промте и правила стиля | Заметен только на длинных текстах | Три-четыре образца в промте закрывают разницу |
| Ответы по базе знаний | Качество поиска и полнота базы | Практически не виден | Вкладываться в базу и поиск, а не в модель |
| Многошаговые агенты с инструментами | Устойчивость на длинной цепочке шагов | Принципиальный | Резать цепочку и проверять каждый шаг снаружи |
Первый класс — самый массовый и самый неблагодарный для продавцов моделей. Разбор входящей почты, классификация обращений, извлечение полей из счетов и накладных: здесь качество упирается в то, насколько внятно описаны категории и что считать «датой документа», когда их в файле три. Похожие задачи мы разбирали в решениях классификация документов и обработка электронной почты — модель там не главный компонент.
Второй класс — генерация типовых текстов: коммерческие предложения по шаблону, описания товаров, ответы клиентам на повторяющиеся вопросы, короткие письма. Здесь разница между моделями заметна на длинных связных текстах и почти не заметна на коротких формах, а качество определяют три-четыре образца в промте и явные правила стиля. Признак, что дело не в модели: если тексты правит редактор, посмотрите, что именно он правит. Когда правки однотипны — не тот тон, не та структура, лишние обороты, — их снимает промт, а не смена поставщика модели.
Третий класс — ответы по базе знаний. Модель здесь отвечает только за последний шаг: сформулировать ответ по найденным фрагментам. Всё остальное делает поиск, и именно он определяет, будет ли ответ верным. Практическая проверка занимает полчаса: возьмите двадцать вопросов, на которые система ответила неверно, и посмотрите, был ли нужный фрагмент вообще среди найденных. Если в половине случаев не был — задача не в модели, а в базе и в поиске по ней, и смена модели не сдвинет ничего.
Задача: разложить письма закупщика на девять категорий и вытащить шесть полей. На 100 реальных письмах первая версия промта дала полноту извлечения 78 %. Переписанное описание полей — с примерами, правилами разрешения конфликтов и явным «чего делать не надо» — подняло её до 89 %. Замена российской модели на зарубежную через посредника дала 91 %. Одиннадцать пунктов против двух: разница между хорошим и плохим описанием процесса больше, чем разница между моделями.
Четыре горизонтальные полосы разной длины, длина пропорциональна величине разрыва. Сверху вниз: «Классификация и извлечение — 1–2 пункта», «Генерация типовых текстов — заметен на длинных», «Ответы по базе знаний — почти не виден», «Многошаговые агенты — принципиальный» (самая длинная полоса, выделена штриховкой). Справа от каждой полосы подпись «что решает результат»: описание полей, примеры в промте, качество поиска, длина цепочки. Чертёжный стиль, подписи по-русски.
Из чего выбирают: модели по назначению и размещению
Рейтингов «лучшая модель» мы не составляем: место в лидерборде не переносится на вашу задачу, и почему именно — разобрано в материале про то, как выбрать языковую модель для бизнеса. Полезнее таблица по назначению и способу размещения.
| Что это | Где размещается | Для чего обычно берут |
|---|---|---|
| GigaChat 3 (Lite, Pro, Max) | Облако | Классификация, извлечение, генерация типовых текстов |
| GigaChat 3.1 Ultra | Облако | Длинные документы и цепочки посложнее |
| GigaChat Enterprise | On-premise, облако или гибрид | Когда данные не должны выходить за периметр компании |
| YandexGPT 5 и Yandex AI Studio | Облако | Сборка агентов, векторное хранилище, поиск по базе знаний |
| T-Lite и T-Pro (Т-Банк) | Своё железо | Небольшие задачи на скромных ресурсах |
| Cotype Pro (МТС) | Облако или контур | Корпоративные задачи на русском языке |
| Qwen 3, Llama 4, DeepSeek, Mistral через Ollama | Свой сервер в России | Когда нужен полный контроль над данными и версией |
Последняя строка стоит отдельного пояснения, потому что её часто понимают как «бесплатно». Открытые модели разворачиваются через Ollama, векторное хранилище обычно делается на pgvector, и лицензии действительно ничего не стоят. Стоит всё остальное: видеокарты, электричество, обновления, дежурство. Полная цена среднего контура — 89 700 ₽ в месяц, то есть 8,97 ₽ за обращение при потоке 10 000 обращений против 1,04 ₽ в облаке. Пять признаков, при которых эта разница оправдана, разобраны в материале про то, когда нужна модель в своём контуре.
Не качество ответов, а отсутствие трансграничной передачи персональных данных. Модель на своём сервере в России означает, что содержимое запроса не покидает периметр и не проходит через третье лицо. Дополнительный довод на сентябрь 2026 — вступающее в силу регулирование ИИ с требованиями к маркировке машинного контента и к обработке персональных данных: локальный контур упрощает и то, и другое.
Где разрыв действительно есть
Четвёртый класс — агент, который сам решает, какие действия выполнить: сходить в учётную систему, сверить остаток, посчитать, написать письмо, проверить себя. Здесь важна не одна реплика, а способность не сбиться на длинной цепочке. Российские модели на таких сценариях пока уступают заметно, и промтом это не закрывается.
Полезнее, впрочем, посмотреть на арифметику цепочки, потому что она бьёт всех. Пусть надёжность одного шага равна 92 % — это хороший показатель для любой модели. Тогда вероятность довести цепочку до конца без вмешательства человека равна 0,92 в степени числа шагов.
Отсюда три приёма, которыми задача перестраивается так, что разрыв перестаёт быть критичным. Первый: резать длинную цепочку на короткие с фиксированным результатом на выходе каждой. Второй: выносить маршрут наружу — пусть последовательность шагов определяют правила в коде, а модель отвечает только за содержательные операции. Третий: проверять результат детерминированно там, где это возможно: сверять сумму с документом, сопоставлять контрагента со справочником, валидировать формат ИНН. Проверка кодом стоит копейки и не зависит от модели вообще.
График с одной убывающей кривой. По горизонтальной оси — число шагов в цепочке от 1 до 10, по вертикальной — доля доведённых до конца цепочек от 0 до 100 %. На кривой выделены и подписаны три точки: 3 шага — 78 %, 5 шагов — 66 %, 8 шагов — 51 %. Сбоку короткий вертикальный отрезок с подписью «прирост от смены модели — 2 пункта» для масштаба. Чертёжный стиль, подписи по-русски.
Как проверить замену на своих данных за неделю
Единственный честный способ ответить на вопрос «хватит ли нам российской модели» — измерить на своих данных. Не на демонстрации подрядчика, не на публичном тесте и не на десяти примерах, придуманных за обедом.
- 1Собрать 100 реальных примеров и разметить их руками
Примеры берутся из живого потока за последний месяц, включая неудобные: письма с вложениями не по теме, документы со сканами, обращения на двух языках. Размечает предметный эксперт — тот, кто сегодня делает эту работу руками. Сто примеров по четыре минуты — 6,7 часа по ставке 2 000 ₽, то есть 13 400 ₽.
- 2Прогнать двух кандидатов на одном промте
Стенд, единый промт, одинаковые условия, фиксация версии модели и даты. Восемь часов инженера по 3 000 ₽ — 24 000 ₽. Кандидатов именно двое: текущее решение и предполагаемая замена. Сравнивать сразу пятерых бессмысленно, пока не понятно, какая метрика важна.
- 3Разобрать расхождения глазами
Не итоговый процент, а конкретные примеры, где модели разошлись. Три часа эксперта — 6 000 ₽. Обычно на этом шаге выясняется, что половина «ошибок» — это спорная разметка, и промт надо переписать обеим моделям, а не менять одну на другую.
- 4Принять решение по письменным критериям
Критерии формулируются до замера, а не после. Рабочий набор: главная метрика не хуже текущей больше чем на 3 процентных пункта, ноль ошибок в дорогих полях (сумма, ИНН, срок), оценивает предметный эксперт, а не инженер. Решение фиксируется одной страницей с датой, версиями моделей и метриками.
Суммарно 43 400 ₽ и четыре рабочих дня на одну задачу и двух кандидатов. Полная методика выбора модели — шесть критериев, три кандидата, счёт за токены и стоимость будущей миграции — стоит около 66 000 ₽ и разобрана отдельно. Замена уже работающего решения дешевле, потому что половина вопросов на неё уже отвечена.
Первое: оценки инженера вместо оценки предметного эксперта — инженер систематически принимает правдоподобный ответ за верный. Второе: примеры, подобранные под демонстрацию, — берите подряд из потока. Третье: сравнение по одному числу без разбора расхождений. Четвёртое: молчаливая замена промта между прогонами — тогда вы меряете промт, а не модель.
Когда менять модель не надо
Четыре ситуации, в которых смена модели не даст ничего, а времени и денег заберёт как полноценный проект.
- Текущая система работает и оплачивается без посредников. Если доступ легальный и стабильный, а данных клиентов в запросах нет, менять нечего. Разумное действие — заложить адаптер, чтобы смена модели стоила дни, а не месяцы; когда переход вообще не нужен, разобрано в материале про то, когда переходить на отечественное ПО не надо.
- Проблема в базе знаний, а не в модели. Если система отвечает неверно на вопросы, ответа на которые нет ни в одном документе, замена модели ничего не изменит. Сначала корпоративная база знаний и поиск по ней, потом разговор о модели.
- Ошибки идут из одного и того же места. Три категории писем из девяти дают 80 % ошибок — значит дело в описании этих трёх категорий. Сначала промт и примеры, потом сравнение моделей: иначе вы измерите свой промт двумя разными приборами.
- Нет ни одного размеченного примера. Без сотни размеченных вручную случаев сравнение превращается в обмен впечатлениями. Разметка — это работа предметного эксперта на день, и её всё равно придётся сделать, потому что без неё не принять и результат внедрения.
И вывод, который стоит проверить на своей задаче, прежде чем спорить о моделях. В трёх классах из четырёх качество определяет не модель, а то, насколько внятно описан процесс: какие категории существуют, что считать датой документа, что делать при конфликте данных. Российские модели закрывают эти три класса полностью. Четвёртый класс закрывается не выбором модели, а сокращением цепочки — и это тоже работа с процессом, а не с технологией.
Схема связей с явной рамкой периметра компании. Внутри рамки три узла со стрелками между ними: «Приложение и правила маршрута», «Модель на своём сервере (Ollama)», «Векторное хранилище (pgvector)». Внизу внутри рамки — «Учётная система и документы». Наружу за рамку выходит одна перечёркнутая стрелка с подписью «трансграничная передача». Сбоку подпись «89 700 ₽ в месяц, 8,97 ₽ за обращение против 1,04 ₽ в облаке». Чертёжный стиль, подписи по-русски.
Модель отвечает за то, чтобы понять текст. За то, чтобы в тексте было что понимать, отвечает описание процесса — и разница здесь на порядок больше.
