Качество модели на русском проверяется не разговором, а пятью контрольными точками: склонение фамилий и адресов, отраслевые сокращения, числа с единицами измерения, отрицания и длинные канцелярские конструкции из договоров. Во всех пяти местах ошибка выглядит правдоподобно — текст остаётся гладким, а условие в нём меняется на противоположное. Именно поэтому впечатление от демонстрации ничего не доказывает.
Протокол ниже занимает один рабочий день и 21 104 ₽: 50 примеров из вашей собственной переписки и документов, эталонные ответы к ним, прогон через двух кандидатов и слепая оценка двумя людьми. Повторить его на новой версии модели стоит уже 6 404 ₽, потому что самая дорогая часть — эталоны — пишется один раз.
Ставки в расчётах — канонические для журнала: инженер 3 000 ₽/час, предметный специалист и методист 900 ₽/час. Цены на модели и состав кандидатов меняются каждые несколько месяцев, поэтому все числа даны по состоянию на сентябрь 2026 года и снабжены способом пересчитать их на своих объёмах.
Пять мест, где ломается русский
Порядок в таблице — по частоте, с которой мы встречаем ошибку в разборах, а не по тяжести. Самая дорогая строка здесь четвёртая: сглаженное отрицание меняет смысл пункта договора и при этом не выглядит ошибкой ни для кого, кроме юриста.
| Что ломается | Как выглядит в ответе | Чем проверить за пять минут |
|---|---|---|
| Склонение ФИО, адресов и названий | «Договор с Иванов Пётр Сергеевич», «в городе Нижний Новгород» вместо «в Нижнем Новгороде». Отдельно ломаются женские фамилии и фамилии на -ко, -их, -аго | 10 карточек клиентов из своей базы, включая двойные и нерусские фамилии |
| Сокращения и аббревиатуры отрасли | УПД в одном абзаце раскрывается, в соседнем остаётся сокращением; КС-2 читается как марка стали; МЧД принимается за опечатку | 15 своих сокращений внутри реальных фраз, а не списком |
| Числа с единицами | «1 500 м²» превращается в «1,5 тыс. метров», разряды теряются, «руб.» и «₽» смешиваются в одном перечне | Пять строк спецификации с ценами, весами и объёмами |
| Отрицания и условия | «Не подлежит возврату» в пересказе становится «подлежит возврату при условии». Текст гладкий, смысл обратный | 10 пунктов договора со словами «не», «за исключением», «кроме случаев» |
| Канцелярские конструкции | Предложение с тремя причастными оборотами пересказывается с потерей одного условия — обычно того, которое стоит в середине | Пять абзацев своего договора длиной от 60 слов |
Обратите внимание, что в правой колонке нет ни одного придуманного примера. Материал для проверки берётся из вашей базы, вашего договора и вашей спецификации — иначе замер показывает качество модели на чужих текстах. Тот же принцип лежит в основе методики измерения качества на своих данных: сравнивать можно только с эталоном, который написал ваш предметный специалист.
Таблица-сравнение из пяти горизонтальных полос. Каждая полоса разделена на две части: слева «как должно быть», справа «как отвечает модель». Строки подписаны: «Фамилии и адреса» — «в Нижнем Новгороде» против «в городе Нижний Новгород»; «Сокращения» — «УПД» против «универсальный передаточный документ»; «Числа с единицами» — «1 500 м²» против «1,5 тыс. метров»; «Отрицания» — «не подлежит возврату» против «подлежит возврату при условии»; «Канцелярит» — «три условия» против «два условия». Правая часть четвёртой строки выделена как самая дорогая ошибка. Чертёжный стиль, подписи по-русски.
Почему англоязычный рейтинг не переносится на ваши документы
Публичные рейтинги решают другую задачу. Они измеряют универсальность модели на широком наборе академических заданий, чтобы сравнить между собой десятки участников. Ваша задача противоположна по устройству: одна операция, один тип документа, один словарь, повторяющийся тысячи раз. Высокий средний балл не гарантирует, что именно на ваших накладных не ломается извлечение позиций.
Вторая причина прозаичнее: половина участников мировых лидербордов недоступна российской компании для прямой оплаты, а результаты для русского языка в них либо получены переводом заданий, либо отсутствуют. Из чего реально приходится выбирать в России и как ставить кандидатов в сравнение, разобрано отдельно — в материале про сравнение российских моделей на задачах и в опорной статье про выбор языковой модели для бизнеса.
Собственный замер на 50 примерах. Он не отвечает на вопрос «какая модель лучше», он отвечает на единственный вопрос, который вам нужен: проходит ли этот кандидат порог на моих текстах. Порог формулируется до замера, иначе результат подгоняется под уже сделанный выбор.
Протокол проверки: 50 примеров, один рабочий день
Пятьдесят примеров — минимальный размер, при котором видна разница между кандидатами по пяти точкам сразу: по десять на каждую. Для приёмки системы этого мало, там работает регресс-набор из 180 примеров, но для выбора между двумя-тремя моделями достаточно.
- 1Шаг 1. Отбор и обезличивание — 1,5 часа
По 10 примеров на каждую из пяти точек, взятых случайно из реального потока, а не отобранных руками. Персональные данные заменяются на выдуманные, но с сохранением грамматической формы: если в оригинале была фамилия на -ых, в замене тоже должна быть.
- 2Шаг 2. Эталонные ответы — 5 часов
Предметный специалист пишет, как правильно, по 6 минут на пример. Эталон пишет не тот, кто будет настраивать промпт, — иначе замер превращается в проверку собственной работы.
- 3Шаг 3. Прогон через кандидатов — 1,5 часа
Одинаковая инструкция, одинаковый порядок примеров, два-три кандидата. Токены на 100 ответов стоят около 104 ₽ — в этом замере деньги уходят на людей, а не на модель.
- 4Шаг 4. Слепая оценка — 5 часов на двоих
Оценщики не знают, чей ответ читают: имена кандидатов скрыты, порядок перемешан. Оценка бинарная — принял бы такой ответ в работу или нет. Расхождения между двумя оценщиками разбираются отдельно и часто оказываются спором о требованиях, а не о модели.
- 5Шаг 5. Свод и решение — 1 час
Таблица на пять строк: по каждой контрольной точке — сколько ответов принято у каждого кандидата. Решение принимается по строкам, а не по общей сумме: провал на отрицаниях не компенсируется успехом на склонениях.
Повтор при выходе новой версии модели стоит вчетверо дешевле: прогон 3 000 ₽, токены 104 ₽, разбор только расхождений 1 800 ₽ и свод 1 500 ₽ — 6 404 ₽ и полдня. Это же и есть аргумент за то, чтобы протокол существовал в письменном виде: один раз собранный набор превращается в дешёвую регулярную процедуру. Что происходит с системой, когда провайдер молча меняет версию под прежним именем, разобрано в материале про обновление версии модели.
Горизонтальная лента одного рабочего дня с пятью подписанными отрезками разной длины: «Отбор и обезличивание — 1,5 ч», «Эталонные ответы — 5 ч», «Прогон двух кандидатов — 1,5 ч», «Слепая оценка вдвоём — 5 ч», «Свод и решение — 1 ч». Под лентой итог «14 часов, 21 104 ₽». Ниже вторая, короткая лента с подписью «повтор на новой версии — 3,5 ч, 6 404 ₽», совмещённая по левому краю с первой. Чертёжный стиль, подписи по-русски.
Красный флаг: модель отвечает переводом
Отдельный класс кандидатов обрабатывает русский через промежуточный английский. Формально они отвечают по-русски, и на коротких вопросах это незаметно. На деловых текстах такая модель ломается ровно там, где вам дороже всего: в формулировках договора и в реквизитах.
Кальки и неестественный порядок слов в длинных предложениях. Единицы измерения, переведённые в чужую систему: мили, фунты, галлоны. Даты в формате 09/05/2026 вместо 5 сентября 2026 года. Прямые кавычки вместо ёлочек и англоязычные названия документов — invoice вместо счёта. Потеря падежа у подставленного имени: «отправлено Иванов Пётр». Наконец, самый надёжный признак — резкий рост времени ответа на длинных русских текстах при нормальной скорости на коротких. Один-два признака ещё ничего не значат, четыре и больше означают, что кандидат не подходит для работы с договорами и первичкой.
Чем отечественные модели обычно сильнее — и чего это не значит
По состоянию на сентябрь 2026 года мы устойчиво наблюдаем разрыв в пользу российских моделей на четырёх вещах — и намеренно не приводим здесь процентов, потому что честная цифра получается только на ваших примерах, а чужая цифра устареет вместе с версией модели.
- Склонение ФИО и топонимов в сгенерированных документах: письма, шапки договоров, обращения в рассылках.
- Сокращения российской деловой практики: УПД, КС-2, ТОРГ-12, МЧД, ОКВЭД, ЕГАИС узнаются без подсказки в инструкции.
- Канцелярские конструкции: длинные предложения договоров и регламентов пересказываются с меньшей потерей условий.
- Отраслевой сленг рынка РФ: обозначения, которых нет в переводных источниках, — от «первички» до названий форм отчётности.
Чего это не значит: универсального превосходства. На извлечении данных из структурированных документов, на работе с кодом и на длинном контексте картина другая и меняется от версии к версии. Поэтому вывод из этого раздела один — включать российских кандидатов в сравнение обязательно, а решать всё равно по своему замеру. Живой разбор двух платформ по деньгам и составу есть в сравнении GigaChat и YandexGPT.
Что делать, если качество на русском не устраивает
Четыре выхода, и менять модель следует пробовать последним — он самый дорогой и самый долгий. Цифры ниже даны для системы, у которой база знаний и адаптер уже есть.
| Что делаем | Часы и деньги | Что чинит | Чего не чинит |
|---|---|---|---|
| Примеры в инструкции: 6–10 разобранных случаев прямо в промпте | 8 часов, 19 800 ₽, полдня | Форму ответа, оформление чисел, обращение к клиенту | Незнание ваших терминов и сокращений |
| Глоссарий в базе знаний: 300 терминов с определениями и синонимами | 23 часа, 35 400 ₽, два дня | Отраслевые сокращения, омонимы, внутренние обозначения | Грамматику и склонение в генерируемых документах |
| Предобработка текста до отправки: раскрытие сокращений, нормализация чисел и ФИО | 12 часов, 36 000 ₽, два-три дня | Числа с единицами, реквизиты, устойчивые формы имён | Смысловые ошибки в пересказе договора |
| Смена модели на другого кандидата | 34 часа, 102 000 ₽, 3–4 недели | Всё перечисленное сразу, если новый кандидат действительно сильнее | Ничего, если проблема в данных, а не в модели |
Разница в пять раз между первой и последней строкой — не аргумент против смены модели, а аргумент за порядок действий. Начинайте с двух верхних строк, потому что они проверяются за день и не требуют переезда. Как устроен словарь терминов и почему дообучение здесь почти всегда лишнее, разобрано в соседнем материале про отраслевую терминологию, а полная процедура переезда — в статье про смену модели без переписывания системы.
Столбчатая диаграмма из четырёх столбцов, ось Y — рубли от 0 до 110 000. Столбцы подписаны снизу: «Примеры в инструкции — 19 800 ₽», «Глоссарий — 35 400 ₽», «Предобработка текста — 36 000 ₽», «Смена модели — 102 000 ₽». Под каждым столбцом вторая подпись со сроком: «полдня», «два дня», «два-три дня», «3–4 недели». Первые три столбца затонированы одинаково, четвёртый выделен контуром. Внизу подпись «модельный расчёт, сентябрь 2026, ставка инженера 3 000 ₽/час». Чертёжный стиль, подписи по-русски.
Когда отдельная проверка русского не нужна
Протокол на 50 примерах стоит 21 104 ₽ и окупается не всегда. Четыре случая, когда его можно не проводить и потратить те же деньги с большей пользой.
- Задача не текстовая. Классификация обращения по десяти категориям или проставление статуса решается коротким ответом из закрытого списка — там русский язык почти не участвует, и проверять нужно точность классификации, а не грамматику.
- Ответ никто не читает. Если результат уходит в поле базы данных и дальше обрабатывается программой, качество формулировок не имеет значения. Значение имеет формат, а его проверяет валидация, а не человек.
- Поток меньше 300 обращений в месяц. Разница между кандидатами на таком объёме тонет в случайности: 50 примеров покажут расхождение, которого не будет в жизни. Дешевле взять любого доступного кандидата и разбирать ошибки по факту.
- Проблема известна и не в модели. Если справочники ведутся по-разному, а два регламента противоречат друг другу, любой кандидат будет ошибаться одинаково. Сначала чек-лист проверки качества данных, потом замер.
Модель, которая красиво разговаривает по-русски, и модель, которая не теряет «не» в пункте договора, — это разные модели, и различает их только замер на ваших текстах.
