Правильный вопрос звучит не «какая российская нейросеть лучше», а «какая из них лучше на моей задаче, на моих документах и на сегодняшнюю дату». Разница принципиальная: первый вопрос имеет вид рейтинга и не имеет ответа, второй решается за пять рабочих дней и даёт цифры, с которыми можно идти к собственнику. Ниже — протокол, по которому мы такие сравнения проводим, и форма таблицы, в которую они сводятся.

Мы сознательно не публикуем таблицу победителей. Линейки моделей обновляются каждые несколько месяцев, провайдер вправе поменять модель, оставив прежнее имя, а наш замер на наших примерах ничего не говорит о ваших сканах и вашей терминологии. Рейтинг устаревает за квартал, методика — нет. Поэтому мы отдаём протокол: пять прикладных задач, 100 примеров на каждую, слепая оценка и семь строк итогового отчёта.

Все суммы — модельные расчёты на прозрачных вводных. Ставки: инженер 3 000 ₽/час, предметный специалист 900 ₽/час, оператор 700 ₽/час, руководитель 2 500 ₽/час. Цены за токены взяты порядком величины — 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных; подставьте прайс своего провайдера на дату расчёта.

Почему мы не публикуем рейтинг

Любая опубликованная таблица «модель А против модели Б» имеет срок годности и область применимости, и обычно ни то, ни другое рядом с таблицей не написано. Причин, по которым чужой рейтинг нельзя переносить на свой проект, четыре, и все они проверяемые.

  • Версии живут кварталами. За время, пока статья с рейтингом выходит в топ выдачи, у половины участников появляется новая версия — и порядок мест меняется.
  • Имя модели не равно модели. Провайдер обновляет её под прежним псевдонимом, и система, которая вчера давала 3% ошибок, сегодня даёт 6% без единой правки с вашей стороны.
  • Ваши данные не участвовали в тесте. В бенчмарке нет ваших артикулов, ваших сокращений, ваших сканов с печатью поверх строки и ваших пятнадцати внутренних правил, которые сотрудник знает наизусть.
  • Средняя точность скрывает главное. Две модели с одинаковой точностью 90% могут различаться втрое по доле ошибок, которые стоят денег, — а в отчёте это одна и та же цифра.
Провайдер меняет модель под прежним именем — и это меняет ваши цифры

Обновление версии за одним и тем же псевдонимом — обычная практика у всех облачных провайдеров, российских и зарубежных. Ваши промпты отлажены под прежнее поведение: изменился внутренний формат ответа, модель стала многословнее или, наоборот, чаще отказывается отвечать — и доля разборов вручную выросла ночью, без релиза с вашей стороны. Практических следствия три. Закрепляйте версию модели явно, если провайдер это позволяет, и спрашивайте про политику версий до подписания договора. Держите набор из 100 размеченных примеров как регрессионный тест — прогон занимает час и ловит деградацию до того, как её заметят клиенты. И считайте бюджет так, чтобы он сходился при цене обращения втрое выше сегодняшней: односторонний пересмотр тарифов на этом рынке случался у всех участников.

сравнениеsravnenie-rossiyskikh-modeley-na-zadachakh--01
Сравнение чужого рейтинга и собственного замера: срок годности, данные, метрика, применимость

Две колонки одинаковой ширины. Левая «Чужой рейтинг»: строки «Данные — не ваши», «Метрика — средняя точность», «Версия — та, что была на дату публикации», «Срок годности — до следующего обновления», «Что с ним делать — сократить список до трёх». Правая «Свой замер, 500 примеров»: строки «Данные — ваши счета, письма, звонки», «Метрика — точность и отдельно критические ошибки», «Версия — записана дословно из ответа API», «Срок годности — квартал», «Что с ним делать — принять решение и подписать». Внизу общая подпись: «Первое бесплатно, второе стоит 139 000 ₽ и окупается за два месяца».

Чужой рейтинг сокращает список кандидатов. Решение принимает только свой замер

Пять задач, на которых имеет смысл сравнивать

Сравнивать «вообще» бессмысленно: у моделей разные сильные стороны, и победитель меняется от задачи к задаче. Мы берём пять операций, которые встречаются почти в любой компании и покрывают разные механики — короткое структурное извлечение, работу с базой знаний, классификацию, длинный контекст и генерацию. Если ваша задача в списке — берите её постановку целиком; если нет — стройте свою по этому же образцу: вход, эталон, метрика, цена ошибки.

ЗадачаЧто подаём на входЧто считается верным ответомЧто измеряемЦена ошибки
Извлечение реквизитов из счётаСкан или PDF счёта на 1–2 страницы, включая перекошенные и с печатью поверх текстаСемь полей совпали с эталоном посимвольно: номер, дата, поставщик, ИНН, сумма, НДС, срок оплатыДоля документов, где верны все поля. Отдельно — доля неверных сумм и ИНННеверная сумма уходит в платёжное поручение
Ответ по базе знаний со ссылкой на источникВопрос сотрудника или клиента и пять найденных фрагментов документовОтвет следует из переданных фрагментов и содержит ссылку на документ и пунктДоля ответов с подтверждаемой ссылкой. Отдельно — доля выдумок при пустом поискеВыдуманный пункт регламента, на который сошлётся клиент
Классификация входящих писемТекст письма без темы и подписи, 12 категорий, включая мусорные и пограничныеКатегория совпала с эталоном предметного специалистаДоля верных категорий. Отдельно — доля писем, сваленных в «прочее»Письмо уходит не в тот отдел, теряется рабочий день
Резюме телефонного разговораРасшифровка звонка на 6–10 минут с перебиваниями и разговорной речьюНазваны все договорённости, сумма, срок и следующий шаг, ничего не добавленоДоля резюме без потерянной договорённости и без придуманнойПотерянная договорённость — потерянная сделка
Переписывание карточки товараИсходное описание, таблица характеристик и правила стиля компанииТекст в рамках стиля, все ключевые характеристики на месте, ни одного свойства сверх исходных данныхДоля карточек без выдуманного свойства и без потерянной характеристикиВыдуманное свойство — возврат, жалоба и риск претензии

Обратите внимание на последний столбец: он превращает сравнение из технического упражнения в управленческое. Именно цена ошибки определяет, какую метрику считать главной. На извлечении реквизитов вас интересует не средняя точность, а доля неверных сумм — потому что одна ошибка в сумме стоит дороже, чем двадцать ошибок в поле «срок оплаты». На карточках товаров наоборот: потерянная характеристика правится редактором за минуту, а выдуманное свойство доходит до покупателя.

схема процессаsravnenie-rossiyskikh-modeley-na-zadachakh--02
Пять задач сравнения: вход, эталон и метрика для каждой — от счёта до карточки товара

Пять горизонтальных дорожек, одна под другой. Каждая дорожка — три блока со стрелками: «Вход» → «Модель» → «Что сверяем». Подписи дорожек сверху вниз: «Счёт — 7 полей посимвольно», «База знаний — ответ со ссылкой на пункт», «Письмо — 1 из 12 категорий», «Звонок — договорённости, сумма, срок», «Карточка — характеристики без выдумок». Справа от каждой дорожки узкая колонка «Цена ошибки» с короткой пометкой. Чертёжная графика, только русские подписи.

Пять разных механик: короткое извлечение, база знаний, классификация, длинный контекст, генерация

Почему бенчмарк не равен рабочей задаче

Публичный тест и ваша операция расходятся по шести параметрам одновременно, и каждое расхождение сдвигает результат в свою сторону. Поэтому цифра из обзора и цифра из вашего замера могут отличаться на двадцать пунктов, и обе будут честными — они просто меряют разное.

  • Чистота входа. В тесте — вычитанный текст, у вас — скан с наклоном в три градуса, письмо без пунктуации и расшифровка звонка, где половина реплик наложена друг на друга.
  • Глоссарий. «Отгрузка», «резерв», «под заказ» и артикул «КР-140/2» в вашей компании значат конкретные вещи. Модель этого не знает и подставляет общеязыковое значение.
  • Длина контекста. Тестовое задание умещается в пару абзацев, ваш запрос несёт пять фрагментов базы и историю диалога. Качество на длинном контексте деградирует иначе, чем на коротком, — и у разных моделей по-разному.
  • Формат ответа. Вам нужен разбираемый программой JSON с обязательными полями. В тесте оценивается смысл свободного текста, и сломанная скобка ошибкой не считается.
  • Отказ от ответа. В бенчмарке отказ — это потерянный балл. В вашем процессе честное «не знаю» на вопрос вне базы дороже золота, потому что оно предотвращает выдумку.
  • Вес ошибок. Тест считает все ошибки одинаковыми. У вас они различаются на два порядка по стоимости, и модель-победитель по среднему может проигрывать по деньгам.

Отсюда простое правило приёмки, которое стоит запомнить: если подрядчик показывает вам качество своей системы цифрой из чужого обзора — он показал вам не качество своей системы. Единственная цифра, которую имеет смысл обсуждать, получена на ваших примерах, с вашими эталонами и датирована. Всё остальное — маркетинг, даже когда числа настоящие.

Протокол замера: 100 примеров, эталоны, слепая оценка

Протокол умышленно скучный и повторяемый. Его смысл в том, чтобы результат не зависел от того, кто именно его проводил и в каком настроении, — и чтобы через квартал его можно было повторить точь-в-точь на новых версиях моделей.

  1. 1
    1. Собрать по 100 реальных примеров на каждую задачу

    Только настоящие данные из ваших систем за последние два-три месяца. Обязательно включить трудные случаи — их доля в выборке должна примерно соответствовать реальной: нестандартные формы, вопросы не по теме, письма на границе двух категорий, звонки с плохой связью. Выборка из одних удобных примеров даёт красивый отчёт и бесполезное решение. Меньше 50 примеров на задачу брать нельзя: разница между кандидатами утонет в случайности.

  2. 2
    2. Записать эталонные ответы силами предметного специалиста

    Правильный ответ определяет тот, кто отвечает за результат в жизни: бухгалтер по счетам, диспетчер по звонкам, старший менеджер по письмам. Это единственная часть работы, которую нельзя отдать подрядчику. Побочный результат почти всегда одинаков: на 500 примерах обнаруживается 20–40 случаев, где сотрудники сами отвечают по-разному, — и это находка про процесс, а не про модель.

  3. 3
    3. Зафиксировать промпт и параметры один раз для всех

    Одинаковая инструкция, одинаковый формат ответа, одинаковые примеры в промпте, одинаковая температура генерации. Соблазн «подкрутить промпт под каждого кандидата» надо погасить: тогда вы сравниваете не модели, а качество своей подгонки. Отдельным этапом после выбора победителя промпт действительно дорабатывают под него — но это уже не сравнение.

  4. 4
    4. Прогнать двух-трёх кандидатов и записать версии дословно

    Три кандидата — практический предел: объём оценки растёт линейно, а решение от четвёртого не меняется. Версия модели и дата прогона записываются в отчёт из ответа API, а не по памяти. Заодно фиксируется техника: сколько запросов упало по таймауту, сколько пришлось повторить, какая была худшая задержка.

  5. 5
    5. Оценить вслепую

    Ответы обезличиваются и перемешиваются: оценщик не знает, где чей. Без этого оценка съезжает в сторону ожиданий — эффект устойчивый и заметный. На 20% выборки полезно провести перекрёстную проверку вторым оценщиком: если два человека расходятся чаще, чем в одном случае из десяти, значит, размыт критерий правильности, и его надо уточнять до продолжения.

  6. 6
    6. Считать критические ошибки отдельной строкой

    Критическая ошибка — та, что стоит денег или доверия: неверная сумма, выдуманный пункт документа, обещание, которого нет в прайсе, потерянная договорённость. Она не должна растворяться в общей точности. Практика показывает, что кандидаты, идущие вровень по средней точности, различаются по критическим ошибкам в разы — и именно эта строка определяет выбор.

  7. 7
    7. Свести в один отчёт и датировать

    Семь строк на кандидата, дата замера, версии моделей, объём выборки и подпись того, кто давал эталоны. Отчёт хранится вместе с набором примеров: вместе они образуют регрессионный тест, который прогоняется при каждой смене версии модели и стоит после этого один час, а не пять дней.

Отказы считаются как отдельная метрика, а не как ошибки

Модель, которая на вопрос вне базы честно отвечает «не знаю», ведёт себя правильно, хотя формально не дала ответа. Модель с нулём отказов — тревожный признак: она отвечает всегда, в том числе там, где данных нет. Поэтому в отчёте три разные строки: верные ответы, ошибки и отказы. Их сумма даёт 100%, и читать таблицу нужно всеми тремя глазами сразу.

схема процессаsravnenie-rossiyskikh-modeley-na-zadachakh--03
Схема протокола замера: примеры, эталоны, единый промпт, прогон, обезличивание, оценка, отчёт

Горизонтальная схема из семи блоков со стрелками: «500 примеров» → «Эталоны предметника» → «Единый промпт» → «Прогон трёх кандидатов» → «Обезличивание ответов» → «Слепая оценка» → «Отчёт с датой». Под блоком «Слепая оценка» ответвление вниз к блоку «Перекрёстная проверка 20% выборки» с пометкой «расхождение больше 10% — уточнить критерий». Под блоком «Отчёт» подпись «хранится вместе с примерами как регрессионный тест». Чертёжная графика, только русские подписи.

Обезличивание ответов — не формальность: без него оценка съезжает в сторону ожиданий

Пять ошибок, которые обесценивают замер

Замер легко провести так, что он даст цифры и не даст знания. Ошибки ниже встречаются постоянно, стоят тех же пяти дней и обнаруживаются обычно через полгода, когда система в эксплуатации ведёт себя не так, как обещал отчёт.

  1. 1Промпт подкручивали под каждого кандидата. Самая частая и самая незаметная ошибка: инженер честно старается выжать максимум из каждой модели — и в результате сравниваются не модели, а его старания и запас времени. Инструкция, формат ответа и примеры в промпте должны быть общими и лежать в отчёте дословно. Доработка под победителя — отдельный этап после выбора.
  2. 2Примеры выбирал тот, кто делает систему. Люди неосознанно берут случаи, на которых система работает: чистые сканы, типовые вопросы, вежливых клиентов. Правильно — случайная выборка из реального потока за период плюс заранее объявленная квота трудных случаев: скажем, 20% пограничных категорий, кривых сканов и вопросов вне базы. Квота фиксируется до того, как кто-либо увидел первые результаты.
  3. 3Оценивал ответы автор промпта, зная, где чей. Эффект ожиданий устойчив и заметен: свой кандидат получает более мягкую трактовку в спорных случаях, а спорных случаев в любом замере — от десятой до пятой части. Обезличивание и перемешивание ответов занимают десять минут скриптом и снимают проблему полностью.
  4. 4Кандидатов мерили в разное время и по разным версиям. Прогон должен уместиться в одно окно, лучше в один день, а версия каждой модели — быть записана дословно из ответа API. Иначе через месяц невозможно понять, отличаются кандидаты между собой или отличается июньская версия от сентябрьской.
  5. 5Мерили только точность и не считали деньги и время. Кандидат-победитель по качеству вполне может оказаться в четыре раза дороже на вашем профиле запросов и вдвое медленнее в худшем случае. Стоимость тысячи обращений и худшая задержка считаются в том же прогоне — данные для этого уже есть, добавить их в отчёт стоит полчаса.

Есть и шестая ошибка, организационная: замер поручают подрядчику целиком, включая эталонные ответы. Подрядчик не знает, что в вашей компании считается правильным ответом на письмо от проблемного клиента или какой срок отгрузки допустимо назвать. В результате измеряется соответствие модели представлениям подрядчика, а не вашим. Эталоны — единственная часть работы, которая обязана остаться внутри.

Кого имеет смысл ставить в сравнение на сентябрь 2026

Список кандидатов собирается не по величине, а по способу доступа: сначала отсекается всё, чему нельзя легально заплатить и что не проходит по режиму персональных данных, и только потом сравнивается качество. Ниже — то, из чего российская компания реально выбирает по состоянию на сентябрь 2026.

КандидатЧем интересен в сравненииЧто проверить отдельно
GigaChat 3 — Lite, Pro, MaxТри уровня в одной линейке: младший ставится на массовые короткие операции, старший — на редкие сложные, без смены провайдера и договораУсловия по обучению на ваших запросах, лимиты тарифа, поведение младшего уровня на строгом формате ответа
GigaChat 3.1 UltraСтаршая модель линейки — контрольная верхняя точка: показывает, сколько вы теряете, оставаясь на среднем уровнеРазницу в цене обращения на вашем профиле: она может оказаться в разы, а прирост качества — в пунктах
GigaChat EnterpriseКорпоративная платформа агентов с тремя схемами размещения — облако, свой контур, гибрид (с марта 2026)Что именно уезжает в ваш контур: только модель или ещё поиск, база знаний и журналы диалогов
YandexGPT 5 и Yandex AI StudioГотовая обвязка вокруг модели: конструктор агентов Agent Atelier, MCP Hub, векторное хранилище и поиск — часть работы не придётся писать рукамиСтатус компонентов в реестре отечественного ПО, если среди ваших заказчиков есть государственные
T-Lite и T-ProКомпактные модели: интересны как кандидат на массовые операции, где цена обращения важнее последнего процента точностиКачество на вашей отраслевой терминологии и стабильность формата на длинной серии запросов
Cotype ProОриентирована на деловые тексты и работу с документами — уместна в сравнении на задачах со счетами, письмами и карточкамиЛимиты, доступность на вашем тарифе и условия обработки персональных данных
Локальный Qwen 3 через OllamaКонтрольная точка своего контура: показывает, что вы теряете или не теряете, отказавшись от облака ради 152-ФЗЛицензию конкретной версии весов, требования к железу и наличие администратора, который это обслуживает

Разумный набор для замера — три кандидата: две облачные модели разных уровней и одна локальная. Локальную стоит включать, даже если вы не планируете свой контур: она бесплатна на этапе теста, ставится на арендованной GPU-машине за пару часов и даёт понятный ответ на вопрос собственника «а если через год придётся всё увезти к себе». Про зарубежные модели: прямая оплата из России для OpenAI и Anthropic невозможна, доступ идёт через посредников, и в производственный контур мы такую схему не закладываем — но как верхнюю точку отсчёта на этапе замера её иногда используют, помня, что это не вариант поставки.

карта связейsravnenie-rossiyskikh-modeley-na-zadachakh--04
Карта кандидатов для сравнения: облачные линейки, корпоративные платформы и локальная модель

Карта из трёх групп. Левая группа «Российское облако»: узлы «GigaChat 3 Lite / Pro / Max», «GigaChat 3.1 Ultra», «YandexGPT 5», «T-Lite / T-Pro», «Cotype Pro». Средняя группа «Платформы с выбором размещения»: узлы «GigaChat Enterprise», «Yandex AI Studio». Правая группа «Свой контур»: узел «Qwen 3 через Ollama» с пометкой «контрольная точка». Внизу поперёк карты рамка «В замер берём три: две облачные разных уровней и одну локальную». Отдельно сбоку отсечённый блок «Зарубежные модели через посредника» с пометкой «не вариант поставки».

Три кандидата — практический предел: четвёртый удлиняет оценку и не меняет решения

Форма отчёта: семь строк, которые показывают собственнику

Результат замера должен помещаться на одну страницу и читаться человеком, который не занимается ИИ. Ниже — форма: слева строки отчёта, дальше как считается каждая и что в ней должно насторожить. Колонки под кандидатов добавляются справа; сколько кандидатов — столько колонок.

Строка отчётаКак считаетсяЧто должно насторожить
Точность на задаче, %Доля примеров, где ответ совпал с эталоном по правилу, записанному до начала замераРазброс между пятью задачами больше 15 пунктов — модель неровная, и на части задач ей нужна подстраховка
Критические ошибки, %Доля ответов, где ошибка стоит денег или доверия: сумма, ИНН, выдуманный пункт, обещаниеБольше 1% на любой задаче, связанной с деньгами. Это отдельный стоп-сигнал, независимо от общей точности
Отказы, %Доля ответов «не знаю» и «недостаточно данных»Ноль отказов. Модель, которая отвечает всегда, будет отвечать и там, где данных нет
Устойчивость формата, %Доля ответов, которые программа разобрала без ручной правки: поля на месте, типы верныеНиже 98%: контуру нужен валидатор и повтор запроса, это добавляет 6–10 часов работы
Задержка: средняя и худшаяМедиана и худшая из ста задержек на реальном размере запросаХудшая больше 15 секунд в диалоговом сценарии — клиент уходит раньше, чем приходит ответ
Цена 1 000 обращений, ₽Реальные входные и выходные токены вашего профиля × прайс провайдера на дату замераРасчёт по прайсу без своего профиля: ошибка в разы, особенно на диалогах с историей
Дата замера и версия моделиДословно из ответа API, а не по памятиОтсутствие даты. Через квартал такая таблица не значит ничего

Читать таблицу нужно в определённом порядке, и он не совпадает с интуитивным. Сначала строка критических ошибок: кандидат с превышением порога выбывает, какими бы ни были остальные цифры. Потом устойчивость формата — она определяет, сколько инженерной обвязки придётся дописать. Потом деньги на вашем объёме. И только потом общая точность, потому что разница в два-три пункта почти всегда дешевле, чем разница в любом из первых трёх пунктов.

разбор экранаsravnenie-rossiyskikh-modeley-na-zadachakh--05
Бланк отчёта о замере: семь строк, три колонки кандидатов, поле даты и версии модели

Нарисованный бланк-таблица на одну страницу. Слева семь строк: «Точность на задаче, %», «Критические ошибки, %», «Отказы, %», «Устойчивость формата, %», «Задержка средняя / худшая», «Цена 1000 обращений, ₽», «Дата замера и версия». Справа три пустые колонки, подписанные «Кандидат А», «Кандидат Б», «Кандидат В». Строка критических ошибок выделена рамкой и подписана сбоку «читать первой». Внизу бланка поля «Кто давал эталоны», «Объём выборки», «Дата». Чертёжная графика, без реальных названий продуктов.

Форма отчёта пустая намеренно: числа в неё ставит ваш замер, а не наша статья

Сколько стоит замер и что он окупает

Полный протокол на пять задач — это 500 примеров, 1 500 оцененных ответов и пять рабочих дней. Основная нагрузка ложится не на инженера, а на предметного специалиста: 30 часов его времени и есть главная статья, и её нельзя ни сократить, ни передать наружу.

Замер по протоколу: пять задач, 500 примеров, три кандидата
Выгрузка 500 реальных примеров из почты, CRM, архива счетов и записей звонков — инженер, 8 ч24 000 ₽
Эталонные ответы: 500 примеров × 3,5 мин ≈ 30 ч × 900 ₽/час27 000 ₽
Обвязка прогона: единые промпты на пять задач, подключение трёх кандидатов, сбор результатов — 12 ч36 000 ₽
Токены на прогон 1 500 ответов у трёх кандидатов, включая повторы6 000 ₽
Слепая оценка 1 500 ответов: 25 ч × 900 ₽/час22 500 ₽
Перекрёстная проверка 20% выборки вторым оценщиком: 6 ч × 900 ₽/час5 400 ₽
Сведение отчёта, расчёт цены обращения, протокол решения — 6 ч18 000 ₽
Итого138 900 ₽ и пять рабочих дней — из них 30 часов предметного специалиста

Теперь другая сторона весов. Допустим, выбор сделан по обзору в интернете и оказался неудачным: кандидат, который проиграл бы в замере, даёт на 4 процентных пункта больше ответов, требующих ручной правки, и на 0,3 пункта больше критических ошибок. Поток — 12 000 обращений в месяц, что для компании на 100–150 человек с клиентским потоком совершенно обычно.

Цена выбора вслепую: 12 000 обращений в месяц
Дополнительные ручные правки: 4% × 12 000 = 480 разборов × 8 мин = 64 ч × 700 ₽/час44 800 ₽/мес
Разбор критических случаев руководителем: 0,3% × 12 000 = 36 случаев × 20 мин = 12 ч × 2 500 ₽/час30 000 ₽/мес
Переписывание промптов и повторный замер, когда решение всё-таки признают ошибочным: 40 ч120 000 ₽ разово
Итого74 800 ₽ в месяц — замер стоимостью 138 900 ₽ окупается за 56 дней эксплуатации

В расчёте намеренно нет двух вещей, которые посчитать нельзя: потерянных клиентов и внутреннего доверия к проекту. Второе на практике дороже: после неудачного старта поддержка инициативы внутри компании исчезает, и следующий подход к автоматизации откладывается на год. Поэтому замер разумно воспринимать не как расход на выбор модели, а как страховку от отката всего проекта — с известной ценой и известным сроком.

графикsravnenie-rossiyskikh-modeley-na-zadachakh--06
График: 138 900 ₽ на замер против накопленных 74 800 ₽ в месяц при выборе вслепую

Двухосевой график за 6 месяцев. Горизонтальная штриховая линия на уровне 138 900 ₽ подписана «разовый замер». Возрастающая ломаная линия — накопленные потери при выборе вслепую: 74 800, 149 600, 224 400, 299 200, 374 000, 448 800 ₽. Точка пересечения между первым и вторым месяцем выделена и подписана «здесь замер уже окупился». Оси: месяцы и рубли.

Кривые пересекаются на втором месяце — дальше выбор вслепую только дорожает

Что мы устойчиво наблюдаем — и чего не утверждаем

Ниже — наблюдения из наших замеров и разборов чужих внедрений. Это не рейтинг и не измеренная статистика рынка: мы не называем победителей и не переносим свои результаты на ваши данные. Но повторяющиеся закономерности стоит знать до того, как вы начнёте собственное сравнение, — они экономят один-два дня.

  • Русский язык и деловой тон — самая ровная зона. Отечественные линейки уверенно держат падежи, канцелярские обороты и структуру делового письма; переводные решения здесь чаще звучат неестественно. На задачах вроде резюме звонка или ответа клиенту разница между кандидатами обычно невелика.
  • На коротких структурных задачах кандидаты идут вплотную. Классификация по десятку категорий и извлечение полей из типовой формы редко расходятся больше чем на несколько пунктов — и выбор в итоге решают цена обращения и лимиты, а не качество.
  • Строгий формат ломают все, вопрос только в доле. На длинной серии запросов любая модель периодически выдаёт невалидный JSON или лишний текст вокруг него. Валидатор ответа и автоматический повтор — обязательная часть контура, а не признак плохой модели; закладывайте на это 6–10 часов работы.
  • Длинный контекст деградирует к концу документа. Заявленная длина окна означает, что документ поместится, а не что модель одинаково внимательна на первой и на тридцатой странице. На договорах надёжнее резать текст на части и собирать ответ из фрагментов, чем полагаться на большое окно.
  • Отраслевая терминология и артикулы бьют всех одинаково. Прирост от глоссария и словаря синонимов почти всегда больше, чем прирост от перехода на более сильную модель, и стоит в разы дешевле.
  • Арифметику нельзя доверять модели. Извлечь числа — да, сложить их — нет: считать должна программа. Это не особенность конкретной линейки, а общее свойство класса.
  • Готовность честно отказаться различается заметно. Одни модели легче говорят «не знаю», другие достраивают ответ до последнего. Поведение подстраивается инструкцией и ограничителями, но исходную склонность стоит померить отдельной строкой — она предсказывает, сколько сил уйдёт на контур.

Чего мы не утверждаем: что какая-то из линеек лучше в целом; что наши наблюдения воспроизведутся на ваших документах; что всё написанное останется верным после следующего обновления моделей. Любая из этих закономерностей проверяется вашим замером за пять дней — и именно поэтому мы отдаём протокол, а не таблицу победителей.

сравнениеsravnenie-rossiyskikh-modeley-na-zadachakh--07
Две колонки: где модели ведут себя ровно и где ломаются — с указанием, чем это лечится

Две колонки. Левая «Ведут себя ровно»: пункты «Русский язык и деловой тон», «Классификация по 10–12 категориям», «Извлечение полей из типовой формы», «Короткие резюме». Правая «Ломаются регулярно»: пункты «Строгий формат ответа — нужен валидатор и повтор», «Длинный контекст — резать документ на части», «Отраслевые артикулы — нужен глоссарий», «Арифметика — считает программа, не модель», «Отказ от ответа — настраивается ограничителем». У каждого пункта правой колонки — короткая пометка о том, чем лечится. Внизу подпись: «Ни один пункт справа не решается сменой провайдера».

Половина проблем лечится не сменой модели, а глоссарием и валидатором ответа

Когда сравнение проводить не надо

Замер стоит денег и пяти дней чужого времени, поэтому у него есть условия применимости. В четырёх случаях он не окупится, и мы прямо говорим об этом до начала работ.

  • Выбор предопределён требованием. Если у вас специальные категории персональных данных, требование заказчика по размещению или госконтракт с условием по реестру отечественного ПО — сравнивать облачных кандидатов бессмысленно, вариант остаётся один. Меряйте сразу локальную модель на своём железе и на тех же примерах.
  • Объём меньше порога. При 500 обращениях в месяц разница между кандидатами в деньгах — сотни рублей, а в ручных правках — единицы случаев. Берите ту модель, которая проще подключается и от которой дешевле уйти, и потратьте эти пять дней на процесс.
  • Некому дать эталоны. Если в компании нет человека, который скажет, какой ответ правильный, замер выродится в вкусовщину. Сначала нужно договориться внутри о критерии правильности — сам по себе этот разговор часто ценнее сравнения.
  • Задача решается правилами. Маршрутизация по региону и сумме, разбор структурированной выгрузки, сверка справочников — это программа на несколько часов работы, а не модель. Мы регулярно закрываем такие запросы отказом от ИИ и считаем это нормальным результатом диагностики.

Как повторять замер, чтобы он не устарел

Замер — не разовое мероприятие перед выбором, а процедура с расписанием. Первый прогон стоит пять дней, каждый следующий — час, потому что примеры, эталоны и скрипт уже есть. Это и есть главная причина не выбрасывать наработки после принятия решения.

  1. 1Раз в квартал — плановый прогон регрессионного теста на текущей версии модели. Час работы, результат подшивается к отчёту с датой.
  2. 2При каждом уведомлении провайдера об обновлении модели — внеплановый прогон в тот же день. Если провайдер обновляет модель без уведомления, прогон делается по факту заметного изменения поведения.
  3. 3При расширении задачи — добавление новых примеров в набор. Появился новый тип документа или новая категория обращений — 20–30 примеров дописываются к существующим.
  4. 4Раз в год — полное пересравнение с двумя-тремя кандидатами. За год линейки меняются настолько, что решение годовой давности перестаёт быть обоснованным, даже если система работает.
  5. 5Всегда — хранить набор примеров с эталонами как актив компании. Он переживает и модель, и подрядчика, и является единственной вещью в проекте, которая не устаревает.
этапыsravnenie-rossiyskikh-modeley-na-zadachakh--08
Расписание замеров: первый прогон пять дней, квартальные проверки по часу, годовое пересравнение

Горизонтальная лента времени на 12 месяцев. В начале крупный отрезок «Первый замер — 5 дней, 138 900 ₽». Далее через каждые три месяца короткие метки «Регресс-тест — 1 час». Между ними две внеплановые метки со звёздочкой и подписью «обновление версии у провайдера». В конце ленты крупная метка «Полное пересравнение — 5 дней». Под лентой сплошная линия с подписью «Набор из 500 примеров и эталонов живёт всё это время».

Первый замер стоит пять дней, каждый следующий — час: примеры и эталоны уже есть

Рейтинг моделей стареет за квартал, набор из пятисот ваших примеров с эталонными ответами не стареет никогда. Именно он, а не выбранная модель, и есть результат этой работы.