Проверить модель на своих данных за неделю можно, и стоит это 30 часов работы трёх человек — 66 300 ₽ по ставкам сентября 2026 года. Схема одна и та же независимо от задачи: берёте одну операцию, собираете 100 реальных примеров, заранее пишете к ним правильные ответы, прогоняете через двух-трёх кандидатов и оцениваете результат вслепую. На выходе — четыре числа по каждому кандидату и одна страница с решением.

Смысл замера не в том, чтобы узнать, какая модель лучше вообще. Это знание бесполезно: место в чужом рейтинге получено на чужих текстах, в свободном формате ответа и с равной ценой всех ошибок. Ваш замер отвечает на единственный нужный вопрос — проходит ли кандидат порог на ваших документах, — и действителен ровно до следующего обновления модели.

Ниже — как собрать выборку, которая покажет правду, план на пять дней по часам и ролям, четыре цифры свода, полный бюджет и то, что от теста остаётся навсегда. Ставки в расчётах: инженер 3 000 ₽/час, предметный специалист и методист 900 ₽/час. Шесть критериев, из которых замер закрывает первый, разобраны в опорной статье про выбор языковой модели для бизнеса.

Одна операция, 100 примеров, три кандидата

Первая ошибка совершается до сбора данных: тестируют «нейросеть», а не операцию. «Проверим, справится ли модель с документами» — это не задача замера, потому что у такой формулировки нет правильного ответа, с которым можно сверить. Задача звучит иначе: «извлечь номер, дату, сумму, ИНН контрагента и позиции из счёта поставщика в строгом формате».

  • Одна операция за один замер. Классификация обращений и ответ по базе знаний — два разных теста с разными выборками и разными эталонами. Совмещение экономит два дня и обесценивает оба результата.
  • Сто примеров. Ниже пятидесяти разница между кандидатами тонет в случайности, выше полутора сотен растёт только счёт за разметку. Сто — рабочий компромисс для решения о выборе, а не для приёмки готовой системы.
  • Два-три кандидата. Четвёртый почти никогда не меняет решение, а оценку удлиняет на треть. Разумный набор — две российские облачные модели разных уровней и одна локальная, чтобы понимать, чего вы лишаетесь, уходя в свой контур.
  • Один и тот же промпт всем. Подгонка инструкции под каждого кандидата отдельно — это уже не сравнение моделей, а сравнение усилий инженера. Подгонку делают потом, для победителя.

Выборка: 80 случайных и 20 трудных

Честная выборка собирается в два приёма, и оба обязательны. Восемьдесят примеров берутся случайно из реального потока за последние два-три месяца — не «характерные», не «показательные», а просто каждый N-й из выгрузки. Ещё двадцать отбираются намеренно, по списку трудных случаев, и хранятся отдельной корзиной.

Подборка удачных примеров — самая частая и самая дорогая ошибка теста

Когда выборку собирает человек, который хочет, чтобы проект состоялся, он бессознательно берёт понятные случаи: аккуратные сканы, вежливые вопросы, стандартные формулировки. Модель показывает отличный результат, решение принимается, а через месяц выясняется, что в бою треть входа выглядит иначе. Защита простая: случайный отбор делается скриптом, а не глазами, и результат никто не редактирует.

Двадцать трудных примеров — это не «сложные вопросы», а пять именованных корзин по четыре штуки. Плохое качество входа: скан под углом, опечатки в артикуле, обрезанный текст. Нестандартная форма: документ другого поставщика, письмо без темы. Пограничные случаи: два договора в одном файле, возврат вместо поставки. Вопросы вне базы: то, на что верный ответ — честное «не знаю». И провокации: попытка получить скидку, которой нет, или подтверждение срока, который вы не даёте.

схема процессаtest-modeli-na-svoih-dannyh-za-nedelyu--01
Состав выборки: 80 случайных примеров из потока и 20 трудных по пяти корзинам

Схема состава выборки. Слева большой прямоугольник «Поток за 3 месяца» со стрелкой «случайный отбор скриптом» в блок «80 примеров». Справа отдельный столбик из пяти небольших блоков по 4 примера каждый, подписанных: «Плохое качество входа», «Нестандартная форма», «Пограничные случаи», «Вопросы вне базы», «Провокации». Оба потока сходятся в общий блок «Выборка 100 примеров». Под ним подпись: «эталоны пишет предметный специалист, 4 минуты на пример». Чертёжный стиль, подписи по-русски.

Двадцать трудных примеров дают больше информации, чем следующая сотня случайных

Пять дней по часам и ролям

Календарно это рабочая неделя, активной работы в ней — четыре дня. В опорной статье кластера тот же замер назван четырёхдневным: там пятый день, приёмка решения, не считался работой. Разница только в способе счёта, суммы и часы совпадают.

  1. 1
    День 1. Выгрузка, 4 часа инженера

    Скрипт достаёт 80 случайных примеров из почты, CRM или архива и обезличивает их: убирает имена, телефоны, номера счетов. Обезличивание не формальность — вы отдаёте эти данные внешним провайдерам, и без него замер сам становится обработкой персональных данных. Параллельно предметный специалист набирает 20 трудных примеров по пяти корзинам.

  2. 2
    День 2. Эталоны, 7 часов предметного специалиста

    Бухгалтер, диспетчер или старший менеджер пишет, каким должен быть правильный ответ на каждый пример. Четыре минуты на пример, 100 примеров — семь часов с перерывами. Это единственная часть работы, которую нельзя перепоручить подрядчику: он не знает, что у вас считается верным. Побочный результат обычно ценнее самого замера — на паре десятков примеров выясняется, что сотрудники отвечают по-разному.

  3. 3
    День 3. Прогон, 10 часов инженера

    Единый промпт, подключение трёх провайдеров, сбор 300 ответов в одну таблицу. Здесь же фиксируется версия каждой модели: не общий псевдоним вроде «последняя», а конкретная версия, иначе результат нельзя будет повторить через месяц. Токены на весь прогон стоят около 1 500 ₽ — меньше, чем час работы любого участника.

  4. 4
    День 4. Слепая оценка, 5 часов оценщика

    Ответы перемешиваются и обезличиваются: оценщик не знает, какая модель что написала. Каждый ответ получает одну из четырёх меток — верный, честный отказ, ошибка без последствий, критическая ошибка. Метки простые намеренно: балльные шкалы от одного до десяти дают красивые средние и не дают решения.

  5. 5
    День 5. Свод и подпись, 4 часа инженера

    Одна страница: какие кандидаты сравнивались, на каких данных, какие получились четыре цифры, что выбрано и почему. Туда же дата замера и версии моделей. Через год, когда встанет вопрос о смене, эта страница сэкономит неделю споров.

Эталоны и оценку не отдают тому, кто настраивал промпт

Человек, который писал инструкцию для модели, знает, что она умеет, и незаметно формулирует эталон в её сторону — а при оценке засчитывает ответ «по смыслу». Разделение ролей стоит ноль рублей и снимает почти всю систематическую ошибку замера: промпт пишет инженер, эталоны — предметный специалист, оценивает третий человек и вслепую. Если кандидатов вам приводит подрядчик, оценка тем более остаётся на вашей стороне.

этапыtest-modeli-na-svoih-dannyh-za-nedelyu--02
Пять дней замера с дорожками трёх ролей: инженер, предметный специалист, оценщик

Горизонтальная лента на пять дней с тремя дорожками ролей: «Инженер», «Предметный специалист», «Оценщик». На дорожке инженера отрезки «День 1 — выгрузка, 4 ч», «День 3 — прогон, 10 ч», «День 5 — свод, 4 ч». На дорожке специалиста один отрезок «День 2 — эталоны, 7 ч». На дорожке оценщика один отрезок «День 4 — слепая оценка, 5 ч». Между дорожками специалиста и оценщика вертикальная штриховая линия с подписью «разные люди». В конце ленты флажок «30 часов, 66 300 ₽». Чертёжный стиль, подписи по-русски.

Предметный специалист занят в замере один день, оценщик — половину дня

Четыре цифры и критерий go/no-go

Порог записывается до прогона — это главное правило свода. Если критерий формулируется после того, как увидели цифры, он неизбежно подгоняется под уже понравившийся вариант, и замер из основания решения превращается в его обоснование. Порог занимает четыре строки и утверждается тем, кто платит за проект.

ПоказательКандидат АКандидат БКандидат ВПорог, записанный до замера
Верных ответов из 100788271не ниже 75
Честных отказов12619не выше 20
Критических ошибок0700
Цена обращения1,04 ₽3,12 ₽8,97 ₽не выше 2 ₽
Решениепроходитотклонёнотклонёнпорог берут все четыре строки сразу

Таблица условная — так выглядит свод, а не рейтинг реальных моделей. Но логика в ней настоящая, и она контринтуитивна: кандидат Б лидирует по главной цифре и выбывает из-за третьей строки. Критические ошибки не усредняются с остальными — неверная сумма в счёте, выдуманный пункт договора и обещание срока, которого вы не даёте, стоят дороже, чем двадцать безобидных неточностей. Кандидат В безупречен по ошибкам, но отказывается отвечать в каждом пятом случае и обходится в 8,97 ₽ за обращение, потому что это локальная модель в своём контуре, где цена обращения складывается из амортизации железа, а не из токенов.

Что это значитЧестный отказ

Ответ вида «в базе знаний нет данных, передаю специалисту». Это не ошибка, а правильное поведение на вопросах вне базы, и в своде он идёт отдельной строкой. Кандидат, который никогда не отказывается, не лучше — он просто отвечает уверенно там, где не знает. Как формулируется и проверяется такое поведение, разобрано в материале про ответ «не знаю» как целевое поведение.

Промежуточный результат — когда никто не взял порог или взяли двое — обрабатывается заранее оговорённым правилом. Если не взял никто, порог чаще всего назначен не той задаче: модель просят пересказать договор целиком там, где нужно извлечь пять полей. Сужаете операцию, переписываете эталоны, прогоняете тот же набор заново — второй прогон стоит уже около 15 000 ₽, потому что эталоны написаны. Если взяли двое, берите того, у кого дешевле уход: смена модели стоит 34 часа при наличии адаптера и 78 часов без него.

Бюджет замера и что от него остаётся навсегда

Замер одной операции на 100 примерах и трёх кандидатах
Выгрузка 80 случайных примеров и обезличивание — инженер, 4 ч × 3 000 ₽12 000 ₽
Эталонные ответы: 100 примеров × 4 мин ≈ 7 ч × 900 ₽6 300 ₽
Единый промпт, подключение трёх провайдеров, сбор ответов — инженер, 10 ч × 3 000 ₽30 000 ₽
Токены на 300 ответов у трёх кандидатов1 500 ₽
Слепая оценка 300 ответов — оценщик, 5 ч × 900 ₽4 500 ₽
Свод таблицы, расчёт цены обращения, протокол — инженер, 4 ч × 3 000 ₽12 000 ₽
Итого30 часов и 66 300 ₽ — календарно рабочая неделя, из них 12 часов ваших сотрудников

Двенадцать часов из тридцати — время предметного специалиста и оценщика, то есть людей, у которых есть основная работа. Их надо согласовать с руководителем отдела до старта, а не в среду утром. Это же обстоятельство делает замер невозможным в компаниях, где предметный специалист один и он в отпуске: перенести замер дешевле, чем отдать эталоны стажёру.

Главный побочный результат — размеченный набор. Из ста примеров с эталонами вырастает регресс-набор, которым потом проверяют каждое обновление модели и принимают работу подрядчика. Собранный с нуля набор на 180 примеров стоит 50 часов и 91 200 ₽; после замера остаётся добрать 80 примеров и сделать оснастку.

Достройка регресс-набора на 180 примеров после замера
Добор 80 примеров из потока и обезличивание — инженер, 3 ч × 3 000 ₽9 000 ₽
Эталоны к 80 новым примерам: 5,5 ч × 900 ₽4 950 ₽
Разбивка 180 примеров на корзины и правила сверки — методист, 6 ч × 900 ₽5 400 ₽
Оснастка автопрогона и отчёта о расхождениях — инженер, 8 ч × 3 000 ₽24 000 ₽
Первый контрольный прогон 180 примеров3 240 ₽
Итого22,5 часа и 46 590 ₽ вместо 50 часов и 91 200 ₽ при сборке с нуля

Экономия 44 610 ₽ — не главный аргумент. Главный в том, что набор, собранный в момент миграции, отражает уже изменённую систему и потому бесполезен как эталон. Дальше один прогон 180 примеров стоит 3 240 ₽ и делается при каждом обновлении версии модели, а сам набор становится приложением к договору с подрядчиком.

сравнениеtest-modeli-na-svoih-dannyh-za-nedelyu--03
Стоимость регресс-набора: 46 590 рублей после замера против 91 200 рублей с нуля

Сравнение в две колонки одинаковой ширины. Левая колонка «После замера»: строки «22,5 часа», «46 590 ₽», «100 примеров уже размечены». Правая колонка «С нуля в момент миграции»: строки «50 часов», «91 200 ₽», «набор отражает уже изменённую систему». Между колонками вертикальная фигурная скобка с подписью «разница 44 610 ₽». Под колонками общая сноска: «один прогон набора — 3 240 ₽». Чертёжный стиль, подписи по-русски.

Замер оплачивает половину будущего регресс-набора, а второй половиной становятся его же примеры

Когда замер не нужен или преждевременен

Замер стоит 66 300 ₽ и окупается не всегда. Четыре ситуации, в которых эти деньги лучше потратить иначе, встречаются регулярно, и в двух из них тест дал бы формально корректный, но бессмысленный результат.

  • Поток меньше 300 обращений в месяц. Разница между кандидатами на таком объёме не окупает разметку. Разумнее взять доступного кандидата, месяц читать все ответы подряд и решать по ним; порог объёма, ниже которого не окупается сама автоматизация, разобран в материале про порог окупаемости по объёму.
  • Задача решается без модели. Расчёт по формуле, маршрутизация по полю формы, проверка формата не требуют нейросети вообще — и тогда сравнивать нечего. Шесть таких классов задач разобраны отдельно в материале про то, когда ИИ не нужен.
  • Нет предметного специалиста, который напишет эталоны. Без эталонов замер превращается в чтение ответов и обсуждение впечатлений. Это не замер, и его результат не переживёт первого спора с подрядчиком.
  • Данные в беспорядке. Если одна и та же позиция записана в трёх системах по-разному, все кандидаты ошибутся одинаково, а вы решите, что дело в моделях. Сначала — короткий чек-лист проверки качества данных, он занимает несколько часов.

Отдельно про соблазн проверить только русский язык или только терминологию: это разные и более дешёвые процедуры. Узкая проверка русского на 50 примерах стоит 21 104 ₽ и один день, и если вопрос сводится к ней, полноценный замер на 100 примерах избыточен. А после запуска место разового замера занимает регулярная процедура — измерение качества на своих данных, которая повторяется ежемесячно и считает уже не выбор, а эксплуатацию.

Замер не отвечает на вопрос «какая модель лучше». Он отвечает на вопрос «берём или не берём» — и только потому, что порог был записан раньше, чем получены цифры.