Проверить модель на своих данных за неделю можно, и стоит это 30 часов работы трёх человек — 66 300 ₽ по ставкам сентября 2026 года. Схема одна и та же независимо от задачи: берёте одну операцию, собираете 100 реальных примеров, заранее пишете к ним правильные ответы, прогоняете через двух-трёх кандидатов и оцениваете результат вслепую. На выходе — четыре числа по каждому кандидату и одна страница с решением.
Смысл замера не в том, чтобы узнать, какая модель лучше вообще. Это знание бесполезно: место в чужом рейтинге получено на чужих текстах, в свободном формате ответа и с равной ценой всех ошибок. Ваш замер отвечает на единственный нужный вопрос — проходит ли кандидат порог на ваших документах, — и действителен ровно до следующего обновления модели.
Ниже — как собрать выборку, которая покажет правду, план на пять дней по часам и ролям, четыре цифры свода, полный бюджет и то, что от теста остаётся навсегда. Ставки в расчётах: инженер 3 000 ₽/час, предметный специалист и методист 900 ₽/час. Шесть критериев, из которых замер закрывает первый, разобраны в опорной статье про выбор языковой модели для бизнеса.
Одна операция, 100 примеров, три кандидата
Первая ошибка совершается до сбора данных: тестируют «нейросеть», а не операцию. «Проверим, справится ли модель с документами» — это не задача замера, потому что у такой формулировки нет правильного ответа, с которым можно сверить. Задача звучит иначе: «извлечь номер, дату, сумму, ИНН контрагента и позиции из счёта поставщика в строгом формате».
- Одна операция за один замер. Классификация обращений и ответ по базе знаний — два разных теста с разными выборками и разными эталонами. Совмещение экономит два дня и обесценивает оба результата.
- Сто примеров. Ниже пятидесяти разница между кандидатами тонет в случайности, выше полутора сотен растёт только счёт за разметку. Сто — рабочий компромисс для решения о выборе, а не для приёмки готовой системы.
- Два-три кандидата. Четвёртый почти никогда не меняет решение, а оценку удлиняет на треть. Разумный набор — две российские облачные модели разных уровней и одна локальная, чтобы понимать, чего вы лишаетесь, уходя в свой контур.
- Один и тот же промпт всем. Подгонка инструкции под каждого кандидата отдельно — это уже не сравнение моделей, а сравнение усилий инженера. Подгонку делают потом, для победителя.
Выборка: 80 случайных и 20 трудных
Честная выборка собирается в два приёма, и оба обязательны. Восемьдесят примеров берутся случайно из реального потока за последние два-три месяца — не «характерные», не «показательные», а просто каждый N-й из выгрузки. Ещё двадцать отбираются намеренно, по списку трудных случаев, и хранятся отдельной корзиной.
Когда выборку собирает человек, который хочет, чтобы проект состоялся, он бессознательно берёт понятные случаи: аккуратные сканы, вежливые вопросы, стандартные формулировки. Модель показывает отличный результат, решение принимается, а через месяц выясняется, что в бою треть входа выглядит иначе. Защита простая: случайный отбор делается скриптом, а не глазами, и результат никто не редактирует.
Двадцать трудных примеров — это не «сложные вопросы», а пять именованных корзин по четыре штуки. Плохое качество входа: скан под углом, опечатки в артикуле, обрезанный текст. Нестандартная форма: документ другого поставщика, письмо без темы. Пограничные случаи: два договора в одном файле, возврат вместо поставки. Вопросы вне базы: то, на что верный ответ — честное «не знаю». И провокации: попытка получить скидку, которой нет, или подтверждение срока, который вы не даёте.
Схема состава выборки. Слева большой прямоугольник «Поток за 3 месяца» со стрелкой «случайный отбор скриптом» в блок «80 примеров». Справа отдельный столбик из пяти небольших блоков по 4 примера каждый, подписанных: «Плохое качество входа», «Нестандартная форма», «Пограничные случаи», «Вопросы вне базы», «Провокации». Оба потока сходятся в общий блок «Выборка 100 примеров». Под ним подпись: «эталоны пишет предметный специалист, 4 минуты на пример». Чертёжный стиль, подписи по-русски.
Пять дней по часам и ролям
Календарно это рабочая неделя, активной работы в ней — четыре дня. В опорной статье кластера тот же замер назван четырёхдневным: там пятый день, приёмка решения, не считался работой. Разница только в способе счёта, суммы и часы совпадают.
- 1День 1. Выгрузка, 4 часа инженера
Скрипт достаёт 80 случайных примеров из почты, CRM или архива и обезличивает их: убирает имена, телефоны, номера счетов. Обезличивание не формальность — вы отдаёте эти данные внешним провайдерам, и без него замер сам становится обработкой персональных данных. Параллельно предметный специалист набирает 20 трудных примеров по пяти корзинам.
- 2День 2. Эталоны, 7 часов предметного специалиста
Бухгалтер, диспетчер или старший менеджер пишет, каким должен быть правильный ответ на каждый пример. Четыре минуты на пример, 100 примеров — семь часов с перерывами. Это единственная часть работы, которую нельзя перепоручить подрядчику: он не знает, что у вас считается верным. Побочный результат обычно ценнее самого замера — на паре десятков примеров выясняется, что сотрудники отвечают по-разному.
- 3День 3. Прогон, 10 часов инженера
Единый промпт, подключение трёх провайдеров, сбор 300 ответов в одну таблицу. Здесь же фиксируется версия каждой модели: не общий псевдоним вроде «последняя», а конкретная версия, иначе результат нельзя будет повторить через месяц. Токены на весь прогон стоят около 1 500 ₽ — меньше, чем час работы любого участника.
- 4День 4. Слепая оценка, 5 часов оценщика
Ответы перемешиваются и обезличиваются: оценщик не знает, какая модель что написала. Каждый ответ получает одну из четырёх меток — верный, честный отказ, ошибка без последствий, критическая ошибка. Метки простые намеренно: балльные шкалы от одного до десяти дают красивые средние и не дают решения.
- 5День 5. Свод и подпись, 4 часа инженера
Одна страница: какие кандидаты сравнивались, на каких данных, какие получились четыре цифры, что выбрано и почему. Туда же дата замера и версии моделей. Через год, когда встанет вопрос о смене, эта страница сэкономит неделю споров.
Человек, который писал инструкцию для модели, знает, что она умеет, и незаметно формулирует эталон в её сторону — а при оценке засчитывает ответ «по смыслу». Разделение ролей стоит ноль рублей и снимает почти всю систематическую ошибку замера: промпт пишет инженер, эталоны — предметный специалист, оценивает третий человек и вслепую. Если кандидатов вам приводит подрядчик, оценка тем более остаётся на вашей стороне.
Горизонтальная лента на пять дней с тремя дорожками ролей: «Инженер», «Предметный специалист», «Оценщик». На дорожке инженера отрезки «День 1 — выгрузка, 4 ч», «День 3 — прогон, 10 ч», «День 5 — свод, 4 ч». На дорожке специалиста один отрезок «День 2 — эталоны, 7 ч». На дорожке оценщика один отрезок «День 4 — слепая оценка, 5 ч». Между дорожками специалиста и оценщика вертикальная штриховая линия с подписью «разные люди». В конце ленты флажок «30 часов, 66 300 ₽». Чертёжный стиль, подписи по-русски.
Четыре цифры и критерий go/no-go
Порог записывается до прогона — это главное правило свода. Если критерий формулируется после того, как увидели цифры, он неизбежно подгоняется под уже понравившийся вариант, и замер из основания решения превращается в его обоснование. Порог занимает четыре строки и утверждается тем, кто платит за проект.
| Показатель | Кандидат А | Кандидат Б | Кандидат В | Порог, записанный до замера |
|---|---|---|---|---|
| Верных ответов из 100 | 78 | 82 | 71 | не ниже 75 |
| Честных отказов | 12 | 6 | 19 | не выше 20 |
| Критических ошибок | 0 | 7 | 0 | 0 |
| Цена обращения | 1,04 ₽ | 3,12 ₽ | 8,97 ₽ | не выше 2 ₽ |
| Решение | проходит | отклонён | отклонён | порог берут все четыре строки сразу |
Таблица условная — так выглядит свод, а не рейтинг реальных моделей. Но логика в ней настоящая, и она контринтуитивна: кандидат Б лидирует по главной цифре и выбывает из-за третьей строки. Критические ошибки не усредняются с остальными — неверная сумма в счёте, выдуманный пункт договора и обещание срока, которого вы не даёте, стоят дороже, чем двадцать безобидных неточностей. Кандидат В безупречен по ошибкам, но отказывается отвечать в каждом пятом случае и обходится в 8,97 ₽ за обращение, потому что это локальная модель в своём контуре, где цена обращения складывается из амортизации железа, а не из токенов.
Ответ вида «в базе знаний нет данных, передаю специалисту». Это не ошибка, а правильное поведение на вопросах вне базы, и в своде он идёт отдельной строкой. Кандидат, который никогда не отказывается, не лучше — он просто отвечает уверенно там, где не знает. Как формулируется и проверяется такое поведение, разобрано в материале про ответ «не знаю» как целевое поведение.
Промежуточный результат — когда никто не взял порог или взяли двое — обрабатывается заранее оговорённым правилом. Если не взял никто, порог чаще всего назначен не той задаче: модель просят пересказать договор целиком там, где нужно извлечь пять полей. Сужаете операцию, переписываете эталоны, прогоняете тот же набор заново — второй прогон стоит уже около 15 000 ₽, потому что эталоны написаны. Если взяли двое, берите того, у кого дешевле уход: смена модели стоит 34 часа при наличии адаптера и 78 часов без него.
Бюджет замера и что от него остаётся навсегда
Двенадцать часов из тридцати — время предметного специалиста и оценщика, то есть людей, у которых есть основная работа. Их надо согласовать с руководителем отдела до старта, а не в среду утром. Это же обстоятельство делает замер невозможным в компаниях, где предметный специалист один и он в отпуске: перенести замер дешевле, чем отдать эталоны стажёру.
Главный побочный результат — размеченный набор. Из ста примеров с эталонами вырастает регресс-набор, которым потом проверяют каждое обновление модели и принимают работу подрядчика. Собранный с нуля набор на 180 примеров стоит 50 часов и 91 200 ₽; после замера остаётся добрать 80 примеров и сделать оснастку.
Экономия 44 610 ₽ — не главный аргумент. Главный в том, что набор, собранный в момент миграции, отражает уже изменённую систему и потому бесполезен как эталон. Дальше один прогон 180 примеров стоит 3 240 ₽ и делается при каждом обновлении версии модели, а сам набор становится приложением к договору с подрядчиком.
Сравнение в две колонки одинаковой ширины. Левая колонка «После замера»: строки «22,5 часа», «46 590 ₽», «100 примеров уже размечены». Правая колонка «С нуля в момент миграции»: строки «50 часов», «91 200 ₽», «набор отражает уже изменённую систему». Между колонками вертикальная фигурная скобка с подписью «разница 44 610 ₽». Под колонками общая сноска: «один прогон набора — 3 240 ₽». Чертёжный стиль, подписи по-русски.
Когда замер не нужен или преждевременен
Замер стоит 66 300 ₽ и окупается не всегда. Четыре ситуации, в которых эти деньги лучше потратить иначе, встречаются регулярно, и в двух из них тест дал бы формально корректный, но бессмысленный результат.
- Поток меньше 300 обращений в месяц. Разница между кандидатами на таком объёме не окупает разметку. Разумнее взять доступного кандидата, месяц читать все ответы подряд и решать по ним; порог объёма, ниже которого не окупается сама автоматизация, разобран в материале про порог окупаемости по объёму.
- Задача решается без модели. Расчёт по формуле, маршрутизация по полю формы, проверка формата не требуют нейросети вообще — и тогда сравнивать нечего. Шесть таких классов задач разобраны отдельно в материале про то, когда ИИ не нужен.
- Нет предметного специалиста, который напишет эталоны. Без эталонов замер превращается в чтение ответов и обсуждение впечатлений. Это не замер, и его результат не переживёт первого спора с подрядчиком.
- Данные в беспорядке. Если одна и та же позиция записана в трёх системах по-разному, все кандидаты ошибутся одинаково, а вы решите, что дело в моделях. Сначала — короткий чек-лист проверки качества данных, он занимает несколько часов.
Отдельно про соблазн проверить только русский язык или только терминологию: это разные и более дешёвые процедуры. Узкая проверка русского на 50 примерах стоит 21 104 ₽ и один день, и если вопрос сводится к ней, полноценный замер на 100 примерах избыточен. А после запуска место разового замера занимает регулярная процедура — измерение качества на своих данных, которая повторяется ежемесячно и считает уже не выбор, а эксплуатацию.
Замер не отвечает на вопрос «какая модель лучше». Он отвечает на вопрос «берём или не берём» — и только потому, что порог был записан раньше, чем получены цифры.
