Языковую модель для бизнеса выбирают по шести критериям, и место в мировом рейтинге не входит ни в один из них. Два критерия работают как фильтры и отсекают кандидата сразу, независимо от качества ответов: можно ли легально заплатить провайдеру из России и что происходит с персональными данными, которые вы ему отправляете. Оставшиеся четыре — качество на вашей задаче, стоимость тысячи обращений, лимиты и устойчивость провайдера, стоимость будущей смены модели — измеряются и складываются в понятную оценку. Всю проверку реально уложить в одну рабочую неделю.
Обычная ошибка — начать с обзора лидербордов. Половина участников любого мирового рейтинга недоступна российской компании для легальной оплаты, а оставшиеся сравниваются на задачах, которых нет в вашей работе. Ниже — разбор того, из чего действительно приходится выбирать в России по состоянию на сентябрь 2026, по каким признакам, в каком порядке и с какими цифрами в руках.
Все суммы в статье — модельные расчёты на прозрачных вводных, а не измеренная статистика рынка. Ставки одни и те же: инженер 3 000 ₽/час, предметный специалист 900 ₽/час, оператор 700 ₽/час, системный администратор 2 500 ₽/час. Цены за токены взяты порядком величины — подставьте актуальный прайс своего провайдера на дату расчёта, арифметика от этого не изменится.
Шесть критериев и их веса
Критерии перечислены в порядке проверки, а не в порядке важности. Сначала прогоняются два фильтра: они дешёвые, занимают день на переписку с поставщиком и убирают половину кандидатов до того, как вы потратите неделю на замер качества. Оценивать качество модели, которой нельзя заплатить, — самый обидный способ потерять время.
| Критерий | Что именно проверяем | Как проверить | Вес |
|---|---|---|---|
| 1. Доступность и способ оплаты из РФ | Есть ли договор с российским юрлицом, счёт в рублях, закрывающие документы. Не «работает ли доступ», а «примет ли это ваша бухгалтерия и служба безопасности» | Запросить проект договора и счёт до начала пилота. День переписки | Фильтр |
| 2. Режим работы с персональными данными | Где физически лежат серверы, есть ли поручение обработки, обучается ли провайдер на ваших запросах, сколько хранит логи и кто в них смотрит | Читать приложение к договору о персональных данных, а не страницу с описанием тарифов | Фильтр |
| 3. Качество на вашей задаче | Доля верных ответов и отдельно доля критических ошибок на 100 ваших реальных примерах, а не на публичном тесте | Замер по протоколу: примеры, эталоны, слепая оценка. Четыре дня, около 66 000 ₽ | 30 |
| 4. Стоимость тысячи обращений | Реальный профиль запроса в токенах, умноженный на ваш объём. Не цена за 1000 токенов из прайса, а рубли в месяц | Посчитать по своим объёмам на трёх типах операций | 30 |
| 5. Лимиты и устойчивость провайдера | Квоты в минуту и в сутки, задержка под нагрузкой, политика версий, история односторонних изменений тарифа | Нагрузочный прогон на пиковом профиле плюс прямые вопросы поставщику | 20 |
| 6. Стоимость смены модели | Сколько часов займёт переезд на другого провайдера при вашей архитектуре — и есть ли вообще куда переезжать | Оценить по коду: считаются вызовы модели, промпты и точки разбора ответа | 20 |
Веса подвижны, и это нормально. Если вы обрабатываете специальные категории персональных данных — здоровье, судимости, биометрию, — второй критерий перестаёт быть фильтром «да/нет» и становится единственным содержанием выбора: остаётся ровно один вариант, модель в собственном контуре. Если задача внутренняя, данные обезличены, а объём мал, вес стоимости падает почти до нуля: разница между кандидатами в 3 000 ₽ в месяц не стоит обсуждения на совете директоров. Что нельзя делать — это выкидывать критерий целиком, потому что он неудобен.
Вертикальная воронка из шести ступеней. Верхние две ступени обозначены как фильтры и нарисованы как заслонки с подписями «Оплата из РФ» и «Персональные данные»; сбоку от них стрелки в сторону с подписью «кандидат выбывает». Нижние четыре ступени — весовые, подписаны «Качество на вашей задаче — 30», «Стоимость тысячи обращений — 30», «Лимиты и устойчивость — 20», «Стоимость смены модели — 20». Внизу воронки блок «Итого 100 баллов» и подпись «решение фиксируется письменно». Чертёжная графика, только русские подписи.
Почему место в лидерборде не переносится на вашу задачу
Публичный бенчмарк проверяет универсальность: как модель справляется с широким набором заданий, ни одно из которых не является вашим. Вам нужна не универсальность, а одна операция, повторённая десять тысяч раз на ваших документах, с вашей терминологией и с вашей ценой ошибки. Это две разные величины, и корреляция между ними слабее, чем принято думать.
Расхождение возникает по пяти конкретным причинам, и все они техничны, а не философичны.
- Данные. В бенчмарке — чистый текст, у вас — скан накладной с печатью поверх строки, письмо без знаков препинания и переписка с сокращениями склада.
- Терминология. В вашей отрасли «отгрузка» значит не то же, что в общем языке, а артикул «КР-140/2» модель видит впервые. В тесте вашего глоссария нет.
- Длина контекста. Бенчмарк работает на коротких заданиях, а у вас в запрос уходит пять фрагментов базы знаний и история диалога — и качество на длинном контексте деградирует не так, как на коротком.
- Формат ответа. Вам нужен строгий JSON с обязательными полями, который разберёт программа. Тест оценивает свободный текст, где мелкие отклонения формата не считаются ошибкой.
- Цена ошибки. В тесте все ошибки равны. У вас перепутанная сумма в счёте стоит на два порядка дороже, чем неудачная формулировка в описании товара, — и модель, выигравшая по средней точности, может проигрывать именно на дорогих ошибках.
Отсюда практическое следствие: любая внешняя цифра качества — это гипотеза, а не результат. Она годится, чтобы сократить список кандидатов с десяти до трёх, и не годится, чтобы принять решение. Дальше нужен собственный замер, и он стоит ощутимо дешевле, чем кажется, — расчёт будет ниже.
Две колонки рядом. Левая подписана «Чужой лидерборд»: строки «Данные — публичный набор», «Формат ответа — свободный текст», «Глоссарий — общий язык», «Цена ошибки — все ошибки равны», «Срок годности — до следующей версии». Правая подписана «Ваш замер, 100 примеров»: строки «Данные — ваши сканы и письма», «Формат — строгий JSON», «Глоссарий — ваши артикулы», «Цена ошибки — считается в рублях», «Срок годности — до смены версии модели». Внизу общая подпись: «Первое сокращает список до трёх, второе принимает решение».
Из чего реально выбирают в России на сентябрь 2026
Вариантов доступа три, и они отличаются не столько качеством, сколько юридической и эксплуатационной механикой. Внутри каждого варианта есть выбор конкретной линейки, но сначала имеет смысл выбрать сам вариант — потому что именно он определяет, что вы сможете написать в договоре с заказчиком и в уведомлении регулятору.
| Способ доступа | Оплата из РФ | Персональные данные | Цена и устойчивость | Что проверить первым |
|---|---|---|---|---|
| Российское облако по API: GigaChat 3 (Lite/Pro/Max) и GigaChat 3.1 Ultra, YandexGPT 5, Cotype Pro, T-Pro | Договор с российским юрлицом, оплата в рублях, закрывающие документы для бухгалтерии | Серверы в РФ, трансграничной передачи нет. Нужны поручение обработки и письменный отказ провайдера от обучения на ваших запросах | Самый дешёвый вариант при объёме до нескольких десятков тысяч обращений в месяц. Тарифы и лимиты меняются в одностороннем порядке | Приложение о персональных данных и режим хранения логов |
| Открытая модель в своём контуре: Qwen 3, Llama, DeepSeek, Mistral через Ollama, векторное хранилище на pgvector | Платите только за железо, электричество и людей. Лицензия на веса — отдельный вопрос к юристу | Данные не покидают вашу сеть. Трансграничной передачи нет по построению, третьего лица в цепочке нет | Фиксированная стоимость владения — около 90 000 ₽/мес для средней конфигурации, независимо от объёма. Устойчивость зависит только от вас | Лицензию конкретной версии весов и наличие администратора, который это обслуживает |
| Зарубежная модель через посредника: OpenAI, Anthropic и агрегаторы | Прямая оплата из РФ невозможна: Россия не входит в список поддерживаемых стран. Платит посредник, ваш договор — с ним, а не с владельцем модели | Трансграничная передача плюс дополнительное третье лицо в цепочке обработки. Юридически серая зона | Цена с наценкой посредника. Доступ может пропасть без предупреждения — как со стороны модели, так и со стороны посредника | Кто в этой цепочке оператор, кто обработчик и что будет с процессом, если посредник исчезнет |
Внутри первого варианта на сентябрь 2026 линейки выглядят так. У Сбера — GigaChat 3 в трёх уровнях (Lite, Pro, Max) и старшая GigaChat 3.1 Ultra, плюс корпоративная платформа GigaChat Enterprise, которая с марта 2026 предлагает три схемы размещения: облако, свой контур и гибрид. У Яндекса — YandexGPT 5 и надстройка Yandex AI Studio с конструктором агентов Agent Atelier, MCP Hub, векторным хранилищем и поиском. У Т-Банка — T-Lite и T-Pro, у МТС — Cotype Pro. Каждая из этих моделей закрывает типовые деловые задачи на русском языке; какая именно окажется точнее на ваших накладных, не знает никто, включая нас, — это и есть предмет замера.
Про качество отечественных моделей стоит сказать прямо, потому что в выдаче об этом пишут в двух крайностях. На публичных тестах разрыв с мировыми лидерами за последние два года заметно сократился, и по русскому языку российские линейки часто выглядят лучше переводных решений. При этом на прикладных рабочих задачах результат неоднозначный: одна и та же модель уверенно классифицирует письма и путается в извлечении полей из скана, ровно держит деловой тон и ломает строгий формат ответа на пятой тысяче запросов. Это не претензия к разработчикам — так ведут себя все модели этого класса. Практический вывод один: любое утверждение вида «модель X лучше модели Y» имеет смысл только с приписками «на такой-то задаче», «на таких-то данных» и «на такую-то дату».
Прямая оплата из РФ невозможна — страна не входит в список поддерживаемых для API. Схемы через рублёвые прокси и агрегаторы технически работают, но юридически это серая зона: договор у вас с посредником, а фактическая обработка идёт у владельца модели за границей. Если в запросах есть персональные данные, вы получаете трансграничную передачу без нормального основания и без поручения обработки — при проверке объяснить это нечем. Отдельно: такой доступ отключается без предупреждения, и процесс, построенный на нём, встаёт в тот же день. Мы упоминаем эти модели как ориентир качества и как источник открытых практик, но не рекомендуем их как основу производственного контура российской компании.
Карта из трёх горизонтальных маршрутов. Верхний: «Ваша система» → «Российское облако модели» → «Ответ», рядом рамка «серверы в РФ, нужно поручение обработки». Средний: «Ваша система» → «Сервер в вашей сети (Ollama)» → «Ответ», рамка «данные не покидают контур». Нижний: «Ваша система» → «Посредник» → «Зарубежная модель» → «Ответ», рамка «трансграничная передача, договор с посредником» и пометка «доступ может пропасть». Границу РФ обозначить вертикальной штриховой линией, которую пересекает только нижний маршрут.
Критерий качества: как померить его за рабочую неделю
Замер качества выглядит трудоёмким ровно до момента, пока его не расписать по дням. На одной задаче с тремя кандидатами это четыре рабочих дня и один человек с вашей стороны, который знает предмет. Никакой лаборатории не нужно — нужен набор примеров и дисциплина в оценке.
- 1День 1. Собрать 100 реальных примеров
Выгружаются настоящие входные данные за последние два-три месяца: письма, сканы, реплики клиентов, документы — то, что будет приходить в систему в бою. Обязательно включить трудные случаи: нестандартные формы, опечатки, вопросы не по теме, попытки получить скидку. Если взять только удобные примеры, замер покажет, что всё прекрасно, и это будет правда ровно до запуска. Минимум — 50 примеров, ниже этого разница между кандидатами тонет в случайности.
- 2День 2. Записать эталонные ответы
Предметный специалист — бухгалтер, диспетчер, старший менеджер — пишет, каким должен быть правильный ответ на каждый пример. Это самая ценная часть работы и единственная, которую нельзя перепоручить подрядчику: он не знает, что у вас считается верным. Побочный эффект приятный: на этом шаге обычно выясняется, что в двух десятках случаев сами сотрудники отвечают по-разному, — и это отдельная находка про процесс.
- 3День 3. Прогнать двух-трёх кандидатов
Одинаковый промпт, одинаковые примеры, разные модели. Больше трёх кандидатов брать не стоит: оценка растёт линейно, а решение от четвёртого варианта не меняется. Разумный набор — две российские облачные модели разных уровней и одна локальная, чтобы понимать, чего вы лишаетесь или не лишаетесь, уходя в свой контур.
- 4День 4. Оценить вслепую и посчитать деньги
Ответы обезличиваются: оценщик не должен знать, какая модель что написала, иначе оценка съезжает в сторону ожиданий. Считаются две разные величины — общая доля верных ответов и отдельно доля критических ошибок (неверная сумма, выдуманный пункт договора, обещание, которого нет в прайсе). Модель с точностью 88% и нулём критических ошибок практически всегда лучше модели с 92% и тремя.
- 5День 5. Зафиксировать выбор письменно
Одна страница: какие кандидаты сравнивались, на каких данных, какие получились числа, что выбрано и по какой причине. Через год, когда встанет вопрос о смене, эта страница сэкономит неделю споров и покажет, изменились ли исходные предпосылки. Туда же — дата замера: результат действителен на неё, а не вечно.
Горизонтальная лента времени из пяти отрезков, подписанных «День 1 — 100 примеров», «День 2 — эталонные ответы», «День 3 — прогон трёх кандидатов», «День 4 — слепая оценка и деньги», «День 5 — решение письменно». Под каждым отрезком мелкой строкой указано, кто занят: «инженер 4 ч», «предметный специалист 7 ч», «инженер 10 ч», «оценщик 5 ч», «инженер 4 ч». В конце ленты флажок с подписью «66 300 ₽». Чертёжная графика, только русские подписи.
Сравните это с ценой ошибки. Если модель выбрана вслепую и на потоке в 10 000 обращений в месяц даёт на 4 процентных пункта больше ответов, требующих ручной правки, — это 400 разборов в месяц по 8 минут, то есть 53 часа оператора и около 37 000 ₽ ежемесячно. Замер окупается за второй месяц эксплуатации и продолжает окупаться дальше. При этом набор из 100 размеченных примеров остаётся у вас навсегда: он же станет регрессионным тестом при обновлении модели и приложением к договору с подрядчиком.
Критерий персональных данных: что смотреть в договоре
Этот критерий выглядит юридическим, но проверяется инженерно: нужно понять маршрут данных и зафиксировать его на бумаге. Вопрос «где лежат серверы» — только первый из шести, и сам по себе он ничего не гарантирует.
- Где физически обрабатываются и хранятся запросы. Для персональных данных граждан РФ ч. 5 ст. 18 152-ФЗ требует, чтобы базы находились в России, — это касается и логов диалогов, а не только вашей CRM.
- Есть ли поручение обработки. Провайдер модели, который получает от вас имена и телефоны, становится обработчиком по ч. 3 ст. 6 152-ФЗ: нужен договор с перечнем действий, целями и обязанностью соблюдать требования безопасности.
- Обучается ли провайдер на ваших запросах. Ответ должен быть письменным и отрицательным, а не устным и обнадёживающим. Отдельно уточните, распространяется ли это на бесплатный и тестовый тарифы — там условия часто другие.
- Сколько хранятся логи и кто в них смотрит. Тридцать дней хранения полного текста запросов — это тридцать дней, в течение которых ваши договорные суммы лежат у третьей стороны.
- Что происходит при инциденте. Уведомит ли провайдер вас и в какой срок: вы обязаны сообщить в Роскомнадзор об утечке в течение 24 часов, а результаты внутреннего расследования — в течение 72 часов.
- Что вы отправляете на самом деле. Половина проблем закрывается обезличиванием на входе: если в запрос уходит «клиент №4718» вместо фамилии, режим обработки меняется радикально и дешевле.
Если после этих шести вопросов остаются нерешаемые пункты — данные специальных категорий, требование заказчика или отраслевого регулятора, госконтракт с условием по размещению, — вариант остаётся один: модель в собственном контуре. Мы разбирали этот сценарий отдельно: какие модели ставят на практике, на каком железе они работают, в какой бюджет это укладывается и что по 152-ФЗ всё равно остаётся вашей заботой даже при полностью локальной установке. С 1 сентября 2026 к этому добавились требования нового регулирования ИИ, включая маркировку сгенерированного контента, — внутреннюю политику использования ИИ имеет смысл завести до внедрения, а не после.
Критерий стоимости: считаем рубли, а не цену за 1000 токенов
Единица, которой модель измеряет текст: примерно 2–3 символа русского языка, то есть страница А4 — это порядка 1 000–1 500 токенов. Провайдер тарифицирует отдельно входные токены (всё, что вы отправили: инструкцию, найденные фрагменты базы, историю диалога) и выходные (то, что модель написала). Выходные обычно дороже входных в 2–3 раза.
Цена из прайса ни о чём не говорит, пока не умножена на профиль вашего обращения. Профиль — это сколько токенов реально улетает за одну операцию, и разброс здесь тридцатикратный. Ниже — четыре типовые операции при ориентировочной цене 0,20 ₽ за 1 000 входных токенов и 0,60 ₽ за 1 000 выходных.
| Операция | Входных токенов | Выходных | Цена одного обращения | 10 000 обращений |
|---|---|---|---|---|
| Классификация входящего письма по 12 темам | 700 | 30 | 0,16 ₽ | 1 600 ₽ |
| Переписывание карточки товара | 1 200 | 600 | 0,60 ₽ | 6 000 ₽ |
| Ответ по базе знаний с пятью найденными фрагментами | 4 000 | 400 | 1,04 ₽ | 10 400 ₽ |
| Сводка договора на 30 страниц | 25 000 | 900 | 5,54 ₽ | 55 400 ₽ |
| Диалог с клиентом из 10 реплик (весь диалог целиком) | 30 000 | 1 500 | 6,90 ₽ | 69 000 ₽ |
Обратите внимание на последнюю строку: диалог считается не за реплику, а целиком. При каждой новой реплике модели заново отправляется вся история разговора, поэтому десятая реплика стоит примерно вдесятеро дороже первой. Компании, которые прикидывают бюджет чат-бота по цене одного вопроса, ошибаются в пять-семь раз. Второе следствие: обрезка истории и суммаризация длинных диалогов — это не оптимизация ради красоты, а прямая экономия, которая окупает работу инженера за месяц.
Это главная отрезвляющая цифра всей статьи. Счёт за модель в типовой компании сопоставим с зарплатой стажёра за неделю и меньше, чем поддержка системы, которая её вызывает. Выбирать провайдера ради экономии 4 000 ₽ в месяц, проиграв при этом два процентных пункта качества, — арифметически невыгодно: два пункта на этих объёмах стоят дороже. Стоимость становится решающей в двух случаях: когда операции длинные (сводки, разбор документов, длинные диалоги) или когда объём переваливает за сотню тысяч обращений в месяц. Тогда же появляется смысл считать порог перехода в собственный контур.
Горизонтальная столбчатая диаграмма, ось X в рублях от 0 до 30 000. Столбцы сверху вниз: «Классификация почты — 1 280 ₽», «Ответы по базе знаний — 6 240 ₽», «Сводки документов — 2 216 ₽», «Клиентские диалоги — 8 280 ₽», затем итоговый столбец «Модель всего — 18 016 ₽» и отдельно выделенный другим тоном «Поддержка системы — 25 000 ₽». Под диаграммой подпись: «Компания 120 человек, сентябрь 2026, модельный расчёт».
Критерий устойчивости: лимиты, версии и односторонние изменения
Пятый критерий отвечает на вопрос, который в момент выбора кажется теоретическим, а через год оказывается главным: что произойдёт с вашим процессом, если провайдер изменит правила. Изменит он их обязательно — вопрос только в том, насколько больно это будет.
- Квоты: сколько запросов в минуту и в сутки разрешено на вашем тарифе. Считайте не среднюю нагрузку, а пиковую: понедельник, десять утра, когда за час приходит четверть дневного потока.
- Задержка под нагрузкой. Средний ответ за две секунды и худший из ста ответов за сорок — это разные системы. Для диалога с клиентом важен именно худший.
- Политика версий. Провайдер вправе обновить модель, оставив прежнее имя. Ваши промпты рассчитаны на прежнее поведение, и ночью после обновления доля ошибок может измениться без единой правки с вашей стороны.
- Порядок вывода модели из обслуживания: за сколько месяцев предупреждают и есть ли зафиксированный срок поддержки текущей версии.
- История изменений тарифов и лимитов за последний год. Это открытая информация, и она говорит о провайдере больше, чем страница с описанием возможностей.
За последние два года участники этого рынка — все, без исключений — меняли тарифы, вводили и снимали лимиты, обновляли модели под прежними именами и закрывали доступ отдельным категориям пользователей. Считайте это не риском, а нормальным свойством среды. Практических следствий три. Первое: в любом расчёте окупаемости держите сценарий, где цена обращения выросла втрое, — если при нём проект перестаёт сходиться, он не готов к запуску. Второе: закрепите версию модели явно, а не через общий алиас, и держите набор из 100 примеров как регрессионный тест, чтобы за час проверить систему после обновления. Третье: адаптер, о котором ниже, должен быть в архитектуре с первого дня — именно он превращает смену провайдера из проекта в задачу на три дня.
Критерий смены: сколько стоит уйти к другому провайдеру
Шестой критерий уникален тем, что его цена определяется не провайдером, а вами — и определяется в первую неделю разработки. Если вызовы модели раскиданы по коду, промпты вписаны в бизнес-логику, а формат ответа разбирается в пяти местах, миграция превращается в небольшой проект. Если между системой и моделью стоит адаптер — тонкий слой, который прячет конкретного провайдера за одним внутренним интерфейсом, — миграция становится заменой драйвера.
Заметьте, что строка «повторный замер» одинакова в обоих расчётах и не сокращается ничем: проверять новую модель на своих примерах придётся в любом случае, потому что промпт, отлаженный под одну модель, у другой ведёт себя иначе. Именно поэтому набор примеров — актив, а не расходник. Хранить его нужно вместе с эталонными ответами и датой последнего прогона, тогда любая замена начинается не с нуля, а с готового теста.
Схема из трёх слоёв. Слева блок «Ваша система: сценарии, промпты, разбор ответа». В центре вертикальный блок «Адаптер: единый интерфейс вызова, схема ответа, повтор при ошибке, учёт токенов». Справа три сменных блока-драйвера, нарисованных как вставляемые карточки: «Российское облако», «Локальная модель», «Резервный провайдер»; над ними подпись «меняется за 6 часов». Внизу подпись-сноска: «Без адаптера то же самое — 78 часов».
Матрица: какой класс модели под какой класс задачи
Самая частая и самая дорогая ошибка в выборе — брать старшую модель на все задачи подряд. Классификация письма по двенадцати темам не становится лучше от того, что её делает флагман: она упирается не в мощность модели, а в качество инструкции и стабильность формата ответа. При этом счёт за неё вырастает в разы. Разумная архитектура почти всегда смешанная: младшая модель на массовых коротких операциях, старшая — на редких и сложных.
| Класс задачи | Что решает результат | Обычно достаточно | Когда нужна старшая модель |
|---|---|---|---|
| Классификация и маршрутизация: письма, обращения, заявки | Стабильность формата ответа и понятная инструкция, а не эрудиция модели | Младший уровень линейки или локальная модель на 8–14 млрд параметров | Классов больше тридцати и они пересекаются по смыслу |
| Извлечение полей: счета, накладные, договоры | Точность на редких формах и корректная работа с OCR-слоем скана | Младший-средний уровень плюс отдельный распознаватель документов | Поля не написаны в документе явно, а выводятся из смысла текста |
| Ответ по базе знаний со ссылкой на источник | Следование инструкции и честный отказ, когда поиск ничего не нашёл | Средний уровень линейки, контекст от 16 тысяч токенов | Ответ собирается из пяти и более фрагментов, между которыми есть противоречия |
| Сводка длинного документа: договор, тендер, протокол | Длина контекста и удержание фактов на всём объёме, а не на первых страницах | Средний-старший уровень, контекст от 32 тысяч токенов | Документы от 30 страниц и требование не потерять ни одного существенного условия |
| Диалог с клиентом во внешнем канале | Тон, устойчивость к провокациям и соблюдение сценария — но решает это контур, а не модель | Средний уровень, обязательно с ограничителями на суммы, скидки и сроки | Публичный канал с высокой ценой ошибки и сложным сценарием продажи |
| Генерация текста: карточки товаров, описания, черновики писем | Разнообразие формулировок и соблюдение стиля компании | Младший-средний уровень: разница в качестве съедается редактурой | Текст идёт к клиенту без вычитки человеком — хотя правильнее так не делать |
Из матрицы следует ещё один вывод, неочевидный на старте: единый выбор «одна модель на всю компанию» обычно избыточен, но и зоопарк из пяти провайдеров вреден. Практический ориентир — два провайдера: основной и резервный, между которыми система умеет переключаться через адаптер. Каждый следующий добавляет договоры, счета, мониторинг и часы сопровождения, но не добавляет качества.
Матрица 6×2. По вертикали шесть классов задач: «Классификация», «Извлечение полей», «Ответ по базе знаний», «Сводка длинного документа», «Диалог с клиентом», «Генерация текста». По горизонтали две колонки: «Хватает младшей модели» и «Нужна старшая». Заполненные клетки закрашены, в них короткая пометка-условие. Справа от матрицы вертикальная подпись «объём операций в месяц» со стрелкой вниз, слева — «длина одного обращения» со стрелкой вверх. Внизу ремарка: «Смешанная схема дешевле единой на 3–5 раз по счёту за модель».
Когда выбирать модель не надо вообще
Половина запросов на выбор модели, которые к нам приходят, заканчивается выводом, что модель здесь не нужна. Это не кокетство: языковая модель — дорогой и вероятностный инструмент, и там, где задача детерминирована, она проигрывает обычной программе по всем параметрам сразу — по цене, по скорости, по предсказуемости и по возможности объяснить результат.
- Задача описывается правилами. Если маршрутизация заявки определяется регионом и суммой, это условие в коде на два часа работы, а не модель за 300 000 ₽. Хороший признак: вы можете описать логику на листе А4 без слова «обычно».
- Данные приходят в структурированном виде. Выгрузка из системы поставщика в XML не нуждается в языковой модели, чтобы попасть в вашу учётную систему, — ей нужен разбор формата и сверка справочников.
- Объём меньше порога окупаемости. При 300 обращениях в месяц ни одна конфигурация не окупится: экономия на операторе не покроет поддержку. Дешевле упорядочить процесс и написать шаблоны ответов.
- Нулевая терпимость к ошибке без человека в контуре. Расчёт налогов, выдача медицинского заключения, юридически значимое решение — модель может готовить черновик, но подписывает человек, и это меняет всю экономику проекта.
- Процесс сломан. Если заявки теряются потому, что их обрабатывают в четырёх местах и ни за одно никто не отвечает, модель добавит пятое место. Сначала процесс, потом автоматизация — порядок скучный, но обратный не работает.
- Нет никого, кто даст эталонные ответы. Если в компании нет человека, способного сказать, какой ответ правильный, замер провести невозможно, а без замера выбор модели превращается в лотерею.
Отдельная честная оговорка про порядок работ. Выбор модели — это не первый шаг проекта, а примерно четвёртый. Сначала описывается процесс и считается, сколько сейчас стоит ручная работа; потом проверяется, есть ли данные, на которых система вообще сможет работать; потом определяется класс задачи; и только затем выбирается модель. Компании, которые начинают с вопроса «какую нейросеть взять», обычно через два месяца возвращаются к первому шагу — но уже с потраченным бюджетом.
Что читать дальше в этом разделе
Эта статья — вход в раздел про выбор модели и провайдера. Дальше материалы расходятся по шести критериям: под каждый есть отдельный разбор с расчётами. Ниже — карта, чтобы не читать всё подряд.
- Качество: «Российские нейросети на рабочих задачах» — воспроизводимый протокол сравнения на пяти прикладных задачах и форма итоговой таблицы. И «Тест модели на своих данных за неделю» — та же процедура в виде чек-листа.
- Конкретный выбор: «GigaChat или YandexGPT» — сравнение двух главных отечественных платформ по семи параметрам, влияющим на проект.
- Персональные данные: «Локальная модель под 152-ФЗ» — что меняет свой контур в документах, какие модели ставят и в какой бюджет это укладывается.
- Деньги: «Облако или свой сервер для ИИ» — смета на 36 месяцев для обоих вариантов и точка пересечения кривых. И «Сколько стоит сервер под свою нейросеть» — три конфигурации железа.
- Устойчивость: «Зависимость от одного поставщика модели» и «Что делать, если провайдер закрыл доступ» — сценарии отказа и запасной контур.
- Смена модели: «Смена модели без переписывания системы» — как устроен адаптер и что в нём должно быть с первого дня.
Карта связей: в центре узел «Как выбрать модель» с пометкой «вы здесь». От него шесть ветвей к узлам «Качество на своих данных», «Оплата и доступ из РФ», «Персональные данные», «Стоимость обращений», «Лимиты провайдера», «Смена модели». От «Качества» отходят «Сравнение российских моделей» и «Тест за неделю», от «Персональных данных» — «Локальная модель под 152-ФЗ», от «Стоимости» — «Облако или свой сервер» и «Сколько стоит сервер», от «Лимитов» — «Если провайдер закрыл доступ», от «Смены» — «Адаптер». Подписи связей: «как померить», «чем закрыть», «сколько стоит».
Лучшая модель — не та, что выше в рейтинге, а та, которую вы проверили на своих ста примерах, которой можете легально заплатить и от которой сможете уйти за три дня.

