Счёт за языковую модель считается в токенах, а не в запросах и не в символах. Токен — кусочек текста примерно в 2–3 символа русского языка; провайдер тарифицирует отдельно всё, что вы отправили, и отдельно всё, что модель написала в ответ. Отсюда главное следствие для бюджета: вы платите не за вопрос клиента, а за весь текст, который система собрала и отправила вместе с этим вопросом.

В типовом запросе к ассистенту по базе знаний сам вопрос занимает 150 токенов из 3 800. Остальное — системная инструкция, пять найденных фрагментов документов и история разговора. Именно поэтому прикидка «одно обращение стоит копейки, у нас их немного» промахивается в разы: считать надо не вопрос, а конверт, в котором он уезжает.

Дальше — что такое токен и почему русский текст дороже английского; из чего складывается один запрос и какая часть за что отвечает; сквозной счёт на 6 000 обращений в месяц; пять приёмов, которые снижают строку модели вдвое-втрое; как читать прайс провайдера и что записать в договор, чтобы счёт не удвоился после первого месяца.

Токен — не буква и не слово

Что это значитТокен

Единица, которой модель разбивает текст на части перед обработкой. Для русского языка это в среднем 2–3 символа, для английского — около 4. Страница А4 по-русски весит порядка 1 000–1 500 токенов, та же страница по-английски — 600–800. Тарифицируются отдельно входные токены (всё, что вы отправили) и выходные (то, что модель написала). Ориентир на сентябрь 2026 для расчётов ниже: 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных; подставьте прайс своего провайдера на дату сделки.

Разница между языками — не мелочь, а множитель на всю смету. Модель режет текст на куски по статистике того корпуса, на котором обучался её токенизатор, и кириллица в большинстве универсальных токенизаторов дробится мельче латиницы. Практический результат: один и тот же смысл по-русски обходится примерно в полтора-два раза дороже. У моделей, изначально сделанных под русский язык — GigaChat и YandexGPT, — разрыв заметно меньше, и это отдельный аргумент при выборе провайдера, помимо вопроса о размещении данных.

Что отправляемПримерно токеновСтоимость на входе
Реплика клиента: «Здравствуйте, подскажите статус заказа»12–18менее 0,01 ₽
Страница А4 русского текста1 000–1 5000,20–0,30 ₽
Та же страница по-английски600–8000,12–0,16 ₽
Регламент на 40 страниц целиком40 000–60 0008–12 ₽ за один запрос
Пять найденных фрагментов базы по 480 токенов2 4000,48 ₽

Последние две строки таблицы объясняют, почему поиск по документам дешевле «кладём весь регламент в запрос». Отправить сорок страниц целиком стоит 8–12 ₽ за каждый вопрос; отправить пять относящихся к делу фрагментов — 48 копеек. Разница в двадцать раз, и она платится на каждом обращении. Механизм, который позволяет отбирать нужное, разобран в опорной статье раздела про поиск по вашим документам.

Из чего складывается один запрос

Возьмём рабочий пример: внутренний ассистент отвечает сотрудникам по регламентам и условиям договоров, поиск отдаёт пять фрагментов, ответ ограничен по длине. Так выглядит средняя реплика в диалоге.

Часть запросаТокеновДоля входаКто на неё влияет
Системная инструкция: правила, формат, стоп-темы80021 %подрядчик, один раз при настройке
Пять фрагментов базы по 480 токенов2 40063 %настройка поиска и размер фрагментов
История разговора, в среднем две пары реплик45012 %стратегия работы с историей
Вопрос человека1504 %никто, это данность
Вход всего3 800100 %
Ответ модели (выход)300тариф втрое вышеограничение длины ответа
графикtokeny-i-stoimost-zaprosov-k-modeli--01
Состав запроса в 3 800 токенов: фрагменты базы 63 %, инструкция 21 %, история 12 %, вопрос 4 %

Один горизонтальный составной столбец общей длиной 3 800 токенов, разбитый на четыре подписанных сегмента с числами и долями: «Фрагменты базы — 2 400 (63 %)», «Системная инструкция — 800 (21 %)», «История разговора — 450 (12 %)», «Вопрос человека — 150 (4 %)». Самый маленький сегмент выделен контуром и отдельной выноской со стрелкой: «то, что спросил человек». Справа от столбца отдельная короткая полоска «Ответ модели — 300 токенов» с подписью «тариф втрое выше». Внизу сноска: «0,20 ₽ за 1 000 входных, 0,60 ₽ за 1 000 выходных, сентябрь 2026».

Вопрос клиента — четыре процента того, за что выставлен счёт

Считаем цену обращения. Под обращением понимаем диалог из трёх реплик — это средняя длина внутреннего запроса «спросил, уточнил, поблагодарил». Первая реплика: 3 350 входных токенов (истории ещё нет) и 300 выходных, то есть 3 350 × 0,20 / 1 000 + 300 × 0,60 / 1 000 = 0,85 ₽. Вторая: история выросла на пару реплик, 3 800 входных — 0,94 ₽. Третья: 4 250 входных — 1,03 ₽. Обращение целиком — 2,82 ₽, из них 0,54 ₽ приходится на выход, то есть 19 %.

Полезно смотреть на эту таблицу как на список рычагов. Вопрос человека изменить нельзя — это данность. Всё остальное настраивается, и настраивается один раз: длина инструкции, число и размер фрагментов, глубина истории, ограничение длины ответа. Из четырёх строк входа три находятся под управлением подрядчика, и ни одна из них обычно не обсуждается на переговорах — обсуждается цена за 1 000 токенов, на которую вы повлиять как раз не можете.

Растёт только одна часть из четырёх

Инструкция, фрагменты и вопрос от реплики к реплике не меняются — растёт только история, и она уезжает в модель целиком каждый раз заново. На трёх репликах это ещё незаметно, на пятнадцати история становится основной статьёй. Что именно происходит на длинных диалогах и какие стратегии есть при переполнении контекстного окна, мы разбирали отдельно — там же посчитана разница в 27 045 ₽ в месяц между щедрой и аккуратной настройкой.

Счёт за месяц: 16 920 ₽ за модель и 66 620 ₽ за всё

Вводные модельного примера: производственно-торговая компания, 140 человек, внутренний ассистент по регламентам и условиям договоров, поток 6 000 обращений в месяц, база из 380 документов. Цена обращения 2,82 ₽ по расчёту выше. Ставки для внутренних часов: предметный специалист 900 ₽/час, оператор 700 ₽/час.

Месяц эксплуатации, 6 000 обращений
Вызовы модели: 6 000 × 2,82 ₽16 920 ₽ — 25 %
Поддержка и мелкие доработки подрядчика25 000 ₽ — 38 %
Инфраструктура: сервер, векторное хранилище, журналы, резервные копии9 000 ₽ — 14 %
Контроль качества: 8 часов в месяц силами компании6 800 ₽ — 10 %
Ведение базы знаний: 6 часов предметного специалиста5 400 ₽ — 8 %
Резервный контур: второй провайдер модели и дежурный канал3 500 ₽ — 5 %
Итого66 620 ₽ в месяц. Строка, о которой спрашивают все, — четверть суммы
графикtokeny-i-stoimost-zaprosov-k-modeli--02
Месячный счёт 66 620 ₽: модель 25 %, поддержка 38 %, инфраструктура 14 %, остальное — люди

Горизонтальная составная полоса общей длиной 66 620 ₽, разбитая на шесть подписанных сегментов с суммами и долями: «Поддержка подрядчика — 25 000 ₽ (38 %)», «Вызовы модели — 16 920 ₽ (25 %)», «Инфраструктура — 9 000 ₽ (14 %)», «Контроль качества — 6 800 ₽ (10 %)», «Ведение базы — 5 400 ₽ (8 %)», «Резервный контур — 3 500 ₽ (5 %)». Сегмент «Вызовы модели» выделен тоном, к нему ведёт выноска «единственная строка, которую обсуждают на переговорах». Внизу сноска «6 000 обращений в месяц, сентябрь 2026».

Единственная статья, которую обсуждают на переговорах, — вторая по величине, а не первая

Доля модели не постоянна — она зависит от объёма. Постоянная часть счёта в этой смете 49 700 ₽ и одинакова при любом потоке, переменная растёт по 2,82 ₽ за обращение. При 1 000 обращений модель займёт 5 % счёта, при 6 000 — 25 %, при 20 000 — 53 %. Практический вывод простой: на малых объёмах спорить о цене токенов бессмысленно, вы боретесь за проценты бюджета, а деньги лежат в постоянной части. Полную раскладку всех девяти статей мы разбираем в материале про структуру расходов на ИИ-агента.

Ещё одна поправка к слову «четверть». В нашей смете обращение — это диалог из трёх реплик. Если ваш сценарий одношаговый — классифицировать письмо, извлечь поля из документа, написать короткое резюме звонка, — истории нет вовсе, и цена обращения падает примерно до рубля. В разборе четырёх подходов к подключению модели к данным такой одиночный запрос считался по 1,04 ₽. Разница в три раза берётся не из тарифа, а из формы сценария, и это первое, что стоит уточнить, читая чужую смету.

Пять способов снизить счёт, не тронув качество

Все пять работают с одним и тем же: количеством текста, который уезжает в модель, и числом обращений, которые до неё вообще доходят. Ни один из них не ухудшает ответы — при условии, что после каждого изменения проводится замер на контрольных вопросах, а не проверка на глаз.

ПриёмЧто меняетсяЭкономия в месяцСтоимость работы
Сокращение инструкции800 токенов вместо 400: убираются примеры, дубли правил и вежливые формулировки1 440 ₽4–6 часов инженера, около 15 000 ₽
Порог отсечения фрагментовВместо фиксированных пяти — от одного до пяти по релевантности, в среднем 3,23 110 ₽1–2 дня с замером, 25 000–40 000 ₽
Кэш готовых ответов15 % вопросов повторяются дословно и закрываются сохранённым ответом без вызова модели2 538 ₽30 000–50 000 ₽ разово
Правила вместо модели15 % обращений — статус заказа, часы работы, реквизиты: прямой запрос в учётную систему2 538 ₽40 000–80 000 ₽
Младшая модель на простых задачах40 % вопросов типовые: модель классом ниже, тариф 0,05 и 0,15 ₽ за 1 000 токенов5 064 ₽1 неделя с замером, 45 000 ₽

Эти суммы нельзя складывать — приёмы пересекаются: обращение, ушедшее в правила, уже не попадает под скидку от младшей модели. Правильный способ — пересчитать сценарий целиком. Инструкция 400 токенов, в среднем 3,2 фрагмента, 30 % обращений не доходят до модели, из оставшихся 40 % идут на младшую модель. Средний диалог тогда весит 7 608 входных токенов вместо 11 400: на старшей модели это 2,06 ₽, на младшей — 0,52 ₽. Через модель проходит 4 200 обращений: 2 520 × 2,06 + 1 680 × 0,52 = 6 065 ₽.

сравнениеtokeny-i-stoimost-zaprosov-k-modeli--03
Счёт за модель до и после оптимизации: 16 920 ₽ против 6 065 ₽ на том же потоке

Две горизонтальные полосы одинаковой шкалы, ось в рублях от 0 до 18 000. Верхняя «Как настроено по умолчанию» длиной 16 920 ₽, подписи внутри: «6 000 обращений × 2,82 ₽». Нижняя «После пяти приёмов» длиной 6 065 ₽, разбита на два сегмента: «2 520 обращений × 2,06 ₽ = 5 191 ₽» и «1 680 обращений × 0,52 ₽ = 874 ₽»; слева от полосы отдельная выноска «1 800 обращений вообще не дошли до модели». Между полосами фигурная скобка с подписью «разница 10 855 ₽/мес, 130 260 ₽/год».

Поток обращений и качество ответов те же — отличается состав запроса и маршрут обращения

Экономия — 10 855 ₽ в месяц, или 130 260 ₽ в год. Вся работа стоит около 120 000 ₽ и окупается за 11 месяцев. Это честно длинно, и именно поэтому браться за оптимизацию токенов имеет смысл не всегда. Экономия здесь строго пропорциональна объёму: 1,81 ₽ с каждого обращения. При 11 000 обращений в месяц те же 120 000 ₽ возвращаются за полгода, при 20 000 — за 3,3 месяца.

Как читать прайс провайдера

Цена за 1 000 токенов в прайсе — не та цифра, по которой сравнивают предложения. Ниже шесть мест, где счёт расходится с прикидкой; каждое проверяется одним вопросом менеджеру провайдера или подрядчику.

  1. 1Вход и выход тарифицируются по-разному, и выход обычно втрое дороже. Но выхода мало: в нашем расчёте он даёт 0,54 ₽ из 2,82 ₽ — 19 % цены обращения. Ограничивать длину ответа полезно для читаемости, но заметных денег это не приносит.
  2. 2Ступень за длинный контекст. У части провайдеров запрос длиннее порога тарифицируется по повышенной ставке целиком, а не только превышающая часть. Спросите, есть ли ступень и где именно проходит порог, — это критично, если вы кладёте в запрос десять и больше фрагментов.
  3. 3Эмбеддинги — отдельная строка прайса, порядка 0,02 ₽ за 1 000 токенов. Это на порядок дешевле генерации: полный пересчёт базы из 380 документов стоит около 48 ₽. Как устроен сам смысловой поиск и когда базу приходится пересчитывать, разобрано отдельно.
  4. 4Неудачный ответ оплачивается полностью. Честный отказ «в базе этого нет» стоит ровно столько же входных токенов, сколько нормальный ответ, а повторный вызов после ошибки — это ещё один платёж. В журнале должно быть видно, сколько обращений закончились повтором.
  5. 5Лимиты по числу запросов в секунду и в минуту. Их превышение не приводит к доплате — оно приводит к очереди или отказу. Для пользователя это выглядит как «бот завис на десять минут в понедельник утром», и лечится это не деньгами, а согласованием квоты заранее.
  6. 6Токенизатор у каждого провайдера свой, поэтому прикидка «страница равна 1 200 токенам» может разойтись со счётом на 20–30 %. Сверяйте по реальному счёту за первый месяц эксплуатации, а бюджет на первый квартал закладывайте с запасом в треть.

Отдельно про первый месяц. Бюджет на эксплуатацию почти всегда считают по демонстрации, а демонстрация идёт на коротких образцовых диалогах — там средний запрос короче реального в полтора-два раза. Правильный порядок такой: первый месяц работаете с потолком расходов и включённым журналом, на второй неделе смотрите фактическую среднюю длину запроса и только тогда фиксируете бюджет на квартал. Цифра из журнала за две недели надёжнее любой оценки до запуска, и она же становится приёмочным параметром: если после очередной доработки средняя длина выросла, это видно сразу, а не по счёту в конце месяца.

Как счёт вырастает на 72 % без единой строки в акте

Самый частый сценарий выглядит безобидно: на жалобу «иногда не находит» подрядчик увеличивает число фрагментов в запросе с пяти до двенадцати. Ответы действительно становятся чуть полнее, а средняя реплика вырастает с 3 800 до 7 160 токенов. Счёт за модель на том же потоке идёт с 16 920 ₽ до 29 016 ₽ — плюс 72 %, около 145 000 ₽ за год. Правильная реакция на ту же жалобу — замер качества поиска на контрольных вопросах, а не увеличение числа фрагментов вслепую.

Что записать в договор и в требования

Пять пунктов ниже стоят ноль рублей, если записать их до начала работ, и превращаются в спор, если вспомнить о них после первого счёта. Как в целом устроен документ, в который они ложатся, разобрано в материале про техническое задание на автоматизацию.

  1. 1Аккаунт у провайдера модели оформлен на юрлицо заказчика, а не на подрядчика. Подрядчик работает по отдельному ключу с собственным лимитом. Иначе при расставании вы теряете и историю расходов, и возможность просто сменить исполнителя.
  2. 2Месячный потолок расходов с автоматической остановкой и алерт при 70 % бюджета — в нашем примере это 11 800 ₽. Потолок ставится не «на всякий случай», а как единственная защита от цикла повторных вызовов, который способен съесть месячный бюджет за ночь.
  3. 3Средняя длина запроса зафиксирована как приёмочный параметр: не более 4 000 входных токенов на реплику при пяти фрагментах базы. Формулировка «система работает эффективно» не проверяется, а число — проверяется за пять минут по журналу.
  4. 4Кто платит за счёт, выросший из-за дефекта в коде: зацикленный повтор, забытый отладочный режим, отправка всей истории вместо последних реплик. По умолчанию платит заказчик, потому что аккаунт его, — и именно поэтому пункт нужен.
  5. 5Состав журнала: на каждый вызов пишутся число входных и выходных токенов, модель, число переданных фрагментов и признак повтора. Без этих полей разбор счёта превращается в обмен мнениями, а любая оптимизация — в гадание.

Когда экономить на токенах не надо

Оптимизация запросов — инженерная работа, и она стоит денег. Есть несколько ситуаций, в которых её стоимость заведомо не вернётся, и правильное решение — просто поставить потолок расходов и заняться другим.

  • Меньше 11 000 обращений в месяц. При 6 000 полный набор приёмов возвращает 120 000 ₽ за 11 месяцев, при 3 000 — за 22 месяца. До этого порога хватает двух бесплатных действий: ограничить длину ответа и поставить алерт на 70 % бюджета.
  • Пилот и первые три месяца эксплуатации. Пока не устоялся состав базы и формулировка инструкции, любая оптимизация будет переделана. Сначала замер качества, потом стабилизация, и только потом счёт.
  • Одношаговые операции без диалога: классификация письма, извлечение полей, короткое резюме звонка. Истории нет, запрос короткий, экономить можно только на инструкции — это те самые 1 440 ₽ в месяц, ради которых не зовут инженера.
  • Сценарии, где ошибка дороже токенов. Лишний фрагмент в запросе стоит 10 копеек, а разбор одного неверного ответа менеджером — 40 минут по ставке 700 ₽/час, то есть 467 ₽. Здесь считать надо не счёт за модель, а стоимость одного обращения целиком, вместе с работой людей вокруг него.
графикtokeny-i-stoimost-zaprosov-k-modeli--04
Окупаемость оптимизации по объёму: 11 месяцев при 6 000 обращений и 3,3 месяца при 20 000

Двухосевой график. Ось X — обращений в месяц от 0 до 22 000, ось Y — месяцев до окупаемости от 0 до 24. Нисходящая кривая проходит через подписанные точки: 3 000 обращений — 22 месяца, 6 000 — 11 месяцев, 11 000 — 6 месяцев, 20 000 — 3,3 месяца. Горизонтальная штриховая линия на уровне 6 месяцев подписана «разумный горизонт»; точка её пересечения с кривой выделена и подписана «порог 11 000 обращений». Область слева от порога затонирована с подписью «дешевле поставить потолок расходов». Внизу сноска «работа по оптимизации — 120 000 ₽, экономия 1,81 ₽ с обращения».

Экономия пропорциональна потоку, стоимость работы — нет; отсюда порог примерно в 11 000 обращений

Зеркальный признак — когда за токены браться нужно: поток выше 11 000 обращений в месяц, диалог длиннее пяти реплик и в журнале видно, что средний запрос перевалил за 5 000 входных токенов. Если верно всё три, неделя работы инженера окупится до конца квартала. Если верно только первое, начинать стоит с выбора модели — разбор шести критериев есть в статье про выбор языковой модели для бизнеса.