Счёт за языковую модель считается в токенах, а не в запросах и не в символах. Токен — кусочек текста примерно в 2–3 символа русского языка; провайдер тарифицирует отдельно всё, что вы отправили, и отдельно всё, что модель написала в ответ. Отсюда главное следствие для бюджета: вы платите не за вопрос клиента, а за весь текст, который система собрала и отправила вместе с этим вопросом.
В типовом запросе к ассистенту по базе знаний сам вопрос занимает 150 токенов из 3 800. Остальное — системная инструкция, пять найденных фрагментов документов и история разговора. Именно поэтому прикидка «одно обращение стоит копейки, у нас их немного» промахивается в разы: считать надо не вопрос, а конверт, в котором он уезжает.
Дальше — что такое токен и почему русский текст дороже английского; из чего складывается один запрос и какая часть за что отвечает; сквозной счёт на 6 000 обращений в месяц; пять приёмов, которые снижают строку модели вдвое-втрое; как читать прайс провайдера и что записать в договор, чтобы счёт не удвоился после первого месяца.
Токен — не буква и не слово
Единица, которой модель разбивает текст на части перед обработкой. Для русского языка это в среднем 2–3 символа, для английского — около 4. Страница А4 по-русски весит порядка 1 000–1 500 токенов, та же страница по-английски — 600–800. Тарифицируются отдельно входные токены (всё, что вы отправили) и выходные (то, что модель написала). Ориентир на сентябрь 2026 для расчётов ниже: 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных; подставьте прайс своего провайдера на дату сделки.
Разница между языками — не мелочь, а множитель на всю смету. Модель режет текст на куски по статистике того корпуса, на котором обучался её токенизатор, и кириллица в большинстве универсальных токенизаторов дробится мельче латиницы. Практический результат: один и тот же смысл по-русски обходится примерно в полтора-два раза дороже. У моделей, изначально сделанных под русский язык — GigaChat и YandexGPT, — разрыв заметно меньше, и это отдельный аргумент при выборе провайдера, помимо вопроса о размещении данных.
| Что отправляем | Примерно токенов | Стоимость на входе |
|---|---|---|
| Реплика клиента: «Здравствуйте, подскажите статус заказа» | 12–18 | менее 0,01 ₽ |
| Страница А4 русского текста | 1 000–1 500 | 0,20–0,30 ₽ |
| Та же страница по-английски | 600–800 | 0,12–0,16 ₽ |
| Регламент на 40 страниц целиком | 40 000–60 000 | 8–12 ₽ за один запрос |
| Пять найденных фрагментов базы по 480 токенов | 2 400 | 0,48 ₽ |
Последние две строки таблицы объясняют, почему поиск по документам дешевле «кладём весь регламент в запрос». Отправить сорок страниц целиком стоит 8–12 ₽ за каждый вопрос; отправить пять относящихся к делу фрагментов — 48 копеек. Разница в двадцать раз, и она платится на каждом обращении. Механизм, который позволяет отбирать нужное, разобран в опорной статье раздела про поиск по вашим документам.
Из чего складывается один запрос
Возьмём рабочий пример: внутренний ассистент отвечает сотрудникам по регламентам и условиям договоров, поиск отдаёт пять фрагментов, ответ ограничен по длине. Так выглядит средняя реплика в диалоге.
| Часть запроса | Токенов | Доля входа | Кто на неё влияет |
|---|---|---|---|
| Системная инструкция: правила, формат, стоп-темы | 800 | 21 % | подрядчик, один раз при настройке |
| Пять фрагментов базы по 480 токенов | 2 400 | 63 % | настройка поиска и размер фрагментов |
| История разговора, в среднем две пары реплик | 450 | 12 % | стратегия работы с историей |
| Вопрос человека | 150 | 4 % | никто, это данность |
| Вход всего | 3 800 | 100 % | — |
| Ответ модели (выход) | 300 | тариф втрое выше | ограничение длины ответа |
Один горизонтальный составной столбец общей длиной 3 800 токенов, разбитый на четыре подписанных сегмента с числами и долями: «Фрагменты базы — 2 400 (63 %)», «Системная инструкция — 800 (21 %)», «История разговора — 450 (12 %)», «Вопрос человека — 150 (4 %)». Самый маленький сегмент выделен контуром и отдельной выноской со стрелкой: «то, что спросил человек». Справа от столбца отдельная короткая полоска «Ответ модели — 300 токенов» с подписью «тариф втрое выше». Внизу сноска: «0,20 ₽ за 1 000 входных, 0,60 ₽ за 1 000 выходных, сентябрь 2026».
Считаем цену обращения. Под обращением понимаем диалог из трёх реплик — это средняя длина внутреннего запроса «спросил, уточнил, поблагодарил». Первая реплика: 3 350 входных токенов (истории ещё нет) и 300 выходных, то есть 3 350 × 0,20 / 1 000 + 300 × 0,60 / 1 000 = 0,85 ₽. Вторая: история выросла на пару реплик, 3 800 входных — 0,94 ₽. Третья: 4 250 входных — 1,03 ₽. Обращение целиком — 2,82 ₽, из них 0,54 ₽ приходится на выход, то есть 19 %.
Полезно смотреть на эту таблицу как на список рычагов. Вопрос человека изменить нельзя — это данность. Всё остальное настраивается, и настраивается один раз: длина инструкции, число и размер фрагментов, глубина истории, ограничение длины ответа. Из четырёх строк входа три находятся под управлением подрядчика, и ни одна из них обычно не обсуждается на переговорах — обсуждается цена за 1 000 токенов, на которую вы повлиять как раз не можете.
Инструкция, фрагменты и вопрос от реплики к реплике не меняются — растёт только история, и она уезжает в модель целиком каждый раз заново. На трёх репликах это ещё незаметно, на пятнадцати история становится основной статьёй. Что именно происходит на длинных диалогах и какие стратегии есть при переполнении контекстного окна, мы разбирали отдельно — там же посчитана разница в 27 045 ₽ в месяц между щедрой и аккуратной настройкой.
Счёт за месяц: 16 920 ₽ за модель и 66 620 ₽ за всё
Вводные модельного примера: производственно-торговая компания, 140 человек, внутренний ассистент по регламентам и условиям договоров, поток 6 000 обращений в месяц, база из 380 документов. Цена обращения 2,82 ₽ по расчёту выше. Ставки для внутренних часов: предметный специалист 900 ₽/час, оператор 700 ₽/час.
Горизонтальная составная полоса общей длиной 66 620 ₽, разбитая на шесть подписанных сегментов с суммами и долями: «Поддержка подрядчика — 25 000 ₽ (38 %)», «Вызовы модели — 16 920 ₽ (25 %)», «Инфраструктура — 9 000 ₽ (14 %)», «Контроль качества — 6 800 ₽ (10 %)», «Ведение базы — 5 400 ₽ (8 %)», «Резервный контур — 3 500 ₽ (5 %)». Сегмент «Вызовы модели» выделен тоном, к нему ведёт выноска «единственная строка, которую обсуждают на переговорах». Внизу сноска «6 000 обращений в месяц, сентябрь 2026».
Доля модели не постоянна — она зависит от объёма. Постоянная часть счёта в этой смете 49 700 ₽ и одинакова при любом потоке, переменная растёт по 2,82 ₽ за обращение. При 1 000 обращений модель займёт 5 % счёта, при 6 000 — 25 %, при 20 000 — 53 %. Практический вывод простой: на малых объёмах спорить о цене токенов бессмысленно, вы боретесь за проценты бюджета, а деньги лежат в постоянной части. Полную раскладку всех девяти статей мы разбираем в материале про структуру расходов на ИИ-агента.
Ещё одна поправка к слову «четверть». В нашей смете обращение — это диалог из трёх реплик. Если ваш сценарий одношаговый — классифицировать письмо, извлечь поля из документа, написать короткое резюме звонка, — истории нет вовсе, и цена обращения падает примерно до рубля. В разборе четырёх подходов к подключению модели к данным такой одиночный запрос считался по 1,04 ₽. Разница в три раза берётся не из тарифа, а из формы сценария, и это первое, что стоит уточнить, читая чужую смету.
Пять способов снизить счёт, не тронув качество
Все пять работают с одним и тем же: количеством текста, который уезжает в модель, и числом обращений, которые до неё вообще доходят. Ни один из них не ухудшает ответы — при условии, что после каждого изменения проводится замер на контрольных вопросах, а не проверка на глаз.
| Приём | Что меняется | Экономия в месяц | Стоимость работы |
|---|---|---|---|
| Сокращение инструкции | 800 токенов вместо 400: убираются примеры, дубли правил и вежливые формулировки | 1 440 ₽ | 4–6 часов инженера, около 15 000 ₽ |
| Порог отсечения фрагментов | Вместо фиксированных пяти — от одного до пяти по релевантности, в среднем 3,2 | 3 110 ₽ | 1–2 дня с замером, 25 000–40 000 ₽ |
| Кэш готовых ответов | 15 % вопросов повторяются дословно и закрываются сохранённым ответом без вызова модели | 2 538 ₽ | 30 000–50 000 ₽ разово |
| Правила вместо модели | 15 % обращений — статус заказа, часы работы, реквизиты: прямой запрос в учётную систему | 2 538 ₽ | 40 000–80 000 ₽ |
| Младшая модель на простых задачах | 40 % вопросов типовые: модель классом ниже, тариф 0,05 и 0,15 ₽ за 1 000 токенов | 5 064 ₽ | 1 неделя с замером, 45 000 ₽ |
Эти суммы нельзя складывать — приёмы пересекаются: обращение, ушедшее в правила, уже не попадает под скидку от младшей модели. Правильный способ — пересчитать сценарий целиком. Инструкция 400 токенов, в среднем 3,2 фрагмента, 30 % обращений не доходят до модели, из оставшихся 40 % идут на младшую модель. Средний диалог тогда весит 7 608 входных токенов вместо 11 400: на старшей модели это 2,06 ₽, на младшей — 0,52 ₽. Через модель проходит 4 200 обращений: 2 520 × 2,06 + 1 680 × 0,52 = 6 065 ₽.
Две горизонтальные полосы одинаковой шкалы, ось в рублях от 0 до 18 000. Верхняя «Как настроено по умолчанию» длиной 16 920 ₽, подписи внутри: «6 000 обращений × 2,82 ₽». Нижняя «После пяти приёмов» длиной 6 065 ₽, разбита на два сегмента: «2 520 обращений × 2,06 ₽ = 5 191 ₽» и «1 680 обращений × 0,52 ₽ = 874 ₽»; слева от полосы отдельная выноска «1 800 обращений вообще не дошли до модели». Между полосами фигурная скобка с подписью «разница 10 855 ₽/мес, 130 260 ₽/год».
Экономия — 10 855 ₽ в месяц, или 130 260 ₽ в год. Вся работа стоит около 120 000 ₽ и окупается за 11 месяцев. Это честно длинно, и именно поэтому браться за оптимизацию токенов имеет смысл не всегда. Экономия здесь строго пропорциональна объёму: 1,81 ₽ с каждого обращения. При 11 000 обращений в месяц те же 120 000 ₽ возвращаются за полгода, при 20 000 — за 3,3 месяца.
Как читать прайс провайдера
Цена за 1 000 токенов в прайсе — не та цифра, по которой сравнивают предложения. Ниже шесть мест, где счёт расходится с прикидкой; каждое проверяется одним вопросом менеджеру провайдера или подрядчику.
- 1Вход и выход тарифицируются по-разному, и выход обычно втрое дороже. Но выхода мало: в нашем расчёте он даёт 0,54 ₽ из 2,82 ₽ — 19 % цены обращения. Ограничивать длину ответа полезно для читаемости, но заметных денег это не приносит.
- 2Ступень за длинный контекст. У части провайдеров запрос длиннее порога тарифицируется по повышенной ставке целиком, а не только превышающая часть. Спросите, есть ли ступень и где именно проходит порог, — это критично, если вы кладёте в запрос десять и больше фрагментов.
- 3Эмбеддинги — отдельная строка прайса, порядка 0,02 ₽ за 1 000 токенов. Это на порядок дешевле генерации: полный пересчёт базы из 380 документов стоит около 48 ₽. Как устроен сам смысловой поиск и когда базу приходится пересчитывать, разобрано отдельно.
- 4Неудачный ответ оплачивается полностью. Честный отказ «в базе этого нет» стоит ровно столько же входных токенов, сколько нормальный ответ, а повторный вызов после ошибки — это ещё один платёж. В журнале должно быть видно, сколько обращений закончились повтором.
- 5Лимиты по числу запросов в секунду и в минуту. Их превышение не приводит к доплате — оно приводит к очереди или отказу. Для пользователя это выглядит как «бот завис на десять минут в понедельник утром», и лечится это не деньгами, а согласованием квоты заранее.
- 6Токенизатор у каждого провайдера свой, поэтому прикидка «страница равна 1 200 токенам» может разойтись со счётом на 20–30 %. Сверяйте по реальному счёту за первый месяц эксплуатации, а бюджет на первый квартал закладывайте с запасом в треть.
Отдельно про первый месяц. Бюджет на эксплуатацию почти всегда считают по демонстрации, а демонстрация идёт на коротких образцовых диалогах — там средний запрос короче реального в полтора-два раза. Правильный порядок такой: первый месяц работаете с потолком расходов и включённым журналом, на второй неделе смотрите фактическую среднюю длину запроса и только тогда фиксируете бюджет на квартал. Цифра из журнала за две недели надёжнее любой оценки до запуска, и она же становится приёмочным параметром: если после очередной доработки средняя длина выросла, это видно сразу, а не по счёту в конце месяца.
Самый частый сценарий выглядит безобидно: на жалобу «иногда не находит» подрядчик увеличивает число фрагментов в запросе с пяти до двенадцати. Ответы действительно становятся чуть полнее, а средняя реплика вырастает с 3 800 до 7 160 токенов. Счёт за модель на том же потоке идёт с 16 920 ₽ до 29 016 ₽ — плюс 72 %, около 145 000 ₽ за год. Правильная реакция на ту же жалобу — замер качества поиска на контрольных вопросах, а не увеличение числа фрагментов вслепую.
Что записать в договор и в требования
Пять пунктов ниже стоят ноль рублей, если записать их до начала работ, и превращаются в спор, если вспомнить о них после первого счёта. Как в целом устроен документ, в который они ложатся, разобрано в материале про техническое задание на автоматизацию.
- 1Аккаунт у провайдера модели оформлен на юрлицо заказчика, а не на подрядчика. Подрядчик работает по отдельному ключу с собственным лимитом. Иначе при расставании вы теряете и историю расходов, и возможность просто сменить исполнителя.
- 2Месячный потолок расходов с автоматической остановкой и алерт при 70 % бюджета — в нашем примере это 11 800 ₽. Потолок ставится не «на всякий случай», а как единственная защита от цикла повторных вызовов, который способен съесть месячный бюджет за ночь.
- 3Средняя длина запроса зафиксирована как приёмочный параметр: не более 4 000 входных токенов на реплику при пяти фрагментах базы. Формулировка «система работает эффективно» не проверяется, а число — проверяется за пять минут по журналу.
- 4Кто платит за счёт, выросший из-за дефекта в коде: зацикленный повтор, забытый отладочный режим, отправка всей истории вместо последних реплик. По умолчанию платит заказчик, потому что аккаунт его, — и именно поэтому пункт нужен.
- 5Состав журнала: на каждый вызов пишутся число входных и выходных токенов, модель, число переданных фрагментов и признак повтора. Без этих полей разбор счёта превращается в обмен мнениями, а любая оптимизация — в гадание.
Когда экономить на токенах не надо
Оптимизация запросов — инженерная работа, и она стоит денег. Есть несколько ситуаций, в которых её стоимость заведомо не вернётся, и правильное решение — просто поставить потолок расходов и заняться другим.
- Меньше 11 000 обращений в месяц. При 6 000 полный набор приёмов возвращает 120 000 ₽ за 11 месяцев, при 3 000 — за 22 месяца. До этого порога хватает двух бесплатных действий: ограничить длину ответа и поставить алерт на 70 % бюджета.
- Пилот и первые три месяца эксплуатации. Пока не устоялся состав базы и формулировка инструкции, любая оптимизация будет переделана. Сначала замер качества, потом стабилизация, и только потом счёт.
- Одношаговые операции без диалога: классификация письма, извлечение полей, короткое резюме звонка. Истории нет, запрос короткий, экономить можно только на инструкции — это те самые 1 440 ₽ в месяц, ради которых не зовут инженера.
- Сценарии, где ошибка дороже токенов. Лишний фрагмент в запросе стоит 10 копеек, а разбор одного неверного ответа менеджером — 40 минут по ставке 700 ₽/час, то есть 467 ₽. Здесь считать надо не счёт за модель, а стоимость одного обращения целиком, вместе с работой людей вокруг него.
Двухосевой график. Ось X — обращений в месяц от 0 до 22 000, ось Y — месяцев до окупаемости от 0 до 24. Нисходящая кривая проходит через подписанные точки: 3 000 обращений — 22 месяца, 6 000 — 11 месяцев, 11 000 — 6 месяцев, 20 000 — 3,3 месяца. Горизонтальная штриховая линия на уровне 6 месяцев подписана «разумный горизонт»; точка её пересечения с кривой выделена и подписана «порог 11 000 обращений». Область слева от порога затонирована с подписью «дешевле поставить потолок расходов». Внизу сноска «работа по оптимизации — 120 000 ₽, экономия 1,81 ₽ с обращения».
Зеркальный признак — когда за токены браться нужно: поток выше 11 000 обращений в месяц, диалог длиннее пяти реплик и в журнале видно, что средний запрос перевалил за 5 000 входных токенов. Если верно всё три, неделя работы инженера окупится до конца квартала. Если верно только первое, начинать стоит с выбора модели — разбор шести критериев есть в статье про выбор языковой модели для бизнеса.
