Токен — это кусочек текста, которым модель измеряет всё: и то, что вы ей отправили, и то, что она ответила. На русском языке один токен — примерно 2–3 символа, то есть слово обычно распадается на два-три токена. Провайдер выставляет счёт именно за токены, поэтому термин интересен не сам по себе: это единственное слово из словаря ИИ, которое напрямую превращается в строку ежемесячного платежа.
Главное, что стоит понять до сметы: платите вы не за вопрос клиента. Вопрос — самая маленькая часть запроса. Вместе с ним в модель каждый раз уезжает инструкция, найденные в базе фрагменты и вся накопленная история разговора. Отсюда и берётся эффект, который удивляет владельцев: обращений стало больше на треть, а счёт вырос вдвое.
Дальше — модельные расчёты по состоянию на сентябрь 2026 года при ставках 0,20 ₽ за 1 000 входных токенов и 0,60 ₽ за 1 000 выходных и ставке инженера 3 000 ₽/час. Про то, как из этой строки складывается полная удельная цена одного обращения вместе с постоянными расходами, есть отдельный разбор.
Токен — это не слово: как посчитать в уме
Минимальная единица текста, которой оперирует модель: на русском примерно 2–3 символа. Бизнесу нужен как единица тарификации — весь счёт за языковую модель измеряется в токенах на входе и на выходе. В смете превращается в переменную строку месячных расходов, которая растёт вместе с длиной запросов, а не только с числом обращений. Проверочный вопрос: покажите отчёт по расходу токенов за месяц в разрезе типов обращений.
Практический способ прикинуть объём: число слов умножить на 2,5. Погрешность в пределах десяти процентов, для оценки бюджета этого достаточно. Ниже — готовая шпаргалка на типовые объёмы, чтобы не считать каждый раз.
| Что отправляем | Примерно в токенах | Стоимость на входе |
|---|---|---|
| Одно слово | 2–3 | менее 0,001 ₽ |
| Абзац на 100 слов | 250 | 0,05 ₽ |
| Страница А4 | 1 000–1 500 | 0,20–0,30 ₽ |
| Инструкция агента | 600–1 200 | 0,12–0,24 ₽ |
| Договор на 12 страниц | 12 000–18 000 | 2,40–3,60 ₽ |
| Расшифровка часового разговора | 17 000–21 000 | 3,40–4,20 ₽ |
Отдельно стоит запомнить, что тарифов всегда два. Входные токены — всё, что вы отправили модели; выходные — то, что она написала в ответ. Выход дороже входа обычно втрое: сгенерировать текст тяжелее, чем прочитать. На практике это означает, что просьба «отвечай развёрнуто» — не стилистическое пожелание, а решение о бюджете: ответ на 600 токенов вместо 250 добавляет к счёту столько же, сколько лишние тысяча токенов на входе.
Цифры в правой колонке специально приведены, чтобы снять лишний страх. Разобрать один договор целиком стоит около трёх рублей; вопрос никогда не в цене одного действия, а в том, сколько раз в месяц оно повторяется и сколько лишнего едет вместе с ним.
Из чего состоит один запрос к модели
Возьмём типовой клиентский ассистент с поиском по базе знаний. В каждый запрос уходят четыре части, и только одна из них — собственно вопрос человека.
- Системная инструкция — 700 токенов. Правила поведения, стоп-темы, формат ответа, тон. Отправляется целиком на каждой реплике, даже двадцатой.
- Найденные фрагменты базы — 2 000 токенов. Четыре куска документов, которые поиск счёл подходящими. Как они отбираются, разобрано в материале про поиск по базе знаний.
- Вопрос клиента — 120 токенов. Одна-две фразы. Это 4 % запроса.
- История диалога — от нуля и вверх. Единственная часть, которая растёт: каждая пара «вопрос — ответ» добавляет к ней 370 токенов, и вся накопленная история едет в модель заново при каждой следующей реплике.
Горизонтальная составная полоса, разбитая на четыре сегмента разной длины с подписями внутри: «Инструкция — 700», «Фрагменты базы — 2 000», «Вопрос клиента — 120», «История диалога — от 0 до 1 480». Под полосой шкала итогов с двумя отметками: «реплика 1 — 2 820 токенов» и «реплика 5 — 4 300 токенов». Сегмент «История диалога» выделен тоном и снабжён стрелкой роста вправо. Справа отдельным блоком «Ответ модели — 250 токенов, тариф втрое выше». Тонкие чертёжные линии, подписи по-русски.
Почему счёт растёт быстрее, чем поток обращений
Модель не помнит предыдущие реплики — у неё нет памяти между запросами. Чтобы разговор выглядел связным, историю приходится пересылать заново каждый раз. На первой реплике в модель уходит 2 820 токенов, на пятой — уже 4 300, при том что вопрос клиента такой же короткий.
Из этого следует правило, которое ломает большинство прикидок бюджета: считать надо обращение целиком, а не одну реплику. Диалог из пяти реплик даёт 17 800 входных токенов, а не 2 820 × 5 = 14 100. Разница в 26 % набегает исключительно на пересылке истории. Эту же механику с другой стороны — со стороны ограничения на длину запроса — мы разбираем в статье про контекстное окно модели.
Месячный счёт на 6 000 обращений: 25 860 ₽ или 17 028 ₽
Вводные модельного примера: служба поддержки, 6 000 обращений в месяц, среднее обращение — 5 реплик. Инструкция 700 токенов, фрагменты базы 2 000, вопрос 120, ответ 250. Сравниваем две архитектуры на одном и том же потоке. Первая отправляет всю историю целиком. Вторая держит дословно только последнюю пару реплик, остальное заменяет резюме на 120 токенов, а инструкцию и число фрагментов сокращает вдвое без потери качества на замере.
Арифметику можно повторить на калькуляторе. В первом варианте пять реплик дают 2 820 + 3 190 + 3 560 + 3 930 + 4 300 = 17 800 входных токенов; 6 000 обращений — это 106 800 000 токенов, то есть 106 800 × 0,20 ₽ = 21 360 ₽. Во втором истории после третьей реплики перестаёт расти: 1 720 + 2 090 + 2 210 + 2 210 + 2 210 = 10 440 токенов, что даёт 12 528 ₽. Выходные токены одинаковы в обоих случаях: 5 × 250 × 6 000 = 7 500 000, то есть 4 500 ₽. Настройка окупается за 36 000 ÷ 8 832 ≈ 4,1 месяца, дальше разница — чистая экономия, 105 984 ₽ в год.
Две горизонтальные составные полосы одной шкалы, ось X в рублях от 0 до 30 000. Верхняя подписана «Полная история» длиной 25 860 ₽ и разбита на сегменты «входные токены 21 360 ₽» и «выходные токены 4 500 ₽». Нижняя подписана «Сжатие истории» длиной 17 028 ₽ с сегментами «входные токены 12 528 ₽» и «выходные токены 4 500 ₽». Между полосами фигурная скобка с подписью «разница 8 832 ₽/мес, 105 984 ₽/год». Внизу сноска «6 000 обращений по 5 реплик, сентябрь 2026». Тонкие чертёжные линии, подписи по-русски.
Четыре приёма снижения расхода и три вопроса подрядчику
Ни один из этих приёмов не является изобретением: это стандартная гигиена, которую взрослый подрядчик делает по умолчанию, а дешёвый пропускает — счёт-то платите вы.
- 1Обрезка и сжатие истории. Последние одна-две пары реплик дословно, остальное — короткое резюме. Даёт основную часть экономии: в примере выше 8 832 ₽ в месяц. Важная деталь: резюме тоже собирает модель, поэтому пересобирать его на каждой реплике нельзя — иначе строка расходов на сжатие догонит ту, ради которой всё затевалось.
- 2Кэширование повторяющегося. Инструкция и часто используемые фрагменты одинаковы во всех запросах; часть провайдеров тарифицирует такой повторный ввод дешевле. Если провайдер это умеет, вопрос «включено ли кэширование» стоит задать прямо.
- 3Короткая инструкция. Инструкции разрастаются: каждый разобранный инцидент добавляет абзац, и через полгода на входе лежит 2 000 токенов правил, половина которых противоречит друг другу. Ревизия инструкции раз в квартал — час работы, который окупается сразу.
- 4Маршрутизация мимо модели. Типовые вопросы — «где мой заказ», «как оплатить», «режим работы» — закрываются готовым ответом без обращения к модели. Если так уходит 30 % потока, счёт из примера падает с 17 028 ₽ до 11 920 ₽ в месяц.
И три вопроса, которые стоит задать до подписания. Первый: кто платит за токены — вы напрямую провайдеру или подрядчик со своей наценкой? Второй: как выглядит отчёт по расходу и есть ли в нём разбивка по типам обращений? Третий: что произойдёт со счётом, если поток удвоится, — расход растёт линейно или быстрее? Остальные строки бюджета ИИ-агента, кроме токенов, разобраны в материале про структуру расходов.
Когда токены можно не считать
Расход токенов — единственная строка бюджета, которая масштабируется вместе с бизнесом, и именно поэтому её переоценивают на старте.
- Поток меньше 1 000 обращений в месяц. По арифметике из статьи это около 4 300 ₽, и вся разница между вариантами архитектуры — полторы тысячи рублей. Двенадцать часов работы на оптимизацию здесь не окупятся никогда: считайте разовые расходы, а не переменные.
- Разовая задача. Разобрать архив договоров один раз — это единичный расход, пусть даже сотня тысяч рублей. Оптимизировать нечего, потому что второго раза не будет.
- Своя модель на своём сервере. Там расход измеряется не в рублях за токен, а в загрузке видеокарты, и экономика считается иначе — по цене машины в месяц. Сравнение двух подходов есть в статье про языковую модель для бизнеса.
Причин обычно три, и все проверяются за полчаса по журналу: диалоги стали длиннее и история потяжелела; кто-то увеличил число фрагментов базы в запросе; инструкцию дописали до полутора тысяч токенов. Если журнала с длиной запроса на каждую реплику нет, разобраться невозможно — поэтому такое поле должно быть в требованиях к подрядчику с самого начала.
Вы платите не за вопрос клиента. Вопрос — это 120 токенов из 4 300, остальное едет вместе с ним и оплачивается на каждой реплике заново.
