Токен — это кусочек текста, которым модель измеряет всё: и то, что вы ей отправили, и то, что она ответила. На русском языке один токен — примерно 2–3 символа, то есть слово обычно распадается на два-три токена. Провайдер выставляет счёт именно за токены, поэтому термин интересен не сам по себе: это единственное слово из словаря ИИ, которое напрямую превращается в строку ежемесячного платежа.

Главное, что стоит понять до сметы: платите вы не за вопрос клиента. Вопрос — самая маленькая часть запроса. Вместе с ним в модель каждый раз уезжает инструкция, найденные в базе фрагменты и вся накопленная история разговора. Отсюда и берётся эффект, который удивляет владельцев: обращений стало больше на треть, а счёт вырос вдвое.

Дальше — модельные расчёты по состоянию на сентябрь 2026 года при ставках 0,20 ₽ за 1 000 входных токенов и 0,60 ₽ за 1 000 выходных и ставке инженера 3 000 ₽/час. Про то, как из этой строки складывается полная удельная цена одного обращения вместе с постоянными расходами, есть отдельный разбор.

Токен — это не слово: как посчитать в уме

Что это значитТокен

Минимальная единица текста, которой оперирует модель: на русском примерно 2–3 символа. Бизнесу нужен как единица тарификации — весь счёт за языковую модель измеряется в токенах на входе и на выходе. В смете превращается в переменную строку месячных расходов, которая растёт вместе с длиной запросов, а не только с числом обращений. Проверочный вопрос: покажите отчёт по расходу токенов за месяц в разрезе типов обращений.

Практический способ прикинуть объём: число слов умножить на 2,5. Погрешность в пределах десяти процентов, для оценки бюджета этого достаточно. Ниже — готовая шпаргалка на типовые объёмы, чтобы не считать каждый раз.

Что отправляемПримерно в токенахСтоимость на входе
Одно слово2–3менее 0,001 ₽
Абзац на 100 слов2500,05 ₽
Страница А41 000–1 5000,20–0,30 ₽
Инструкция агента600–1 2000,12–0,24 ₽
Договор на 12 страниц12 000–18 0002,40–3,60 ₽
Расшифровка часового разговора17 000–21 0003,40–4,20 ₽

Отдельно стоит запомнить, что тарифов всегда два. Входные токены — всё, что вы отправили модели; выходные — то, что она написала в ответ. Выход дороже входа обычно втрое: сгенерировать текст тяжелее, чем прочитать. На практике это означает, что просьба «отвечай развёрнуто» — не стилистическое пожелание, а решение о бюджете: ответ на 600 токенов вместо 250 добавляет к счёту столько же, сколько лишние тысяча токенов на входе.

Цифры в правой колонке специально приведены, чтобы снять лишний страх. Разобрать один договор целиком стоит около трёх рублей; вопрос никогда не в цене одного действия, а в том, сколько раз в месяц оно повторяется и сколько лишнего едет вместе с ним.

Из чего состоит один запрос к модели

Возьмём типовой клиентский ассистент с поиском по базе знаний. В каждый запрос уходят четыре части, и только одна из них — собственно вопрос человека.

  • Системная инструкция — 700 токенов. Правила поведения, стоп-темы, формат ответа, тон. Отправляется целиком на каждой реплике, даже двадцатой.
  • Найденные фрагменты базы — 2 000 токенов. Четыре куска документов, которые поиск счёл подходящими. Как они отбираются, разобрано в материале про поиск по базе знаний.
  • Вопрос клиента — 120 токенов. Одна-две фразы. Это 4 % запроса.
  • История диалога — от нуля и вверх. Единственная часть, которая растёт: каждая пара «вопрос — ответ» добавляет к ней 370 токенов, и вся накопленная история едет в модель заново при каждой следующей реплике.
схема процессаchto-takoe-token-v-neyroseti--01
Состав запроса к модели: инструкция 700, фрагменты базы 2000, вопрос 120 и растущая история

Горизонтальная составная полоса, разбитая на четыре сегмента разной длины с подписями внутри: «Инструкция — 700», «Фрагменты базы — 2 000», «Вопрос клиента — 120», «История диалога — от 0 до 1 480». Под полосой шкала итогов с двумя отметками: «реплика 1 — 2 820 токенов» и «реплика 5 — 4 300 токенов». Сегмент «История диалога» выделен тоном и снабжён стрелкой роста вправо. Справа отдельным блоком «Ответ модели — 250 токенов, тариф втрое выше». Тонкие чертёжные линии, подписи по-русски.

Вопрос клиента — 120 токенов из 2 820 на первой реплике и из 4 300 на пятой

Почему счёт растёт быстрее, чем поток обращений

Модель не помнит предыдущие реплики — у неё нет памяти между запросами. Чтобы разговор выглядел связным, историю приходится пересылать заново каждый раз. На первой реплике в модель уходит 2 820 токенов, на пятой — уже 4 300, при том что вопрос клиента такой же короткий.

Из этого следует правило, которое ломает большинство прикидок бюджета: считать надо обращение целиком, а не одну реплику. Диалог из пяти реплик даёт 17 800 входных токенов, а не 2 820 × 5 = 14 100. Разница в 26 % набегает исключительно на пересылке истории. Эту же механику с другой стороны — со стороны ограничения на длину запроса — мы разбираем в статье про контекстное окно модели.

Месячный счёт на 6 000 обращений: 25 860 ₽ или 17 028 ₽

Вводные модельного примера: служба поддержки, 6 000 обращений в месяц, среднее обращение — 5 реплик. Инструкция 700 токенов, фрагменты базы 2 000, вопрос 120, ответ 250. Сравниваем две архитектуры на одном и том же потоке. Первая отправляет всю историю целиком. Вторая держит дословно только последнюю пару реплик, остальное заменяет резюме на 120 токенов, а инструкцию и число фрагментов сокращает вдвое без потери качества на замере.

Счёт за месяц при 6 000 обращений по 5 реплик
Вариант с полной историей: входные токены, 17 800 на обращение21 360 ₽/мес
Вариант с полной историей: выходные токены, 1 250 на обращение4 500 ₽/мес
Вариант со сжатием: входные токены, 10 440 на обращение12 528 ₽/мес
Вариант со сжатием: выходные токены, те же 1 250 на обращение4 500 ₽/мес
Настройка второго варианта: 12 часов × 3 000 ₽36 000 ₽ разово
Итого25 860 ₽/мес против 17 028 ₽/мес — разница 8 832 ₽/мес

Арифметику можно повторить на калькуляторе. В первом варианте пять реплик дают 2 820 + 3 190 + 3 560 + 3 930 + 4 300 = 17 800 входных токенов; 6 000 обращений — это 106 800 000 токенов, то есть 106 800 × 0,20 ₽ = 21 360 ₽. Во втором истории после третьей реплики перестаёт расти: 1 720 + 2 090 + 2 210 + 2 210 + 2 210 = 10 440 токенов, что даёт 12 528 ₽. Выходные токены одинаковы в обоих случаях: 5 × 250 × 6 000 = 7 500 000, то есть 4 500 ₽. Настройка окупается за 36 000 ÷ 8 832 ≈ 4,1 месяца, дальше разница — чистая экономия, 105 984 ₽ в год.

графикchto-takoe-token-v-neyroseti--02
Два месячных счёта на одном потоке: 25 860 рублей с полной историей и 17 028 со сжатием

Две горизонтальные составные полосы одной шкалы, ось X в рублях от 0 до 30 000. Верхняя подписана «Полная история» длиной 25 860 ₽ и разбита на сегменты «входные токены 21 360 ₽» и «выходные токены 4 500 ₽». Нижняя подписана «Сжатие истории» длиной 17 028 ₽ с сегментами «входные токены 12 528 ₽» и «выходные токены 4 500 ₽». Между полосами фигурная скобка с подписью «разница 8 832 ₽/мес, 105 984 ₽/год». Внизу сноска «6 000 обращений по 5 реплик, сентябрь 2026». Тонкие чертёжные линии, подписи по-русски.

Поток обращений одинаковый — отличается только то, что едет в модель вместе с вопросом

Четыре приёма снижения расхода и три вопроса подрядчику

Ни один из этих приёмов не является изобретением: это стандартная гигиена, которую взрослый подрядчик делает по умолчанию, а дешёвый пропускает — счёт-то платите вы.

  1. 1Обрезка и сжатие истории. Последние одна-две пары реплик дословно, остальное — короткое резюме. Даёт основную часть экономии: в примере выше 8 832 ₽ в месяц. Важная деталь: резюме тоже собирает модель, поэтому пересобирать его на каждой реплике нельзя — иначе строка расходов на сжатие догонит ту, ради которой всё затевалось.
  2. 2Кэширование повторяющегося. Инструкция и часто используемые фрагменты одинаковы во всех запросах; часть провайдеров тарифицирует такой повторный ввод дешевле. Если провайдер это умеет, вопрос «включено ли кэширование» стоит задать прямо.
  3. 3Короткая инструкция. Инструкции разрастаются: каждый разобранный инцидент добавляет абзац, и через полгода на входе лежит 2 000 токенов правил, половина которых противоречит друг другу. Ревизия инструкции раз в квартал — час работы, который окупается сразу.
  4. 4Маршрутизация мимо модели. Типовые вопросы — «где мой заказ», «как оплатить», «режим работы» — закрываются готовым ответом без обращения к модели. Если так уходит 30 % потока, счёт из примера падает с 17 028 ₽ до 11 920 ₽ в месяц.

И три вопроса, которые стоит задать до подписания. Первый: кто платит за токены — вы напрямую провайдеру или подрядчик со своей наценкой? Второй: как выглядит отчёт по расходу и есть ли в нём разбивка по типам обращений? Третий: что произойдёт со счётом, если поток удвоится, — расход растёт линейно или быстрее? Остальные строки бюджета ИИ-агента, кроме токенов, разобраны в материале про структуру расходов.

Когда токены можно не считать

Расход токенов — единственная строка бюджета, которая масштабируется вместе с бизнесом, и именно поэтому её переоценивают на старте.

  • Поток меньше 1 000 обращений в месяц. По арифметике из статьи это около 4 300 ₽, и вся разница между вариантами архитектуры — полторы тысячи рублей. Двенадцать часов работы на оптимизацию здесь не окупятся никогда: считайте разовые расходы, а не переменные.
  • Разовая задача. Разобрать архив договоров один раз — это единичный расход, пусть даже сотня тысяч рублей. Оптимизировать нечего, потому что второго раза не будет.
  • Своя модель на своём сервере. Там расход измеряется не в рублях за токен, а в загрузке видеокарты, и экономика считается иначе — по цене машины в месяц. Сравнение двух подходов есть в статье про языковую модель для бизнеса.
Что делать, если счёт вырос вдвое без роста нагрузки

Причин обычно три, и все проверяются за полчаса по журналу: диалоги стали длиннее и история потяжелела; кто-то увеличил число фрагментов базы в запросе; инструкцию дописали до полутора тысяч токенов. Если журнала с длиной запроса на каждую реплику нет, разобраться невозможно — поэтому такое поле должно быть в требованиях к подрядчику с самого начала.

Вы платите не за вопрос клиента. Вопрос — это 120 токенов из 4 300, остальное едет вместе с ним и оплачивается на каждой реплике заново.