Переход на модель, которая стоит вдвое дешевле, снижает месячный счёт за ИИ-агента примерно на 12 %, а бюджет первого года вместе с внедрением — на 8 %. На модельной смете это 8 000 ₽ в месяц из 65 700 ₽. Ни одно решение — запускать проект или нет, брать подрядчика или коробку, автоматизировать поддержку или закупки — на такой разнице не меняется.
Разговор о цене ИИ сводится к токенам, потому что это единственная цифра, которую легко найти и легко сравнить. В разборе структуры расходов мы показали, что вызовы модели — около четверти месячного счёта, а три четверти составляют инфраструктура, сопровождение, контроль качества и ведение базы знаний. Экономия на модели — это торг за четверть суммы, причём такой, который почти всегда добавляет расходов в остальные три четверти.
Дальше — расчёт на конкретных вводных, перечень мест, где экономия действительно есть, и честный ответ на вопрос, когда дешёвая модель всё-таки правильный выбор.
Что даёт двукратное снижение цены токена
Вводные модельного примера: агент первой линии в поддержке, 5 000 обращений в месяц, внедрение 460 000 ₽, месячный счёт 65 700 ₽. На одно обращение приходится три-четыре вызова модели и около 10 тысяч токенов, что при цене 0,32 ₽ за 1 000 токенов даёт 3,2 ₽ на обращение и 16 000 ₽ в месяц. Цена взята по состоянию на сентябрь 2026 года как середина вилки, в которую укладываются российские облачные модели среднего размера.
Восемь процентов — это не ноль, и если модель при этом отвечает так же, отказываться от такой экономии незачем. Проблема в том, что вдвое более дешёвая модель обычно и есть более слабая модель, и вторая половина расчёта живёт не в счёте провайдера, а в часах людей.
Горизонтальная составная полоса общей длиной 65 700 ₽, разбитая на шесть сегментов с подписями и суммами: вызовы модели 16 000 ₽, инфраструктура 9 000 ₽, сопровождение 25 000 ₽, контроль качества 6 800 ₽, ведение базы знаний 5 400 ₽, резервный контур 3 500 ₽. Сегмент вызовов модели разделён надвое штриховой линией: левая половина 8 000 ₽ подписана «остаётся», правая 8 000 ₽ заштрихована и подписана «вся экономия от вдвое более дешёвой модели». Под полосой подпись: «−12,2 % месячного счёта».
Чем оборачивается более слабая модель
Слабая модель не отвечает хуже во всех случаях — она чаще ошибается в краевых. Практически это выражается в трёх вещах, и все три стоят денег.
Девять процентных пунктов роста эскалаций — модельное допущение, а не закон природы. На однородном простом потоке прирост может быть нулевым, и тогда переход выгоден. Но проверить это можно только прогоном на регресс-наборе из реальных обращений, а не по описанию модели. Без такого прогона переход — ставка, где выигрыш ограничен 8 000 ₽ в месяц, а проигрыш ничем не ограничен.
Максимум, что можно выиграть на строке модели, — половина от 24 % счёта. Минимум, что можно проиграть, — доля автоматических ответов, а вместе с ней весь смысл проекта. Разумная последовательность обратная: сначала выбирают модель, которая уверенно держит нужное качество, и только потом смотрят, где в этой конфигурации можно сократить объём работы.
Где экономия действительно есть
Реальная экономия достигается не ценой за тысячу токенов, а тем, что модель делает меньше работы. Разложим 3,2 ₽ на обращение по вызовам: классификация темы — 0,4 ₽, переформулировка запроса и поиск — 0,5 ₽, генерация ответа — 1,9 ₽, проверка ответа второй моделью — 0,4 ₽.
| Мера | Что делает | Экономия при 5 000 обращений |
|---|---|---|
| Каскад моделей | Классификацию и проверку выполняет маленькая модель, генерацию — сильная: 0,8 ₽ вместо 0,25 ₽ на двух вызовах | 2 750 ₽/мес |
| Кэш повторяющихся ответов | 22 % обращений — один и тот же вопрос с одним ответом; генерация не запускается вовсе | 2 530 ₽/мес |
| Сокращение контекста на треть | В запрос уходит три релевантных фрагмента вместо девяти: минус 1,05 ₽ на обращение | 5 250 ₽/мес |
| Отказ от проверки второй моделью на простых темах | 55 % потока — типовые вопросы с низкой ценой ошибки, вторая проверка им не нужна | 1 100 ₽/мес |
| Арифметическая сумма | — | 11 630 ₽/мес |
| Реалистичный совокупный результат | Меры пересекаются: кэш и сокращение контекста экономят на одном и том же вызове | около 7 500 ₽/мес |
Это правило шире одной статьи и нарушается чаще любого другого. Кэш убирает генерацию целиком — значит, на закэшированных обращениях сокращение контекста уже ничего не экономит. Каскад и отказ от второй проверки касаются одного и того же вызова. Совокупный эффект набора мер всегда меньше суммы эффектов, и разница здесь — 4 130 ₽ в месяц, то есть больше трети.
Семь с половиной тысяч рублей — это 47 % строки модели и 11,4 % месячного счёта. Заметно больше, чем даёт переход на дешёвую модель, и, в отличие от него, не ухудшает ответы. Стоит эта работа примерно 20–30 часов инженера, то есть 60 000–90 000 ₽ разово: окупается за 8–12 месяцев при пяти тысячах обращений и за 2–3 месяца при двадцати тысячах. На больших объёмах такой оптимизацией имеет смысл заниматься всерьёз, на малых — нет.
Сравнительная диаграмма из двух групп столбцов. Левая группа «Дешёвая модель»: столбец вверх 8 000 ₽ с подписью «экономия на вызовах» и столбец вниз 37 400 ₽, разделённый на три сегмента с подписями «эскалации 26 300 ₽», «контроль качества 5 100 ₽», «правка промптов 6 000 ₽». Под группой итог «−29 400 ₽/мес». Правая группа «Оптимизация объёма работы»: один столбец вверх 7 500 ₽ с подписью «без ухудшения ответов». Общая ось в рублях в месяц, нулевая линия проведена через всю диаграмму.
Самый большой рычаг лежит не в модели
Часть обращений порождает сам процесс: клиент пишет, потому что не понимает статус заказа, не получил уведомление или не нашёл условия возврата на сайте. В типовом потоке поддержки это 10–20 % — возьмём 15 %. Такие обращения не надо обрабатывать дешевле, их надо не создавать.
Важная оговорка, без которой расчёт станет очередным завышенным обещанием: постоянная часть расходов при снятии обращений никуда не девается. Сопровождение, инфраструктура и ведение базы знаний стоят столько же — уходит только переменная часть и труд людей. Именно поэтому 18 600 ₽ здесь, а не 750 × 38,6 ₽ полной удельной стоимости, как получилось бы при наивном счёте. Методику разделения на переменную и постоянную часть мы разбирали в статье про стоимость одного обращения.
Чертёжная схема потока. Слева блок «5 000 обращений в месяц», из него две стрелки. Верхняя, широкая, ведёт в блок «4 250 обращений — работа для агента» с подписью «здесь спорят про цену токенов, 8 000 ₽ выигрыша». Нижняя, узкая, ведёт в блок «750 обращений — порождает сам процесс», под ним три подписанных причины: «статус заказа непонятен», «уведомление не пришло», «условий возврата нет на сайте». От нижнего блока стрелка вправо в блок «уведомление, поле в личном кабинете, абзац на сайте» и итоговая подпись «18 600 ₽/мес». Никаких логотипов и роботов.
Найти такие обращения несложно: их видно в разбивке по темам за любой месяц. Обычно это три-четыре темы, дающие вместе шестую часть потока, и лечатся они уведомлением, полем в личном кабинете или абзацем на сайте. Разложить поток по темам помогает классификация обращений — тот же инструмент, что и для агента, только применённый до него.
Как проверить экономию честно
Единственный корректный способ сравнить два варианта — полная удельная стоимость обращения, а не строка счёта провайдера. Порядок проверки занимает один вечер.
- 1Соберите регресс-набор из 200 реальных обращений с эталонными ответами. Без него дальнейшие шаги бессмысленны — сравнивать будет не с чем.
- 2Прогоните оба варианта и запишите две цифры для каждого: долю ответов, принятых без правки, и долю эскалаций.
- 3Переведите разницу в эскалациях в часы и рубли по полной стоимости часа сотрудника — 700 ₽ в наших расчётах.
- 4Прибавьте изменение часов контроля качества: более слабой модели нужна большая выборка, и это тоже деньги.
- 5Сложите переменную часть, постоянную часть и труд людей, разделите на объём и сравнивайте только эти две итоговые цифры. Если полная удельная стоимость выросла, экономии нет, какой бы ни была строка счёта провайдера.
Формула пересчёта на свои условия простая: расход на модель в месяц равен числу обращений, умноженному на среднее число тысяч токенов на обращение и на цену за 1 000 токенов. В нашем примере это 5 000 × 10 × 0,32 = 16 000 ₽. Подставьте свои три числа — и получите ту самую строку, из-за которой обычно спорят. Дальше сравните её с остальным счётом: если она меньше трети, спор не о том.
Когда дешёвая модель — правильный выбор, а когда экономить не надо вовсе
Есть четыре ситуации, где переход на более дешёвую модель оправдан и почти ничем не грозит.
- Задача — классификация, а не генерация. Определить тему обращения, отнести документ к типу, выделить поле из накладной. Здесь разница между сильной и слабой моделью измеряется долями процента, а объём вызовов большой.
- Поток однороден и цена ошибки низкая. Ответы на десяток типовых вопросов по фиксированным условиям, где худший исход — клиент переспросит.
- Человек всё равно проверяет каждый ответ. Если агент готовит черновик оператору, а не отвечает клиенту сам, слабая модель добавит оператору несколько секунд правки — и это дешевле разницы в цене вызовов.
- Объём выше 20 000 обращений в месяц. Там строка модели доходит до 47 % счёта, и половина от неё — уже настоящие деньги, ради которых стоит потратить неделю инженера на прогон и сравнение.
И зеркальный список — когда экономить на модели не надо даже пробовать. Если объём меньше 3 000 обращений в месяц, вся строка модели составляет 9 600 ₽, и половина от неё не покроет даже стоимости прогона сравнения. Если агент отвечает клиенту напрямую и цена неверного ответа — потерянная сделка или спор о деньгах, разница в качестве стоит несопоставимо больше разницы в цене. Если проект ещё не вышел на режим и промпты меняются каждую неделю, менять под ними ещё и модель — значит потерять единственную стабильную точку сравнения.
Общий вывод короткий. Цена токенов — это ставка, по которой считают четверть счёта, и её колебания на десятки процентов двигают итог на единицы. Решают три другие вещи: правильно ли выбран процесс, есть ли объём и кто ведёт базу знаний. Про объём мы писали в разборе порога окупаемости, и там разница между «окупается» и «нет» измеряется не процентами, а разами.
