Переход на модель, которая стоит вдвое дешевле, снижает месячный счёт за ИИ-агента примерно на 12 %, а бюджет первого года вместе с внедрением — на 8 %. На модельной смете это 8 000 ₽ в месяц из 65 700 ₽. Ни одно решение — запускать проект или нет, брать подрядчика или коробку, автоматизировать поддержку или закупки — на такой разнице не меняется.

Разговор о цене ИИ сводится к токенам, потому что это единственная цифра, которую легко найти и легко сравнить. В разборе структуры расходов мы показали, что вызовы модели — около четверти месячного счёта, а три четверти составляют инфраструктура, сопровождение, контроль качества и ведение базы знаний. Экономия на модели — это торг за четверть суммы, причём такой, который почти всегда добавляет расходов в остальные три четверти.

Дальше — расчёт на конкретных вводных, перечень мест, где экономия действительно есть, и честный ответ на вопрос, когда дешёвая модель всё-таки правильный выбор.

Что даёт двукратное снижение цены токена

Вводные модельного примера: агент первой линии в поддержке, 5 000 обращений в месяц, внедрение 460 000 ₽, месячный счёт 65 700 ₽. На одно обращение приходится три-четыре вызова модели и около 10 тысяч токенов, что при цене 0,32 ₽ за 1 000 токенов даёт 3,2 ₽ на обращение и 16 000 ₽ в месяц. Цена взята по состоянию на сентябрь 2026 года как середина вилки, в которую укладываются российские облачные модели среднего размера.

Переход на модель вдвое дешевле: 0,32 → 0,16 ₽ за 1 000 токенов
Было: 5 000 обращений × 10 тыс. токенов × 0,32 ₽16 000 ₽/мес
Стало: те же 5 000 × 10 тыс. × 0,16 ₽8 000 ₽/мес
Месячный счёт: 65 700 → 57 700−8 000 ₽, то есть −12,2 %
Бюджет первого года: 460 000 + 65 700 × 121 248 400 ₽
Он же с дешёвой моделью: 460 000 + 57 700 × 121 152 400 ₽
Разница за первый год−96 000 ₽, то есть −7,7 %
ИтогоВдвое дешевле модель — на 8 % дешевле первый год владения

Восемь процентов — это не ноль, и если модель при этом отвечает так же, отказываться от такой экономии незачем. Проблема в том, что вдвое более дешёвая модель обычно и есть более слабая модель, и вторая половина расчёта живёт не в счёте провайдера, а в часах людей.

графикekonomiya-na-vybore-modeli-bessmyslenna--01
Структура месячного счёта 65 700 ₽ с долей вызовов модели 16 000 ₽ и отрезанной половиной 8 000 ₽

Горизонтальная составная полоса общей длиной 65 700 ₽, разбитая на шесть сегментов с подписями и суммами: вызовы модели 16 000 ₽, инфраструктура 9 000 ₽, сопровождение 25 000 ₽, контроль качества 6 800 ₽, ведение базы знаний 5 400 ₽, резервный контур 3 500 ₽. Сегмент вызовов модели разделён надвое штриховой линией: левая половина 8 000 ₽ подписана «остаётся», правая 8 000 ₽ заштрихована и подписана «вся экономия от вдвое более дешёвой модели». Под полосой подпись: «−12,2 % месячного счёта».

Спор идёт за четверть счёта, а выигрыш в нём — за восьмую часть

Чем оборачивается более слабая модель

Слабая модель не отвечает хуже во всех случаях — она чаще ошибается в краевых. Практически это выражается в трёх вещах, и все три стоят денег.

Обратная сторона той же экономии, в месяц
Экономия на вызовах модели+8 000 ₽
Доля эскалаций: 37 % → 46 %, это +450 обращений
Их обработка: 450 × 5 минут = 37,5 часа × 700 ₽−26 300 ₽
Выборка контроля качества: с 8 до 14 часов, +6 часов−5 100 ₽
Постоянная правка промптов: 2 часа инженера × 3 000 ₽−6 000 ₽
Разовая перенастройка при переходе: 6 часов инженера−18 000 ₽ единовременно
ИтогоМинус 29 400 ₽ в месяц и 18 000 ₽ разово. Экономия обошлась в 370 800 ₽ за год

Девять процентных пунктов роста эскалаций — модельное допущение, а не закон природы. На однородном простом потоке прирост может быть нулевым, и тогда переход выгоден. Но проверить это можно только прогоном на регресс-наборе из реальных обращений, а не по описанию модели. Без такого прогона переход — ставка, где выигрыш ограничен 8 000 ₽ в месяц, а проигрыш ничем не ограничен.

Асимметрия, из-за которой торг за модель не стоит усилий

Максимум, что можно выиграть на строке модели, — половина от 24 % счёта. Минимум, что можно проиграть, — доля автоматических ответов, а вместе с ней весь смысл проекта. Разумная последовательность обратная: сначала выбирают модель, которая уверенно держит нужное качество, и только потом смотрят, где в этой конфигурации можно сократить объём работы.

Где экономия действительно есть

Реальная экономия достигается не ценой за тысячу токенов, а тем, что модель делает меньше работы. Разложим 3,2 ₽ на обращение по вызовам: классификация темы — 0,4 ₽, переформулировка запроса и поиск — 0,5 ₽, генерация ответа — 1,9 ₽, проверка ответа второй моделью — 0,4 ₽.

МераЧто делаетЭкономия при 5 000 обращений
Каскад моделейКлассификацию и проверку выполняет маленькая модель, генерацию — сильная: 0,8 ₽ вместо 0,25 ₽ на двух вызовах2 750 ₽/мес
Кэш повторяющихся ответов22 % обращений — один и тот же вопрос с одним ответом; генерация не запускается вовсе2 530 ₽/мес
Сокращение контекста на третьВ запрос уходит три релевантных фрагмента вместо девяти: минус 1,05 ₽ на обращение5 250 ₽/мес
Отказ от проверки второй моделью на простых темах55 % потока — типовые вопросы с низкой ценой ошибки, вторая проверка им не нужна1 100 ₽/мес
Арифметическая сумма11 630 ₽/мес
Реалистичный совокупный результатМеры пересекаются: кэш и сокращение контекста экономят на одном и том же вызовеоколо 7 500 ₽/мес
Складывать экономию четырёх мер нельзя

Это правило шире одной статьи и нарушается чаще любого другого. Кэш убирает генерацию целиком — значит, на закэшированных обращениях сокращение контекста уже ничего не экономит. Каскад и отказ от второй проверки касаются одного и того же вызова. Совокупный эффект набора мер всегда меньше суммы эффектов, и разница здесь — 4 130 ₽ в месяц, то есть больше трети.

Семь с половиной тысяч рублей — это 47 % строки модели и 11,4 % месячного счёта. Заметно больше, чем даёт переход на дешёвую модель, и, в отличие от него, не ухудшает ответы. Стоит эта работа примерно 20–30 часов инженера, то есть 60 000–90 000 ₽ разово: окупается за 8–12 месяцев при пяти тысячах обращений и за 2–3 месяца при двадцати тысячах. На больших объёмах такой оптимизацией имеет смысл заниматься всерьёз, на малых — нет.

сравнениеekonomiya-na-vybore-modeli-bessmyslenna--02
Столбцы: экономия 8 000 ₽ против расходов 37 400 ₽ и против оптимизации 7 500 ₽ без потери качества

Сравнительная диаграмма из двух групп столбцов. Левая группа «Дешёвая модель»: столбец вверх 8 000 ₽ с подписью «экономия на вызовах» и столбец вниз 37 400 ₽, разделённый на три сегмента с подписями «эскалации 26 300 ₽», «контроль качества 5 100 ₽», «правка промптов 6 000 ₽». Под группой итог «−29 400 ₽/мес». Правая группа «Оптимизация объёма работы»: один столбец вверх 7 500 ₽ с подписью «без ухудшения ответов». Общая ось в рублях в месяц, нулевая линия проведена через всю диаграмму.

Слева — экономия и её цена, справа — то же в деньгах, но без ухудшения ответов

Самый большой рычаг лежит не в модели

Часть обращений порождает сам процесс: клиент пишет, потому что не понимает статус заказа, не получил уведомление или не нашёл условия возврата на сайте. В типовом потоке поддержки это 10–20 % — возьмём 15 %. Такие обращения не надо обрабатывать дешевле, их надо не создавать.

Снятие 15 % обращений вместо удешевления модели
15 % от 5 000 обращений750 обращений в месяц
Переменная часть на обращение3,2 ₽
Труд людей на эскалациях, в среднем на обращение потока21,6 ₽
Экономия: 750 × (3,2 + 21,6)18 600 ₽/мес
То же от вдвое более дешёвой модели8 000 ₽/мес
Итого18 600 ₽ против 8 000 ₽ — в 2,3 раза больше, и часть работы уходит у людей, а не только у провайдера

Важная оговорка, без которой расчёт станет очередным завышенным обещанием: постоянная часть расходов при снятии обращений никуда не девается. Сопровождение, инфраструктура и ведение базы знаний стоят столько же — уходит только переменная часть и труд людей. Именно поэтому 18 600 ₽ здесь, а не 750 × 38,6 ₽ полной удельной стоимости, как получилось бы при наивном счёте. Методику разделения на переменную и постоянную часть мы разбирали в статье про стоимость одного обращения.

схема процессаekonomiya-na-vybore-modeli-bessmyslenna--03
Схема потока 5000 обращений: 750 из них порождает сам процесс и снимается уведомлением, а не моделью

Чертёжная схема потока. Слева блок «5 000 обращений в месяц», из него две стрелки. Верхняя, широкая, ведёт в блок «4 250 обращений — работа для агента» с подписью «здесь спорят про цену токенов, 8 000 ₽ выигрыша». Нижняя, узкая, ведёт в блок «750 обращений — порождает сам процесс», под ним три подписанных причины: «статус заказа непонятен», «уведомление не пришло», «условий возврата нет на сайте». От нижнего блока стрелка вправо в блок «уведомление, поле в личном кабинете, абзац на сайте» и итоговая подпись «18 600 ₽/мес». Никаких логотипов и роботов.

Эти 750 обращений не надо обрабатывать дешевле — их надо не создавать

Найти такие обращения несложно: их видно в разбивке по темам за любой месяц. Обычно это три-четыре темы, дающие вместе шестую часть потока, и лечатся они уведомлением, полем в личном кабинете или абзацем на сайте. Разложить поток по темам помогает классификация обращений — тот же инструмент, что и для агента, только применённый до него.

Как проверить экономию честно

Единственный корректный способ сравнить два варианта — полная удельная стоимость обращения, а не строка счёта провайдера. Порядок проверки занимает один вечер.

  1. 1Соберите регресс-набор из 200 реальных обращений с эталонными ответами. Без него дальнейшие шаги бессмысленны — сравнивать будет не с чем.
  2. 2Прогоните оба варианта и запишите две цифры для каждого: долю ответов, принятых без правки, и долю эскалаций.
  3. 3Переведите разницу в эскалациях в часы и рубли по полной стоимости часа сотрудника — 700 ₽ в наших расчётах.
  4. 4Прибавьте изменение часов контроля качества: более слабой модели нужна большая выборка, и это тоже деньги.
  5. 5Сложите переменную часть, постоянную часть и труд людей, разделите на объём и сравнивайте только эти две итоговые цифры. Если полная удельная стоимость выросла, экономии нет, какой бы ни была строка счёта провайдера.

Формула пересчёта на свои условия простая: расход на модель в месяц равен числу обращений, умноженному на среднее число тысяч токенов на обращение и на цену за 1 000 токенов. В нашем примере это 5 000 × 10 × 0,32 = 16 000 ₽. Подставьте свои три числа — и получите ту самую строку, из-за которой обычно спорят. Дальше сравните её с остальным счётом: если она меньше трети, спор не о том.

Когда дешёвая модель — правильный выбор, а когда экономить не надо вовсе

Есть четыре ситуации, где переход на более дешёвую модель оправдан и почти ничем не грозит.

  • Задача — классификация, а не генерация. Определить тему обращения, отнести документ к типу, выделить поле из накладной. Здесь разница между сильной и слабой моделью измеряется долями процента, а объём вызовов большой.
  • Поток однороден и цена ошибки низкая. Ответы на десяток типовых вопросов по фиксированным условиям, где худший исход — клиент переспросит.
  • Человек всё равно проверяет каждый ответ. Если агент готовит черновик оператору, а не отвечает клиенту сам, слабая модель добавит оператору несколько секунд правки — и это дешевле разницы в цене вызовов.
  • Объём выше 20 000 обращений в месяц. Там строка модели доходит до 47 % счёта, и половина от неё — уже настоящие деньги, ради которых стоит потратить неделю инженера на прогон и сравнение.

И зеркальный список — когда экономить на модели не надо даже пробовать. Если объём меньше 3 000 обращений в месяц, вся строка модели составляет 9 600 ₽, и половина от неё не покроет даже стоимости прогона сравнения. Если агент отвечает клиенту напрямую и цена неверного ответа — потерянная сделка или спор о деньгах, разница в качестве стоит несопоставимо больше разницы в цене. Если проект ещё не вышел на режим и промпты меняются каждую неделю, менять под ними ещё и модель — значит потерять единственную стабильную точку сравнения.

Общий вывод короткий. Цена токенов — это ставка, по которой считают четверть счёта, и её колебания на десятки процентов двигают итог на единицы. Решают три другие вещи: правильно ли выбран процесс, есть ли объём и кто ведёт базу знаний. Про объём мы писали в разборе порога окупаемости, и там разница между «окупается» и «нет» измеряется не процентами, а разами.