Reasoning-модель — это модель, которая перед ответом пишет черновик рассуждения: разбирает задачу на шаги, проверяет промежуточные выводы и только потом формулирует итог. Черновик пользователю обычно не показывают, но оплачивается он как обычные выходные токены, и его длина в несколько раз превышает длину самого ответа. Отсюда обе особенности: заметно лучший результат на многошаговых задачах и заметно худший — на всём остальном, потому что дороже и медленнее.
Владельцу бизнеса из этого нужна не характеристика модели, а граница. Она проходит не по сложности темы и не по важности клиента, а по одному признаку: требует ли задача нескольких шагов, где каждый следующий зависит от результата предыдущего. Сверить три документа между собой — требует. Определить, в какой отдел передать письмо, — нет, сколько бы ни стоил контракт с этим клиентом.
Дальше — что именно происходит внутри и почему это оплачивается; таблица задач, где выигрыш реальный и где его нет; расчёт трёх вариантов контура на потоке 6 000 обращений; схема маршрутизатора, который решает проблему целиком; и однодневный замер, который заменяет спор с подрядчиком о том, «какая модель лучше».
Что reasoning-модель делает иначе
Режим работы модели, в котором она перед итоговым ответом порождает промежуточный текст разбора задачи. Этот текст занимает от нескольких сотен до нескольких тысяч токенов, тарифицируется как выходной и увеличивает время ответа пропорционально своей длине. У части провайдеров длину черновика можно ограничить настройкой, у части — нет.
Аналогия простая: обычная модель отвечает как человек, который знает предмет и говорит сразу. Reasoning-модель — как человек, который берёт лист бумаги и расписывает: «так, здесь три договора, в первом отсрочка 30 дней, во втором 45, но во втором есть пункт про пени, значит…». На простом вопросе этот лист бумаги — потерянное время. На вопросе «какое из трёх предложений выгоднее с учётом отсрочки, брака и срока» — единственный способ не ошибиться.
Важная деталь для чтения прайса: токены рассуждения почти всегда тарифицируются как выходные, то есть по самой дорогой ставке. Это надо увидеть в документе провайдера, а не услышать на созвоне — вместе с тем, показывается ли израсходованный объём рассуждения в статистике ответа. Если не показывается, вы не сможете ни спрогнозировать счёт, ни объяснить его рост. Общая механика подсчёта разобрана в материале про токены и стоимость запросов.
Где выигрыш реальный, а где его нет
Признак один и тот же во всех строках таблицы: есть ли в задаче зависимость между шагами. Если ответ можно получить одним взглядом на один фрагмент — рассуждение не добавит ничего, кроме счёта.
| Задача | Нужно ли рассуждение | Почему |
|---|---|---|
| Сверка нескольких документов между собой | Да | Каждое расхождение проверяется по остальным документам, шаги зависят друг от друга |
| Разбор противоречивых условий договора | Да | Пункт про отсрочку меняет смысл пункта про пени, а тот — смысл приложения |
| Многошаговый расчёт с условиями | Да | Скидка зависит от объёма, объём от остатка, а остаток от даты отгрузки |
| Классификация обращений по темам | Нет | Решение принимается по одному тексту за один шаг, обычная модель справляется быстрее |
| Извлечение полей из документа | Нет | Поля независимы, рассуждение над каждым не улучшает результат и удорожает страницу |
| Ответ по одному найденному фрагменту базы | Нет | Ответ содержится во фрагменте целиком, разбирать нечего |
Сравнение в две колонки. Левая «Шаги зависят друг от друга — нужно рассуждение» с тремя подписанными карточками: «Сверка нескольких документов», «Противоречивые условия договора», «Расчёт со скидкой, объёмом и остатком»; внутри каждой карточки цепочка из трёх маленьких блоков со стрелками между ними. Правая колонка «Один шаг — рассуждение не нужно» с тремя карточками: «Классификация обращения», «Извлечение полей», «Ответ по одному фрагменту»; внутри каждой один блок без стрелок. Внизу общая подпись: «3,68 ₽ за запрос слева, 0,94 ₽ справа». Чертёжный стиль, подписи по-русски.
Цена в двух измерениях: рубли и секунды
Модельный пример: клиентский ассистент, 6 000 обращений в месяц, в среднем три реплики на обращение — 18 000 запросов к модели. Средний запрос — 3 800 входных токенов и 300 выходных. Тарифы обычной модели по состоянию на сентябрь 2026 года: 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных. Для режима рассуждения берём вдвое более высокий тариф (0,40 и 1,20 ₽) и черновик на 1 500 токенов — оба числа надо заменить своими из прайса и статистики ответов.
Вариант А не выдуманный: именно так выглядит контур, когда подрядчик поставил модель с рассуждением на весь поток «для качества». Вариант Б — обратная крайность, в которой 8 % многошаговых обращений упираются в потолок обычной модели и с большой вероятностью доходят до человека. Вариант В стоит на 4 083 ₽ в месяц дороже варианта Б, и вот честный порог для этой доплаты: она окупается, если выделенная ветка снимает с людей хотя бы 11 разборов сложных случаев в месяц — 11 × 25 минут по ставке 900 ₽/час это 4 125 ₽. Сколько снимет у вас, узнаётся замером, а не из статьи.
Три горизонтальные полосы одинаковой шкалы, ось в рублях в месяц от 0 до 70 000. Верхняя «А. Рассуждение на всём потоке — 66 240 ₽». Средняя «В. Маршрутизатор — 21 003 ₽», разбита на три подписанных сегмента: «ветка рассуждения 5 299 ₽», «обычная модель 15 566 ₽», «классификатор 138 ₽». Нижняя «Б. Обычная модель на всём потоке — 16 920 ₽». Между средней и верхней полосой фигурная скобка с подписью «экономия 45 237 ₽/мес», между средней и нижней — скобка «доплата 4 083 ₽/мес за 8 % сложных обращений». Внизу сноска: «18 000 запросов в месяц, тарифы сентября 2026». Чертёжный стиль, подписи по-русски.
Второе измерение цены — секунды, и оно считается так же прямолинейно. Время генерации пропорционально числу выходных токенов: возьмите скорость своей модели из статистики ответа и умножьте. При 60 токенах в секунду обычный ответ в 300 токенов пишется 5 секунд, а ответ с черновиком в 1 800 токенов — 30 секунд. Для живого чата это неприемлемо, для ночной сверки реестров — безразлично. Как задержка первого ответа связана с конверсией, мы считали отдельно в материале про скорость ответа и конверсию.
Маршрутизатор: рассуждение только на выделенной ветке
Правильная архитектура не выбирает одну модель на весь контур. Перед моделями ставится дешёвый классификатор, который отвечает на единственный вопрос: многошаговая эта задача или нет. В расчёте выше он стоит 0,023 ₽ за обращение — 400 входных токенов и 20 выходных на младшей модели по тарифу 0,05 и 0,15 ₽ за 1 000, итого 138 ₽ в месяц на весь поток.
Схема потока данных слева направо. Блок «Обращение, 6 000 в месяц» → блок «Классификатор на младшей модели, 0,023 ₽ за обращение, 138 ₽/мес» → развилка на две дорожки. Верхняя дорожка подписана «92 %, 16 560 запросов» и ведёт в блок «Обычная модель, 0,94 ₽ за запрос, 15 566 ₽/мес», далее стрелка «ответ за 5 секунд». Нижняя дорожка подписана «8 %, 1 440 запросов» и ведёт в блок «Ветка рассуждения, 3,68 ₽ за запрос, 5 299 ₽/мес», далее стрелка «ответ за 30 секунд, показываем статус ожидания». Обе дорожки сходятся в блок «Ответ клиенту». Под нижней дорожкой пометка «сверка документов, противоречия в договоре, расчёт с условиями». Чертёжный стиль, все подписи по-русски.
В половине случаев ветка определяется правилом: обращение пришло из формы сверки, к нему приложено больше одного документа, в тексте есть слова «сравнить» и «расхождение». Правило дешевле, быстрее и предсказуемее модели, а модель ставится только на остаток, который правилами не разбирается. Это тот же приём, что и в гибридной архитектуре «правила плюс модель», и он работает здесь так же хорошо.
Если ветка рассуждения смотрит наружу, в клиентский чат, интерфейс обязан показать статус: «проверяю три документа, это займёт около полуминуты». Без такой подписи доля брошенных диалогов растёт независимо от качества итогового ответа. Практичнее вообще не выпускать медленную ветку в живой диалог: сверки и проверки договоров ставятся в очередь и возвращаются письмом или карточкой в CRM.
Как проверить границу на своих задачах за один день
Спор «какая модель лучше» не решается аргументами — он решается замером на ваших обращениях. Замер укладывается в рабочий день и стоит около 19 000 ₽: это дешевле, чем один месяц неверно выбранного контура по расчёту выше.
- 1Соберите 200 обращений из журнала за последний месяц. Не придуманных: берите подряд, а потом отдельно доберите до 40 штук те, что заведомо многошаговые. Обе группы нужны, потому что интерес представляет разница между ними.
- 2Прогоните обе модели с одинаковым промтом. Ничего не подкручивайте между прогонами — иначе сравнение сломается. Стоимость прогона: 200 × 0,94 + 200 × 3,68 = 924 ₽.
- 3Разметьте ответы силами предметного специалиста. По две минуты на пару ответов — 6,7 часа и около 6 000 ₽ по ставке 900 ₽/час. Разметку делает тот, кто в теме, а не инженер и не подрядчик.
- 4Считайте разницу отдельно на двух группах. На простых обращениях её обычно нет вовсе — это нормальный и полезный результат. На многошаговых она либо есть и видна невооружённым глазом, либо её нет, и тогда рассуждение вам не нужно.
- 5Переведите разницу в часы разбора. Сколько случаев в месяц перестанут доходить до человека и по сколько минут каждый. Порог для доплаты 4 083 ₽ в месяц — 11 разборов по 25 минут. Методику замера качества на своих данных мы описывали отдельным материалом.
Смета замера складывается из трёх строк: 924 ₽ на прогон обеих моделей, 6 000 ₽ на разметку силами предметного специалиста и 4 часа инженера на сборку выборки и сведение результата — 12 000 ₽ по ставке 3 000 ₽/час. Итого 18 924 ₽ и один рабочий день. Побочный полезный результат: у вас остаётся размеченный набор из 200 обращений, который дальше служит контрольным при каждой смене модели или правке промта — второй раз собирать его уже не придётся.
Когда reasoning-модель не нужна
Четыре ситуации, в которых переход на рассуждение ухудшит результат при росте счёта в четыре раза.
- Весь поток одношаговый. Классификация, извлечение полей, ответы по базе знаний. Здесь рассуждение не улучшает ответ, а только удлиняет его — и увеличивает вероятность, что модель уйдёт в сторону от короткого верного ответа.
- Ответ нужен в живом диалоге. Тридцать секунд ожидания в чате дороже любой прибавки к точности. Если задача многошаговая, а канал живой — задача выносится в очередь, а не решается ускорением модели.
- Доля сложных обращений меньше 2 %. При 6 000 обращений это 120 штук в месяц: разбор их людьми стоит дешевле, чем ветка, классификатор и их обслуживание.
- Модель ошибается в арифметике, а не в логике. Рассуждение не заменяет калькулятор: если задача сводится к точному расчёту, правильное решение — вызов функции расчёта, а не более дорогая модель.
- Тариф на рассуждение не виден в прайсе. Пока непонятно, как считаются токены черновика и показывается ли их объём, любой расчёт окупаемости будет фантазией. Это первый вопрос провайдеру, а не последний.
Модель с рассуждением — это не «версия получше». Это отдельный инструмент с ценой в четыре раза выше и задержкой в шесть раз больше, и ставят его на одну ветку из десяти.
