Reasoning-модель — это модель, которая перед ответом пишет черновик рассуждения: разбирает задачу на шаги, проверяет промежуточные выводы и только потом формулирует итог. Черновик пользователю обычно не показывают, но оплачивается он как обычные выходные токены, и его длина в несколько раз превышает длину самого ответа. Отсюда обе особенности: заметно лучший результат на многошаговых задачах и заметно худший — на всём остальном, потому что дороже и медленнее.

Владельцу бизнеса из этого нужна не характеристика модели, а граница. Она проходит не по сложности темы и не по важности клиента, а по одному признаку: требует ли задача нескольких шагов, где каждый следующий зависит от результата предыдущего. Сверить три документа между собой — требует. Определить, в какой отдел передать письмо, — нет, сколько бы ни стоил контракт с этим клиентом.

Дальше — что именно происходит внутри и почему это оплачивается; таблица задач, где выигрыш реальный и где его нет; расчёт трёх вариантов контура на потоке 6 000 обращений; схема маршрутизатора, который решает проблему целиком; и однодневный замер, который заменяет спор с подрядчиком о том, «какая модель лучше».

Что reasoning-модель делает иначе

Что это значитReasoning-режим (режим рассуждения)

Режим работы модели, в котором она перед итоговым ответом порождает промежуточный текст разбора задачи. Этот текст занимает от нескольких сотен до нескольких тысяч токенов, тарифицируется как выходной и увеличивает время ответа пропорционально своей длине. У части провайдеров длину черновика можно ограничить настройкой, у части — нет.

Аналогия простая: обычная модель отвечает как человек, который знает предмет и говорит сразу. Reasoning-модель — как человек, который берёт лист бумаги и расписывает: «так, здесь три договора, в первом отсрочка 30 дней, во втором 45, но во втором есть пункт про пени, значит…». На простом вопросе этот лист бумаги — потерянное время. На вопросе «какое из трёх предложений выгоднее с учётом отсрочки, брака и срока» — единственный способ не ошибиться.

Важная деталь для чтения прайса: токены рассуждения почти всегда тарифицируются как выходные, то есть по самой дорогой ставке. Это надо увидеть в документе провайдера, а не услышать на созвоне — вместе с тем, показывается ли израсходованный объём рассуждения в статистике ответа. Если не показывается, вы не сможете ни спрогнозировать счёт, ни объяснить его рост. Общая механика подсчёта разобрана в материале про токены и стоимость запросов.

Где выигрыш реальный, а где его нет

Признак один и тот же во всех строках таблицы: есть ли в задаче зависимость между шагами. Если ответ можно получить одним взглядом на один фрагмент — рассуждение не добавит ничего, кроме счёта.

ЗадачаНужно ли рассуждениеПочему
Сверка нескольких документов между собойДаКаждое расхождение проверяется по остальным документам, шаги зависят друг от друга
Разбор противоречивых условий договораДаПункт про отсрочку меняет смысл пункта про пени, а тот — смысл приложения
Многошаговый расчёт с условиямиДаСкидка зависит от объёма, объём от остатка, а остаток от даты отгрузки
Классификация обращений по темамНетРешение принимается по одному тексту за один шаг, обычная модель справляется быстрее
Извлечение полей из документаНетПоля независимы, рассуждение над каждым не улучшает результат и удорожает страницу
Ответ по одному найденному фрагменту базыНетОтвет содержится во фрагменте целиком, разбирать нечего
сравнениеreasoning-modeli-kogda-nuzhny--01
Две колонки задач: многошаговые с зависимостью шагов и одношаговые, где рассуждение не нужно

Сравнение в две колонки. Левая «Шаги зависят друг от друга — нужно рассуждение» с тремя подписанными карточками: «Сверка нескольких документов», «Противоречивые условия договора», «Расчёт со скидкой, объёмом и остатком»; внутри каждой карточки цепочка из трёх маленьких блоков со стрелками между ними. Правая колонка «Один шаг — рассуждение не нужно» с тремя карточками: «Классификация обращения», «Извлечение полей», «Ответ по одному фрагменту»; внутри каждой один блок без стрелок. Внизу общая подпись: «3,68 ₽ за запрос слева, 0,94 ₽ справа». Чертёжный стиль, подписи по-русски.

Граница проходит по зависимости шагов друг от друга, а не по важности задачи

Цена в двух измерениях: рубли и секунды

Модельный пример: клиентский ассистент, 6 000 обращений в месяц, в среднем три реплики на обращение — 18 000 запросов к модели. Средний запрос — 3 800 входных токенов и 300 выходных. Тарифы обычной модели по состоянию на сентябрь 2026 года: 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных. Для режима рассуждения берём вдвое более высокий тариф (0,40 и 1,20 ₽) и черновик на 1 500 токенов — оба числа надо заменить своими из прайса и статистики ответов.

Три варианта контура, месяц на 18 000 запросов
Обычный запрос: 3 800 × 0,20 / 1 000 + 300 × 0,60 / 1 0000,94 ₽
Запрос с рассуждением: 3 800 × 0,40 / 1 000 + 1 800 × 1,20 / 1 0003,68 ₽
А. Рассуждение на всём потоке: 18 000 × 3,68 ₽66 240 ₽
Б. Обычная модель на всём потоке: 18 000 × 0,94 ₽16 920 ₽
В. Маршрутизатор: 1 440 × 3,68 + 16 560 × 0,94 + классификатор 6 000 × 0,023 ₽21 003 ₽
ИтогоВариант В против А — экономия 45 237 ₽ в месяц, 542 844 ₽ в год

Вариант А не выдуманный: именно так выглядит контур, когда подрядчик поставил модель с рассуждением на весь поток «для качества». Вариант Б — обратная крайность, в которой 8 % многошаговых обращений упираются в потолок обычной модели и с большой вероятностью доходят до человека. Вариант В стоит на 4 083 ₽ в месяц дороже варианта Б, и вот честный порог для этой доплаты: она окупается, если выделенная ветка снимает с людей хотя бы 11 разборов сложных случаев в месяц — 11 × 25 минут по ставке 900 ₽/час это 4 125 ₽. Сколько снимет у вас, узнаётся замером, а не из статьи.

графикreasoning-modeli-kogda-nuzhny--02
Три варианта контура: 66 240 ₽ на всём потоке, 21 003 ₽ через маршрутизатор, 16 920 ₽ без рассуждения

Три горизонтальные полосы одинаковой шкалы, ось в рублях в месяц от 0 до 70 000. Верхняя «А. Рассуждение на всём потоке — 66 240 ₽». Средняя «В. Маршрутизатор — 21 003 ₽», разбита на три подписанных сегмента: «ветка рассуждения 5 299 ₽», «обычная модель 15 566 ₽», «классификатор 138 ₽». Нижняя «Б. Обычная модель на всём потоке — 16 920 ₽». Между средней и верхней полосой фигурная скобка с подписью «экономия 45 237 ₽/мес», между средней и нижней — скобка «доплата 4 083 ₽/мес за 8 % сложных обращений». Внизу сноска: «18 000 запросов в месяц, тарифы сентября 2026». Чертёжный стиль, подписи по-русски.

Выделенная ветка стоит на 4 083 ₽ дороже обычной модели и на 45 237 ₽ дешевле рассуждения везде

Второе измерение цены — секунды, и оно считается так же прямолинейно. Время генерации пропорционально числу выходных токенов: возьмите скорость своей модели из статистики ответа и умножьте. При 60 токенах в секунду обычный ответ в 300 токенов пишется 5 секунд, а ответ с черновиком в 1 800 токенов — 30 секунд. Для живого чата это неприемлемо, для ночной сверки реестров — безразлично. Как задержка первого ответа связана с конверсией, мы считали отдельно в материале про скорость ответа и конверсию.

Маршрутизатор: рассуждение только на выделенной ветке

Правильная архитектура не выбирает одну модель на весь контур. Перед моделями ставится дешёвый классификатор, который отвечает на единственный вопрос: многошаговая эта задача или нет. В расчёте выше он стоит 0,023 ₽ за обращение — 400 входных токенов и 20 выходных на младшей модели по тарифу 0,05 и 0,15 ₽ за 1 000, итого 138 ₽ в месяц на весь поток.

схема процессаreasoning-modeli-kogda-nuzhny--03
Поток обращений через классификатор: 92 % на обычную модель, 8 % на ветку с рассуждением

Схема потока данных слева направо. Блок «Обращение, 6 000 в месяц» → блок «Классификатор на младшей модели, 0,023 ₽ за обращение, 138 ₽/мес» → развилка на две дорожки. Верхняя дорожка подписана «92 %, 16 560 запросов» и ведёт в блок «Обычная модель, 0,94 ₽ за запрос, 15 566 ₽/мес», далее стрелка «ответ за 5 секунд». Нижняя дорожка подписана «8 %, 1 440 запросов» и ведёт в блок «Ветка рассуждения, 3,68 ₽ за запрос, 5 299 ₽/мес», далее стрелка «ответ за 30 секунд, показываем статус ожидания». Обе дорожки сходятся в блок «Ответ клиенту». Под нижней дорожкой пометка «сверка документов, противоречия в договоре, расчёт с условиями». Чертёжный стиль, все подписи по-русски.

Развилка стоит 138 ₽ в месяц и определяет, куда уйдут остальные двадцать тысяч
Классификатор — не обязательно модель

В половине случаев ветка определяется правилом: обращение пришло из формы сверки, к нему приложено больше одного документа, в тексте есть слова «сравнить» и «расхождение». Правило дешевле, быстрее и предсказуемее модели, а модель ставится только на остаток, который правилами не разбирается. Это тот же приём, что и в гибридной архитектуре «правила плюс модель», и он работает здесь так же хорошо.

Тридцать секунд молчания клиент читает как поломку

Если ветка рассуждения смотрит наружу, в клиентский чат, интерфейс обязан показать статус: «проверяю три документа, это займёт около полуминуты». Без такой подписи доля брошенных диалогов растёт независимо от качества итогового ответа. Практичнее вообще не выпускать медленную ветку в живой диалог: сверки и проверки договоров ставятся в очередь и возвращаются письмом или карточкой в CRM.

Как проверить границу на своих задачах за один день

Спор «какая модель лучше» не решается аргументами — он решается замером на ваших обращениях. Замер укладывается в рабочий день и стоит около 19 000 ₽: это дешевле, чем один месяц неверно выбранного контура по расчёту выше.

  1. 1Соберите 200 обращений из журнала за последний месяц. Не придуманных: берите подряд, а потом отдельно доберите до 40 штук те, что заведомо многошаговые. Обе группы нужны, потому что интерес представляет разница между ними.
  2. 2Прогоните обе модели с одинаковым промтом. Ничего не подкручивайте между прогонами — иначе сравнение сломается. Стоимость прогона: 200 × 0,94 + 200 × 3,68 = 924 ₽.
  3. 3Разметьте ответы силами предметного специалиста. По две минуты на пару ответов — 6,7 часа и около 6 000 ₽ по ставке 900 ₽/час. Разметку делает тот, кто в теме, а не инженер и не подрядчик.
  4. 4Считайте разницу отдельно на двух группах. На простых обращениях её обычно нет вовсе — это нормальный и полезный результат. На многошаговых она либо есть и видна невооружённым глазом, либо её нет, и тогда рассуждение вам не нужно.
  5. 5Переведите разницу в часы разбора. Сколько случаев в месяц перестанут доходить до человека и по сколько минут каждый. Порог для доплаты 4 083 ₽ в месяц — 11 разборов по 25 минут. Методику замера качества на своих данных мы описывали отдельным материалом.

Смета замера складывается из трёх строк: 924 ₽ на прогон обеих моделей, 6 000 ₽ на разметку силами предметного специалиста и 4 часа инженера на сборку выборки и сведение результата — 12 000 ₽ по ставке 3 000 ₽/час. Итого 18 924 ₽ и один рабочий день. Побочный полезный результат: у вас остаётся размеченный набор из 200 обращений, который дальше служит контрольным при каждой смене модели или правке промта — второй раз собирать его уже не придётся.

Когда reasoning-модель не нужна

Четыре ситуации, в которых переход на рассуждение ухудшит результат при росте счёта в четыре раза.

  • Весь поток одношаговый. Классификация, извлечение полей, ответы по базе знаний. Здесь рассуждение не улучшает ответ, а только удлиняет его — и увеличивает вероятность, что модель уйдёт в сторону от короткого верного ответа.
  • Ответ нужен в живом диалоге. Тридцать секунд ожидания в чате дороже любой прибавки к точности. Если задача многошаговая, а канал живой — задача выносится в очередь, а не решается ускорением модели.
  • Доля сложных обращений меньше 2 %. При 6 000 обращений это 120 штук в месяц: разбор их людьми стоит дешевле, чем ветка, классификатор и их обслуживание.
  • Модель ошибается в арифметике, а не в логике. Рассуждение не заменяет калькулятор: если задача сводится к точному расчёту, правильное решение — вызов функции расчёта, а не более дорогая модель.
  • Тариф на рассуждение не виден в прайсе. Пока непонятно, как считаются токены черновика и показывается ли их объём, любой расчёт окупаемости будет фантазией. Это первый вопрос провайдеру, а не последний.

Модель с рассуждением — это не «версия получше». Это отдельный инструмент с ценой в четыре раза выше и задержкой в шесть раз больше, и ставят его на одну ветку из десяти.