Голосовой агент разваливается не на понимании смысла, а на очерёдности реплик. Задача звучит просто — понять, что человек договорил, — но решается она по звуку, а звук русской телефонной речи устроен так, что пауза внутри фразы регулярно длиннее паузы в её конце. Отсюда два симптома, которые слышал каждый: робот перебивает на середине адреса или молчит две секунды после короткого «да».

Ориентир здесь один и он жёсткий: от последнего звука человека до первого звука робота должно проходить меньше секунды. Пауза длиннее секунды в телефонном разговоре читается собеседником как обрыв связи — он говорит «алло», робот в этот момент начинает свою реплику, дальше идёт наложение, из которого разговор уже не выбирается. Ни один смысловой сценарий этого не компенсирует.

Ниже — из чего эта секунда складывается по участкам, три способа определять конец реплики и цена каждого, отдельный режим для диктовки цифр и адресов, модельный расчёт на потоке 3 000 звонков в месяц и восемь сценариев, которыми это проверяется на приёмке. Тема смежная с реальной точностью распознавания русской речи, но задача другая: там речь про то, что робот услышал, здесь — про то, когда он решил, что пора отвечать.

Почему пауза — это не конец фразы

Человек молчит не только тогда, когда закончил. Он молчит, пока вспоминает номер заказа, пока диктует адрес по частям, пока набирает воздух перед длинной фразой и пока ждёт, что собеседник подтвердит услышанное. Физически все эти паузы одинаковы — тишина в линии. Различить их можно только по контексту, а платформа по умолчанию смотрит исключительно на длительность.

Что это значитПорог тишины

Время непрерывного молчания, после которого система считает реплику законченной и начинает готовить ответ. Это единственная настройка, которая есть на любой платформе, и единственная, которую по умолчанию ставят одним значением на весь сценарий. Отсюда почти все жалобы на то, что робот не даёт договорить.

Что происходит в разговореТипичная пауза внутри репликиЧто сделает порог тишины 600 мс
Обычная фраза: «мне нужно поменять время записи»150–350 мсДождётся конца — всё в порядке
Номер телефона, продиктованный по три-четыре цифры400–700 мсПеребьёт примерно на середине номера
Адрес: улица, дом, корпус, квартира600–1 100 мсПеребьёт почти всегда
Фамилия по буквам700–1 400 мсПеребьёт и переспросит с первой буквы
Человек ищет номер заказа в почте или в сообщениях1 500–4 000 мсПеребьёт и уйдёт в ветку «не расслышал»

Отсюда первый практический вывод. Единый порог на весь сценарий — всегда компромисс не в вашу пользу. Поставите 600 мс — робот режет диктовку. Поставите 1 200 мс — он становится заметно медленным на коротких ответах «да», «нет», «второй пункт», а таких реплик в типовом сценарии больше половины. Настраивается не одно число, а карта порогов по репликам.

графикkonets-frazy-v-golosovom-agente--01
Диапазоны пауз в русской телефонной речи и вертикальная линия порога 600 миллисекунд

Горизонтальный график-диапазон: пять полос с типами реплик и длительностью пауз внутри них — обычная фраза 150–350 мс, номер телефона 400–700 мс, адрес 600–1 100 мс, фамилия по буквам 700–1 400 мс, поиск номера заказа 1 500–4 000 мс. Поверх полос вертикальная выделенная линия «порог тишины 600 мс»; видно, что четыре полосы из пяти её пересекают. Нижняя ось — миллисекунды в логарифмическом масштабе. Чертёжный стиль, все подписи по-русски.

Единый порог тишины режет четыре типа реплик из пяти

Из чего складывается задержка ответа

Пауза перед ответом робота — не одно число, а сумма пяти участков. Разбирать её имеет смысл именно по участкам: подрядчик, который на вопрос о задержке отвечает «это модель такая», обычно просто не мерил.

УчастокТипичная задержкаЧем сокращается
Звук от абонента до сервера и обратно80–150 мсПлощадка ближе к оператору связи, меньше перекодировок звука
Распознавание речи150–400 мсПотоковый режим вместо распознавания файла целиком
Ожидание «человек договорил»500–1 200 мсСвой порог под конкретную реплику, модель конца реплики
Обдумывание ответа300–1 500 мсКороткая инструкция, кэш типовых ответов, малая модель на простых ветках
Синтез первого звука ответа150–400 мсПотоковый синтез: озвучка начинается раньше, чем готова вся фраза
Итого до первого звука робота1,2–3,6 с

Половину бюджета съедают два участка — ожидание конца реплики и обдумывание. Остальные три вместе дают от 380 до 950 мс. Это важно для приоритета работ: перевозить площадку ближе к оператору связи ради 50 мс бессмысленно, пока робот полторы секунды ждёт тишины. Про то, как выбирается модель под простые и сложные ветки, есть отдельный разговор — здесь достаточно правила: если ветка отвечает по справочнику, ей не нужна большая модель.

Секунда — это уже обрыв связи

В телефонном разговоре человек ждёт ответа примерно 700–900 мс, после чего начинает считать, что связь пропала. Дальше он говорит «алло» ровно в тот момент, когда робот начинает реплику, — и разговор входит в наложение. Поэтому целевой показатель формулируется не как «быстро», а как конкретное число: медиана задержки меньше 1 секунды, и меряется она секундомером на 20 разговорах, а не на демонстрации в переговорной.

схема процессаkonets-frazy-v-golosovom-agente--02
Схема пути реплики от абонента до ответа робота с задержкой на каждом участке

Горизонтальная схема из семи блоков со стрелкой слева направо: «Абонент говорит» → «Сеть и телефония 80–150 мс» → «Распознавание 150–400 мс» → «Ожидание конца реплики 500–1 200 мс» → «Обдумывание 300–1 500 мс» → «Синтез первого звука 150–400 мс» → «Абонент слышит ответ». Ширина блоков пропорциональна задержке, два средних блока выделены штриховкой. Под схемой шкала времени с отметкой «1 с — порог, за которым пауза читается как обрыв связи» и итоговой подписью «1,2–3,6 с».

Два широких блока в середине — вот где на самом деле лежит секунда

Три способа определить конец реплики

Способов ровно три, и выбирают обычно не один, а комбинацию. Первый — порог тишины, в двух вариантах: общий на сценарий и свой на каждую реплику. Второй — модель, которая решает по смыслу и интонации, а не по длине паузы. Третий — разрешить человеку перебивать робота, чтобы цена ошибки в первых двух перестала быть фатальной.

ПодходКак работаетЧто стоитЧем платите
Общий порог тишиныЖдёт заданное число миллисекунд молчания на всех репликахВходит в любую платформу, настройка — часыОдно значение на весь сценарий: либо режет диктовку, либо тормозит на «да»
Порог под каждую реплику500 мс на выбор пункта меню, 1 500 мс на диктовку адреса6–10 часов инженера на сценарий из 20 репликПереразмечать при каждой правке сценария
Модель конца репликиРешает по смыслу и интонации: «улица Садовая, дом» — фраза не законченаЕсть не на всех платформах, добавляет 100–250 мс и отдельную строку в тарифеОшибается на односложных ответах и на плохой линии
Разрешить перебивать роботаЧеловек говорит поверх — робот замолкает на полусловеВходит в платформу, требует настройки эхоподавленияЛожные срабатывания от шума: улица, радио в машине, телевизор

Рабочая комбинация для большинства сценариев выглядит так: пороги под реплику как основа, разрешённое перебивание как страховка от слишком длинных реплик робота, модель конца реплики — только на тех вопросах, где ответ длинный и свободный по форме. Ставить модель на всё подряд дорого и бессмысленно: на реплике «нажмите или скажите один, два или три» она проигрывает обычному порогу в 400 мс. Отдельно стоит помнить, что длинные реплики робота — сами по себе источник перебиваний, и лечатся они сокращением текста, а не настройками; список типовых раздражителей мы собрали в материале про то, что умеет голосовой робот и где он раздражает.

Режим диктовки: цифры, адреса, фамилии

Отдельный режим для реплик, где человек диктует данные, — самая дешёвая и самая недооценённая настройка. Он включается не на весь звонок, а на конкретную реплику сценария и меняет сразу шесть вещей.

  1. 1Порог тишины поднимается до 1 500–2 000 мс. Только здесь: на соседней реплике он остаётся прежним.
  2. 2Перебивание на этой реплике выключается. Иначе шум улицы или чужая речь в фоне обрежут адрес на половине.
  3. 3Проверяется формат. Если ожидается 11 цифр, а пришло 7, робот продолжает слушать, а не переспрашивает с начала.
  4. 4Подтверждение идёт блоками. Робот повторяет услышанное частями — «Садовая, двенадцать» — и просит подтвердить одним словом, а не зачитывает весь адрес целиком в конце.
  5. 5Подключается словарь: улицы города, названия услуг, номенклатура. Именно на диктовке ошибки распознавания садятся плотнее всего, поэтому словарь важнее порога — без него правильно дослушанный адрес всё равно будет записан неверно.
  6. 6Задаётся выход. После двух неудачных попыток — перевод на человека или SMS со ссылкой на форму, но не третий круг того же вопроса.
сравнениеkonets-frazy-v-golosovom-agente--03
Сравнение обычной реплики и режима диктовки по порогам, перебиванию и подтверждению

Две колонки сравнения. Левая «Обычная реплика»: порог тишины 500–700 мс, перебивание разрешено, формат не проверяется, подтверждение не требуется, ожидаемый ответ — одно-два слова. Правая «Режим диктовки»: порог 1 500–2 000 мс, перебивание выключено, проверка формата (11 цифр в номере), подтверждение блоками, словарь улиц и номенклатуры, выход на человека после двух неудач. Под колонками подпись: «Разница только в настройках одной реплики, а не в платформе». Чертёжный стиль, подписи по-русски.

Режим диктовки включается на одну реплику, а не на весь звонок

Сколько стоит настройка и что она возвращает

Модельная компания: служба доставки, голосовой робот на входящих принимает заказы и снимает очередь в пиковые часы. Поток — 3 000 звонков в месяц, из них 1 200 доходят до реплики, где клиент диктует адрес и состав заказа. Средний чек 2 400 ₽, маржа 30 %.

Соблазн считать эффект в минутах разговора обманчив. Лишние 1,3 секунды на каждую из шести реплик робота дают 7,8 секунды на разговор; на 3 000 разговоров это 390 минут и 1 404 ₽ в месяц при входящей минуте 3,60 ₽. Настройка за 90 000 ₽ такой экономией не окупится никогда. Деньги теряются не в минутах, а в заказах, которые не доехали до конца сценария.

Очерёдность реплик: 3 000 звонков в месяц, из них 1 200 со сбором адреса
Звонков, где робот принимает адрес и состав заказа1 200 в месяц
Робот перебивает на паузе внутри адреса — 34 % таких звонков408 звонков
Из них клиент повторяет данные и заказ всё же принимается — 60 %245 звонков
Из них разговор обрывается или уходит в тупик — 40 %163 звонка
Заказ теряется совсем — 60 % от оборвавшихся98 заказов
Маржа с заказа: чек 2 400 ₽ при марже 30 %720 ₽
Потери до настройки: 98 заказов по 720 ₽70 560 ₽/мес
После настройки перебивания падают с 34 % до 9 %: 108 звонков и 26 потерянных заказов18 720 ₽/мес
Работа инженера: разбор 60 записей, пороги под реплики, режим диктовки, приёмка — 30 часов по 3 000 ₽90 000 ₽ разово
ИтогоВозврат 51 840 ₽ в месяц, окупаемость 1,7 месяца

Цифра 9 % вместо нуля здесь не осторожность, а факт: часть перебиваний остаётся всегда — люди делают паузы в четыре секунды, диктуют на фоне детского крика, кладут телефон на стол. Подрядчик, который обещает «робот перестанет перебивать», обещает то, чего не бывает; правильная формулировка в договоре — целевая доля перебиваний и медиана задержки, замеренные на согласованной выборке разговоров.

Восемь сценариев приёмки

Приёмка занимает около часа и делается тем сотрудником, который будет с роботом жить, а не тем, кто его настраивал. Настройщик подсознательно повторяет сценарии, которые уже работают. Звонить нужно с мобильного, а не через веб-виджет: половина проблем живёт именно в телефонной линии.

  1. 1
    1. Длинная пауза внутри адреса

    Диктуете адрес с паузой около 1,2 секунды между «дом» и номером дома. Робот обязан дождаться и не перебить. Это базовый сценарий, на котором отсеивается половина неготовых внедрений.

  2. 2
    2. Поиск в почте

    Говорите «секунду, сейчас найду» и молчите 6 секунд. Правильное поведение: робот ждёт, один раз мягко напоминает о себе и не кладёт трубку. Неправильное: уходит в ветку «я вас не расслышал» и начинает вопрос заново.

  3. 3
    3. Односложный ответ

    На закрытый вопрос отвечаете «да». Ответ робота должен начаться быстрее секунды. Если здесь пауза полторы секунды, порог стоит один на весь сценарий и подобран под диктовку — это чинится за несколько часов.

  4. 4
    4. Шум на линии

    Звоните с улицы или из машины с включённым радио. Проверяется поведение перебивания: робот не должен замолкать от чужой речи и музыки в фоне. Если замолкает — эхоподавление и порог громкости не настроены.

  5. 5
    5. Перебивание

    Начинаете говорить на второй секунде реплики робота. Он обязан замолчать примерно за 300 мс и начать слушать. Робот, который договаривает свою фразу до конца поверх человека, раздражает сильнее, чем робот, который медленно думает.

  6. 6
    6. Фамилия по буквам

    Диктуете редкую фамилию по буквам. Проверяются сразу три вещи: поднятый порог, подтверждение блоками и словарь. Ошибка здесь означает, что режим диктовки включён не на всех нужных репликах.

  7. 7
    7. Двое на линии

    Рядом с вами говорит второй человек. Проверяется, чью речь робот считает репликой и не смешивает ли он две дорожки в одну фразу. Для колл-центров и торговых залов это не экзотика, а норма.

  8. 8
    8. Замер по секундомеру

    Двадцать разговоров, в каждом фиксируется время от конца вашей реплики до первого звука робота. В акт идёт медиана, а не среднее: одно тридцатисекундное зависание среднее испортит, а медиану — нет.

разбор экранаkonets-frazy-v-golosovom-agente--04
Лист протокола приёмки голосового агента с восемью сценариями и колонками нормы и факта

Нарисованный лист протокола приёмки: таблица из восьми строк со сценариями — длинная пауза в адресе, поиск в почте, односложный ответ, шум на линии, перебивание, фамилия по буквам, двое на линии, замер по секундомеру. Три колонки: «что проверяем», «норма», «факт». В колонке «норма» читаются значения: «дождался», «меньше 1 с», «замолчал за 300 мс», «медиана по 20 разговорам». Внизу строка подписи и дата. Чертёжный стиль, подписи по-русски.

В акт идёт медиана по 20 разговорам, а не впечатление от демонстрации
Порогом чинится не всё

Если робот перебивает на чистой линии и при правильно подобранных порогах, дело не в очерёдности реплик, а в распознавании: движок отдаёт промежуточный результат как окончательный. Лечится это трактом записи и словарём, а не настройкой пауз — механику разбирали в статье про реальную точность распознавания русской речи. Признак ровно один: ошибки идут только на конкретных типах слов — числах, именах, номенклатуре, — а не равномерно по всему разговору.

Когда этим заниматься не надо

Настройка очерёдности реплик — работа на 30 часов и 90 000 ₽, и есть четыре ситуации, в которых мы сами советуем её не начинать.

  • Поток меньше 600–800 звонков в месяц. На таком объёме под вопросом не пороги, а сам робот: обработанный им звонок выходит дороже дежурства по графику. Границы разобраны в материале про то, когда голосовой робот вредит — сначала решается этот вопрос, потом настройки.
  • В сценарии нет диктовки. Если робот только здоровается, определяет звонящего и переводит на нужного человека, общий порог 700 мс закрывает вопрос за час работы. Карта порогов по репликам нужна там, где данные собираются голосом.
  • Плохой тракт записи. Звонки из цеха, со стройки, из торгового зала с музыкой: сначала гарнитуры и двухканальная запись, потом пороги. На чистой записи с гарнитуры ошибок по словам 5–12 %, на телефонной линии — 14–22 %, и вторая цифра съедает любую настройку пауз.
  • Разговор эмоциональный. Жалоба, долг, отказ, всё, что касается здоровья, — здесь проблема не в порогах и не решается ими. Такие темы роботу не отдают ни при каком качестве настройки.
  • Платформа не показывает метрик. Если в отчёте нет времени от конца реплики до ответа и доли перебиваний, настраивать нечего: вы будете двигать числа вслепую и спорить с подрядчиком ощущениями. Наличие этих двух метрик — вопрос к платформе до подписания договора, а не после.

И общий вывод, который стоит держать в голове при выборе подрядчика. Красивый сценарий, умная модель и естественный голос — это то, что показывают на демонстрации; про голос у нас есть отдельный разбор — когда робота слышно и когда уже нет. Очерёдность реплик — то, что определяет, доживёт ли разговор до конца, и на демонстрации её не видно. Спрашивать на первом созвоне надо не про модель и не про тембр, а про две цифры: медиану задержки ответа и долю перебиваний на реальном потоке заказчика.

Робот проигрывает разговор не там, где не понял, а там, где не дал договорить.