Голосовой агент разваливается не на понимании смысла, а на очерёдности реплик. Задача звучит просто — понять, что человек договорил, — но решается она по звуку, а звук русской телефонной речи устроен так, что пауза внутри фразы регулярно длиннее паузы в её конце. Отсюда два симптома, которые слышал каждый: робот перебивает на середине адреса или молчит две секунды после короткого «да».
Ориентир здесь один и он жёсткий: от последнего звука человека до первого звука робота должно проходить меньше секунды. Пауза длиннее секунды в телефонном разговоре читается собеседником как обрыв связи — он говорит «алло», робот в этот момент начинает свою реплику, дальше идёт наложение, из которого разговор уже не выбирается. Ни один смысловой сценарий этого не компенсирует.
Ниже — из чего эта секунда складывается по участкам, три способа определять конец реплики и цена каждого, отдельный режим для диктовки цифр и адресов, модельный расчёт на потоке 3 000 звонков в месяц и восемь сценариев, которыми это проверяется на приёмке. Тема смежная с реальной точностью распознавания русской речи, но задача другая: там речь про то, что робот услышал, здесь — про то, когда он решил, что пора отвечать.
Почему пауза — это не конец фразы
Человек молчит не только тогда, когда закончил. Он молчит, пока вспоминает номер заказа, пока диктует адрес по частям, пока набирает воздух перед длинной фразой и пока ждёт, что собеседник подтвердит услышанное. Физически все эти паузы одинаковы — тишина в линии. Различить их можно только по контексту, а платформа по умолчанию смотрит исключительно на длительность.
Время непрерывного молчания, после которого система считает реплику законченной и начинает готовить ответ. Это единственная настройка, которая есть на любой платформе, и единственная, которую по умолчанию ставят одним значением на весь сценарий. Отсюда почти все жалобы на то, что робот не даёт договорить.
| Что происходит в разговоре | Типичная пауза внутри реплики | Что сделает порог тишины 600 мс |
|---|---|---|
| Обычная фраза: «мне нужно поменять время записи» | 150–350 мс | Дождётся конца — всё в порядке |
| Номер телефона, продиктованный по три-четыре цифры | 400–700 мс | Перебьёт примерно на середине номера |
| Адрес: улица, дом, корпус, квартира | 600–1 100 мс | Перебьёт почти всегда |
| Фамилия по буквам | 700–1 400 мс | Перебьёт и переспросит с первой буквы |
| Человек ищет номер заказа в почте или в сообщениях | 1 500–4 000 мс | Перебьёт и уйдёт в ветку «не расслышал» |
Отсюда первый практический вывод. Единый порог на весь сценарий — всегда компромисс не в вашу пользу. Поставите 600 мс — робот режет диктовку. Поставите 1 200 мс — он становится заметно медленным на коротких ответах «да», «нет», «второй пункт», а таких реплик в типовом сценарии больше половины. Настраивается не одно число, а карта порогов по репликам.
Горизонтальный график-диапазон: пять полос с типами реплик и длительностью пауз внутри них — обычная фраза 150–350 мс, номер телефона 400–700 мс, адрес 600–1 100 мс, фамилия по буквам 700–1 400 мс, поиск номера заказа 1 500–4 000 мс. Поверх полос вертикальная выделенная линия «порог тишины 600 мс»; видно, что четыре полосы из пяти её пересекают. Нижняя ось — миллисекунды в логарифмическом масштабе. Чертёжный стиль, все подписи по-русски.
Из чего складывается задержка ответа
Пауза перед ответом робота — не одно число, а сумма пяти участков. Разбирать её имеет смысл именно по участкам: подрядчик, который на вопрос о задержке отвечает «это модель такая», обычно просто не мерил.
| Участок | Типичная задержка | Чем сокращается |
|---|---|---|
| Звук от абонента до сервера и обратно | 80–150 мс | Площадка ближе к оператору связи, меньше перекодировок звука |
| Распознавание речи | 150–400 мс | Потоковый режим вместо распознавания файла целиком |
| Ожидание «человек договорил» | 500–1 200 мс | Свой порог под конкретную реплику, модель конца реплики |
| Обдумывание ответа | 300–1 500 мс | Короткая инструкция, кэш типовых ответов, малая модель на простых ветках |
| Синтез первого звука ответа | 150–400 мс | Потоковый синтез: озвучка начинается раньше, чем готова вся фраза |
| Итого до первого звука робота | 1,2–3,6 с | — |
Половину бюджета съедают два участка — ожидание конца реплики и обдумывание. Остальные три вместе дают от 380 до 950 мс. Это важно для приоритета работ: перевозить площадку ближе к оператору связи ради 50 мс бессмысленно, пока робот полторы секунды ждёт тишины. Про то, как выбирается модель под простые и сложные ветки, есть отдельный разговор — здесь достаточно правила: если ветка отвечает по справочнику, ей не нужна большая модель.
В телефонном разговоре человек ждёт ответа примерно 700–900 мс, после чего начинает считать, что связь пропала. Дальше он говорит «алло» ровно в тот момент, когда робот начинает реплику, — и разговор входит в наложение. Поэтому целевой показатель формулируется не как «быстро», а как конкретное число: медиана задержки меньше 1 секунды, и меряется она секундомером на 20 разговорах, а не на демонстрации в переговорной.
Горизонтальная схема из семи блоков со стрелкой слева направо: «Абонент говорит» → «Сеть и телефония 80–150 мс» → «Распознавание 150–400 мс» → «Ожидание конца реплики 500–1 200 мс» → «Обдумывание 300–1 500 мс» → «Синтез первого звука 150–400 мс» → «Абонент слышит ответ». Ширина блоков пропорциональна задержке, два средних блока выделены штриховкой. Под схемой шкала времени с отметкой «1 с — порог, за которым пауза читается как обрыв связи» и итоговой подписью «1,2–3,6 с».
Три способа определить конец реплики
Способов ровно три, и выбирают обычно не один, а комбинацию. Первый — порог тишины, в двух вариантах: общий на сценарий и свой на каждую реплику. Второй — модель, которая решает по смыслу и интонации, а не по длине паузы. Третий — разрешить человеку перебивать робота, чтобы цена ошибки в первых двух перестала быть фатальной.
| Подход | Как работает | Что стоит | Чем платите |
|---|---|---|---|
| Общий порог тишины | Ждёт заданное число миллисекунд молчания на всех репликах | Входит в любую платформу, настройка — часы | Одно значение на весь сценарий: либо режет диктовку, либо тормозит на «да» |
| Порог под каждую реплику | 500 мс на выбор пункта меню, 1 500 мс на диктовку адреса | 6–10 часов инженера на сценарий из 20 реплик | Переразмечать при каждой правке сценария |
| Модель конца реплики | Решает по смыслу и интонации: «улица Садовая, дом» — фраза не закончена | Есть не на всех платформах, добавляет 100–250 мс и отдельную строку в тарифе | Ошибается на односложных ответах и на плохой линии |
| Разрешить перебивать робота | Человек говорит поверх — робот замолкает на полуслове | Входит в платформу, требует настройки эхоподавления | Ложные срабатывания от шума: улица, радио в машине, телевизор |
Рабочая комбинация для большинства сценариев выглядит так: пороги под реплику как основа, разрешённое перебивание как страховка от слишком длинных реплик робота, модель конца реплики — только на тех вопросах, где ответ длинный и свободный по форме. Ставить модель на всё подряд дорого и бессмысленно: на реплике «нажмите или скажите один, два или три» она проигрывает обычному порогу в 400 мс. Отдельно стоит помнить, что длинные реплики робота — сами по себе источник перебиваний, и лечатся они сокращением текста, а не настройками; список типовых раздражителей мы собрали в материале про то, что умеет голосовой робот и где он раздражает.
Режим диктовки: цифры, адреса, фамилии
Отдельный режим для реплик, где человек диктует данные, — самая дешёвая и самая недооценённая настройка. Он включается не на весь звонок, а на конкретную реплику сценария и меняет сразу шесть вещей.
- 1Порог тишины поднимается до 1 500–2 000 мс. Только здесь: на соседней реплике он остаётся прежним.
- 2Перебивание на этой реплике выключается. Иначе шум улицы или чужая речь в фоне обрежут адрес на половине.
- 3Проверяется формат. Если ожидается 11 цифр, а пришло 7, робот продолжает слушать, а не переспрашивает с начала.
- 4Подтверждение идёт блоками. Робот повторяет услышанное частями — «Садовая, двенадцать» — и просит подтвердить одним словом, а не зачитывает весь адрес целиком в конце.
- 5Подключается словарь: улицы города, названия услуг, номенклатура. Именно на диктовке ошибки распознавания садятся плотнее всего, поэтому словарь важнее порога — без него правильно дослушанный адрес всё равно будет записан неверно.
- 6Задаётся выход. После двух неудачных попыток — перевод на человека или SMS со ссылкой на форму, но не третий круг того же вопроса.
Две колонки сравнения. Левая «Обычная реплика»: порог тишины 500–700 мс, перебивание разрешено, формат не проверяется, подтверждение не требуется, ожидаемый ответ — одно-два слова. Правая «Режим диктовки»: порог 1 500–2 000 мс, перебивание выключено, проверка формата (11 цифр в номере), подтверждение блоками, словарь улиц и номенклатуры, выход на человека после двух неудач. Под колонками подпись: «Разница только в настройках одной реплики, а не в платформе». Чертёжный стиль, подписи по-русски.
Сколько стоит настройка и что она возвращает
Модельная компания: служба доставки, голосовой робот на входящих принимает заказы и снимает очередь в пиковые часы. Поток — 3 000 звонков в месяц, из них 1 200 доходят до реплики, где клиент диктует адрес и состав заказа. Средний чек 2 400 ₽, маржа 30 %.
Соблазн считать эффект в минутах разговора обманчив. Лишние 1,3 секунды на каждую из шести реплик робота дают 7,8 секунды на разговор; на 3 000 разговоров это 390 минут и 1 404 ₽ в месяц при входящей минуте 3,60 ₽. Настройка за 90 000 ₽ такой экономией не окупится никогда. Деньги теряются не в минутах, а в заказах, которые не доехали до конца сценария.
Цифра 9 % вместо нуля здесь не осторожность, а факт: часть перебиваний остаётся всегда — люди делают паузы в четыре секунды, диктуют на фоне детского крика, кладут телефон на стол. Подрядчик, который обещает «робот перестанет перебивать», обещает то, чего не бывает; правильная формулировка в договоре — целевая доля перебиваний и медиана задержки, замеренные на согласованной выборке разговоров.
Восемь сценариев приёмки
Приёмка занимает около часа и делается тем сотрудником, который будет с роботом жить, а не тем, кто его настраивал. Настройщик подсознательно повторяет сценарии, которые уже работают. Звонить нужно с мобильного, а не через веб-виджет: половина проблем живёт именно в телефонной линии.
- 11. Длинная пауза внутри адреса
Диктуете адрес с паузой около 1,2 секунды между «дом» и номером дома. Робот обязан дождаться и не перебить. Это базовый сценарий, на котором отсеивается половина неготовых внедрений.
- 22. Поиск в почте
Говорите «секунду, сейчас найду» и молчите 6 секунд. Правильное поведение: робот ждёт, один раз мягко напоминает о себе и не кладёт трубку. Неправильное: уходит в ветку «я вас не расслышал» и начинает вопрос заново.
- 33. Односложный ответ
На закрытый вопрос отвечаете «да». Ответ робота должен начаться быстрее секунды. Если здесь пауза полторы секунды, порог стоит один на весь сценарий и подобран под диктовку — это чинится за несколько часов.
- 44. Шум на линии
Звоните с улицы или из машины с включённым радио. Проверяется поведение перебивания: робот не должен замолкать от чужой речи и музыки в фоне. Если замолкает — эхоподавление и порог громкости не настроены.
- 55. Перебивание
Начинаете говорить на второй секунде реплики робота. Он обязан замолчать примерно за 300 мс и начать слушать. Робот, который договаривает свою фразу до конца поверх человека, раздражает сильнее, чем робот, который медленно думает.
- 66. Фамилия по буквам
Диктуете редкую фамилию по буквам. Проверяются сразу три вещи: поднятый порог, подтверждение блоками и словарь. Ошибка здесь означает, что режим диктовки включён не на всех нужных репликах.
- 77. Двое на линии
Рядом с вами говорит второй человек. Проверяется, чью речь робот считает репликой и не смешивает ли он две дорожки в одну фразу. Для колл-центров и торговых залов это не экзотика, а норма.
- 88. Замер по секундомеру
Двадцать разговоров, в каждом фиксируется время от конца вашей реплики до первого звука робота. В акт идёт медиана, а не среднее: одно тридцатисекундное зависание среднее испортит, а медиану — нет.
Нарисованный лист протокола приёмки: таблица из восьми строк со сценариями — длинная пауза в адресе, поиск в почте, односложный ответ, шум на линии, перебивание, фамилия по буквам, двое на линии, замер по секундомеру. Три колонки: «что проверяем», «норма», «факт». В колонке «норма» читаются значения: «дождался», «меньше 1 с», «замолчал за 300 мс», «медиана по 20 разговорам». Внизу строка подписи и дата. Чертёжный стиль, подписи по-русски.
Если робот перебивает на чистой линии и при правильно подобранных порогах, дело не в очерёдности реплик, а в распознавании: движок отдаёт промежуточный результат как окончательный. Лечится это трактом записи и словарём, а не настройкой пауз — механику разбирали в статье про реальную точность распознавания русской речи. Признак ровно один: ошибки идут только на конкретных типах слов — числах, именах, номенклатуре, — а не равномерно по всему разговору.
Когда этим заниматься не надо
Настройка очерёдности реплик — работа на 30 часов и 90 000 ₽, и есть четыре ситуации, в которых мы сами советуем её не начинать.
- Поток меньше 600–800 звонков в месяц. На таком объёме под вопросом не пороги, а сам робот: обработанный им звонок выходит дороже дежурства по графику. Границы разобраны в материале про то, когда голосовой робот вредит — сначала решается этот вопрос, потом настройки.
- В сценарии нет диктовки. Если робот только здоровается, определяет звонящего и переводит на нужного человека, общий порог 700 мс закрывает вопрос за час работы. Карта порогов по репликам нужна там, где данные собираются голосом.
- Плохой тракт записи. Звонки из цеха, со стройки, из торгового зала с музыкой: сначала гарнитуры и двухканальная запись, потом пороги. На чистой записи с гарнитуры ошибок по словам 5–12 %, на телефонной линии — 14–22 %, и вторая цифра съедает любую настройку пауз.
- Разговор эмоциональный. Жалоба, долг, отказ, всё, что касается здоровья, — здесь проблема не в порогах и не решается ими. Такие темы роботу не отдают ни при каком качестве настройки.
- Платформа не показывает метрик. Если в отчёте нет времени от конца реплики до ответа и доли перебиваний, настраивать нечего: вы будете двигать числа вслепую и спорить с подрядчиком ощущениями. Наличие этих двух метрик — вопрос к платформе до подписания договора, а не после.
И общий вывод, который стоит держать в голове при выборе подрядчика. Красивый сценарий, умная модель и естественный голос — это то, что показывают на демонстрации; про голос у нас есть отдельный разбор — когда робота слышно и когда уже нет. Очерёдность реплик — то, что определяет, доживёт ли разговор до конца, и на демонстрации её не видно. Спрашивать на первом созвоне надо не про модель и не про тембр, а про две цифры: медиану задержки ответа и долю перебиваний на реальном потоке заказчика.
Робот проигрывает разговор не там, где не понял, а там, где не дал договорить.
