Современный синтез на длинной нейтральной фразе от диктора на телефонной линии практически неотличим. Полоса телефонного канала узкая, она съедает большую часть различий в тембре, а интонация в спокойном повествовании у хорошего движка уже ровная. Спотыкается синтез в четырёх конкретных местах — и именно они формируют у клиента ощущение «со мной говорит автоответчик».

Это хорошая новость с точки зрения бюджета: чинить надо не голос целиком и не платформу, а четыре типа фрагментов. Работа занимает около 12 часов и стоит порядка 36 000 ₽ — против 28 000 ₽ за студийную запись диктора, которая потом дорожает на каждой правке прайса.

Ниже — разбор этих четырёх мест, три инструмента исправления, расчёт года эксплуатации для сценария из 24 фраз и отдельно про то, почему делать голос неотличимым от человеческого — не та цель, к которой стоит стремиться. Смежная и более важная для качества разговора тема — очерёдность реплик и задержка ответа: робот, который перебивает, раздражает сильнее, чем робот с механическим голосом.

Четыре места, где синтез выдаёт себя

Ошибки синтеза не размазаны по речи ровным слоем — они собраны в четырёх типах фрагментов. Если разобрать 20 записей звонков и отметить моменты, где клиент переспросил или усмехнулся, почти все отметки попадут в эту таблицу.

Что произноситсяКак это звучитЧем чинится
Числа и суммы: 1 240 ₽, 15:30, заказ № 8842Не согласуется падеж и род: «одна тысяча двести сорок рубля»; номер заказа читается как одно длинное числоРазметка произношения: число пишется в шаблоне словами так, как должно звучать
Аббревиатуры: ООО, ПВЗ, КС-2, СБППо буквам там, где надо словом, и слитно там, где надо по буквамСловарь произношения, 30–80 позиций под конкретную компанию
Редкие фамилии, улицы, названия услугУдарение падает не туда, клиент поправляет робота вслухСловарь ударений, пополняется по жалобам и по расшифровкам
Извинение, отказ, сообщение о переносеРовная доброжелательная интонация на фразе про отмену заказаТолько ручная правка: фраза переписывается короче и суше

Четвёртая строка — единственная, которая не лечится словарями. Бодрая интонация на плохой новости воспринимается хуже, чем откровенно механический голос: человек слышит не робота, а безразличие. Практическое правило простое — на извинениях и отказах фразы делают короче, убирают из них вежливые обороты и не пытаются добавить теплоты.

сравнениеsintez-rechi-kogda-slyshno-robota--01
Четыре типа фрагментов речи и способ исправления для каждого

Сравнение в четыре строки, две колонки: слева «Что произносится», справа «Чем чинится». Строки: «Числа и суммы: 1 240 ₽» → «разметка произношения в шаблоне»; «Аббревиатуры: ООО, ПВЗ, КС-2» → «словарь произношения, 30–80 позиций»; «Редкие фамилии и улицы» → «словарь ударений»; «Извинение и отказ» → «ручная правка фразы, словари не помогают». Последняя строка выделена другим цветом и штриховкой. Чертёжный стиль, подписи по-русски.

Три из четырёх мест лечатся словарями, четвёртое — только переписыванием фразы

Три инструмента, которыми это чинится

Все три доступны на любой российской платформе синтеза и не требуют ни смены вендора, ни доработки движка. Это работа со сценарием, а не с технологией.

  1. 1
    Словарь ударений и произношения

    40–80 позиций под конкретную компанию: фамилии сотрудников, улицы города доставки, названия услуг и тарифов, аббревиатуры. Собирается за 3–4 часа по прайсу и справочнику адресов, дальше пополняется по жалобам клиентов и по расшифровкам разговоров.

  2. 2
    Разметка чисел прямо в шаблоне

    Суммы, даты, время и номера заказов пишутся в шаблоне так, как должны звучать: не «1 240 ₽», а «одна тысяча двести сорок рублей». Одна строка кода на шаблон, снимает большинство спотыканий и не ломается при смене движка синтеза.

  3. 3
    Ручная правка ключевых фраз

    Приветствие, представление, извинение, отказ и финальная фраза — 4–6 штук на сценарий. Их слушают вживую по телефону, а не в браузере, и переписывают, пока не начнёт звучать нормально. Это единственный этап, который нельзя ускорить.

Слушать надо в телефоне, а не в наушниках

Демонстрацию синтеза почти всегда показывают в браузере в широкой полосе — там всё звучит отлично. Реальный клиент услышит тот же голос через телефонный канал, где верхние частоты срезаны. Проверять правки надо звонком на свой мобильный: примерно треть замечаний к тембру исчезает после такой проверки, потому что в телефоне этой разницы просто не слышно.

Диктор, синтез или гибрид: год эксплуатации

Сравнивать по цене первой записи бессмысленно: разница там небольшая, а живут сценарии годами. Считать надо стоимость года, и главная статья в ней — правки. Прайс меняется, акции заканчиваются, адрес пункта выдачи переезжает; в среднем сценарий правят раз в месяц.

Сценарий из 24 фраз: первый год эксплуатации
Диктор: гонорар за сессию 18 000 ₽ плюс студия и сведение 10 000 ₽28 000 ₽
Диктор: 12 правок за год по 6 000 ₽ — минимальный заказ плюс сведение72 000 ₽
Диктор: суммарный простой сценария на старой цене, 12 правок по 3 рабочих дня36 рабочих дней
Синтез: словарь ударений на 60 позиций и разметка чисел в 24 фразах, 12 часов инженера по 3 000 ₽36 000 ₽
Синтез: 12 правок за год, по 40 минут на фразу вместе с прослушиванием в телефоне8 часов, 24 000 ₽
Синтез: простой сценария на старой цене0 дней — правка выкатывается в день внесения
ИтогоДиктор — 100 000 ₽ и 36 рабочих дней со старой ценой в эфире. Синтез — 60 000 ₽ и ноль дней простоя

Отдельной строкой сама озвучка не считается: у платформ обзвона синтез входит в минуту разговора и не выставляется в счёте отдельно. Ориентир по минуте — 3,60 ₽ на входящих и 5,00 ₽ на исходящих, и разница там почти целиком в телефонии, а не в голосе. Как складывается цена кампании целиком, разбирали в материале про исходящий обзвон роботом.

СвойствоДикторСинтезГибрид
Первая запись сценария из 24 фраз28 000 ₽, 3–7 рабочих дней36 000 ₽, 2 рабочих дня51 000 ₽, 5–8 рабочих дней
Правка одной фразы6 000 ₽ и 2–5 рабочих дней2 000 ₽ и 40 минутЗависит от того, в какую половину попала правка
Подстановка имени, суммы, датыНевозможна без синтезаШтатноШтатно, но со швом на стыке
Где слышно машинуНигдеЧисла, аббревиатуры, редкие имена, извиненияНа стыке записанного и синтезированного фрагментов
Что делать при смене диктора или голосаПерезаписывать весь сценарийПерегенерировать за часПерезаписывать записанную половину

Гибрид и его слабое место — стыки

Гибридная схема выглядит логично: постоянные фразы читает диктор, подстановки — имя, сумма, адрес — договаривает синтез. На практике она стоит дороже обоих чистых вариантов: студийная запись десяти постоянных фраз — 15 000 ₽, настройка синтеза на четырнадцати подстановочных — 24 000 ₽, сведение стыков и выравнивание громкости — ещё 12 000 ₽, итого 51 000 ₽ на старте. И приносит новую проблему. Записанный голос и синтезированный различаются тембром, темпом, уровнем громкости и акустикой помещения. В момент подстановки слышен шов — и звучит он хуже, чем ровный синтез от начала до конца, потому что до шва человек уже поверил, что говорит с живым сотрудником.

схема процессаsintez-rechi-kogda-slyshno-robota--02
Фраза робота из записанных и синтезированных фрагментов с отмеченными стыками

Схема одной фразы, разложенной на пять фрагментов в строку: «Здравствуйте, вас беспокоит компания» (диктор) — «Иванов Иван Иванович» (синтез) — «по заказу номер» (диктор) — «восемь тысяч восемьсот сорок два» (синтез) — «уточните, пожалуйста, адрес доставки» (диктор). Фрагменты диктора и синтеза заштрихованы по-разному, на четырёх границах между ними стоят вертикальные отметки «стык». Под схемой три подписи: «разный тембр», «разный темп», «разная громкость».

Шов слышен ровно там, где подставляется имя или сумма

Шов частично лечится: нормализация громкости до одного уровня, одинаковая длина пауз перед подстановкой, запись диктора в том же темпе, что и синтез. Полностью он уходит только при синтезе того же самого голоса — то есть при клонировании, и здесь начинается правовая часть вопроса. Практический вывод: гибрид имеет смысл там, где сценарий стабилен и подстановок одна-две, а не там, где в каждой фразе меняются суммы.

Чужой голос: согласие и обязанность представиться

Голос конкретного человека — его личное нематериальное благо, и синтезировать его копию без согласия нельзя, даже если запись этого голоса вы оплатили. Покупая студийную сессию, вы покупаете фонограмму, а не право сделать из неё голосовую модель. Это разные вещи, и путаница в них — самая частая правовая ошибка в проектах с гибридной озвучкой.

  • В договоре с диктором отдельным пунктом фиксируется право создать и использовать синтезированную копию голоса: срок, территория, перечень сценариев, запрет на передачу третьим лицам. Без этого пункта запись у вас есть, а модели голоса — нет.
  • Голос сотрудника — то же самое, даже если сотрудник согласился устно и с энтузиазмом. Согласие оформляется письменно и отзывается: при увольнении вопрос «а голос остаётся?» лучше решить заранее, чем через полгода.
  • Голос клиента в сторону синтеза вообще не идёт. Если голос используется для установления личности звонящего, он становится биометрическими данными с отдельным режимом — эту границу мы разбирали в материале про то, как предупреждать о записи разговора.
Неотличимость — не цель проекта

По состоянию на сентябрь 2026 года собеседник должен понимать, что говорит с машиной, а с 1 сентября 2026 года действует регулирование, требующее маркировать ИИ-контент — что именно и как помечать, разбирали отдельно. Отсюда неудобный для продавцов синтеза вывод: сколько бы вы ни вложили в естественность голоса, первая фраза всё равно сообщает, что говорит робот. Поэтому бюджет разумнее тратить на разборчивость, темп и корректное произношение имён, а не на попытку выдать машину за человека.

Когда за естественность голоса платить не надо

Есть четыре ситуации, в которых вложение в качество озвучки не возвращается ничем и деньги правильнее потратить на другое.

  • Короткие служебные сценарии. Напоминание о записи, подтверждение доставки, напоминание об оплате — три-четыре реплики, где важны разборчивость и темп, а не тембр. Базового синтеза со словарём хватает полностью.
  • Обзвон холодной базы. Если восемь абонентов из десяти кладут трубку на второй секунде, они не успевают оценить голос. Работать надо над первой фразой и над качеством базы, а не над интонацией.
  • Часто меняющийся сценарий. Прайс правится еженедельно, акции живут по две недели — здесь любая запись диктора превращается в постоянную статью расходов и в отставание сценария от реальности на несколько дней.
  • Ограниченный бюджет на голосовой проект. Если выбирать между 90 000 ₽ на очерёдность реплик и той же суммой на тембр, первое даёт заметно больше: робот, который перебивает клиента на середине адреса, теряет заказы, а робот с механическим голосом их только слегка портит.

Общее правило звучит так. Синтез в 2026 году — уже решённая задача в той части, которая касается длинных нейтральных фраз, и нерешённая в той, которая касается чисел, имён и плохих новостей. Первое покупается вместе с платформой, второе делается руками за 12 часов. Всё, что дороже этого, обычно продаётся под словом «естественность» и проверяется одним вопросом: что именно в разговоре изменится для клиента.

Клиента раздражает не механический голос, а машина, которая делает вид, что она человек.