1. Главная
  2. Docs
  3. Глоссарий
  4. Синтез речи

Синтез речи

8

Синтез речи (TTS) — генерация устной речи из текста нейросетевой моделью. Практическая роль: превращает любой текстовый поток — от ответов бота до документации — в аудио без студии, диктора и перезаписи при каждом изменении текста.

Нейросетевой TTS против классического

Классика склеивала, нейросети генерируют. Конкатенативные системы собирали речь из записанных заранее кусков — отсюда металлический тембр и неестественные стыки: пауза не там, интонация не та. Современные модели синтезируют речь целиком, включая просодику — ритм, ударения, дыхание, затяжки звуков, поэтому на коротких фразах естественность неотличима от записи.

Семейство VITS — сквозная генерация. Модели этого семейства переводят текст в аудиосигнал одним проходом, без промежуточных стадий, и задают планку естественности; расплата — тяжёлый инференс и высокие требования к обучающим данным. Потоковые подходы генерируют аудио по мере поступления текста: первая фраза звучит почти сразу, что критично для диалога в реальном времени; старт звука укладывается в сотни миллисекунд.

Граница качества — конкретный жанр, а не «естественность вообще». Нейтральное чтение новостей или документации решено; длинное выразительное повествование с эмоциональной динамикой, пение, точная имитация конкретной манеры — слабые места, проверяемые на своём материале.

Клонирование голоса: возможности и границы

Сэмпл длиной в секунды. Современные модели клонируют тембр по короткой записи — типично 5–30 секунд чистой речи. Дальше модель читает этим голосом любой текст; перезапись диктора не нужна.

Клонируется тембр, а не человек. Похожесть обычно достаточна, чтобы знакомые узнали голос, но это не идентичная копия: манера пауз и интонационные привычки переносятся частично. Точность растёт с качеством и длительностью сэмпла, но побайтового совпадения не даёт ни одна модель.

Главный фактор — качество сэмпла. Фоновый шум, реверберация помещения, сжатие кодеком — всё это модель копирует вместе с голосом. Сэмпл с несколькими говорящими, музыкой или перекрытием речей даёт непредсказуемый результат: десять секунд чистой записи работают лучше минут телефонного шума.

Управление: паузы, ударения, эмоции

Стабильно: паузы и темп. Паузы по знакам препинания, явные паузы разметкой, скорость речи и громкость управляются надёжно и предсказуемо. Для большинства служебных сценариев этого достаточно.

Ударения — через словарь и разметку. Ошибки ударения — самая частая претензия к русскому TTS; лечится словарём исключений для домена (названия, фамилии, аббревиатуры) или разметкой в тексте. Числа, даты и сокращения разворачивает нормализация текста: «200 г» может стать и «двести грамм», и «двести года» — правильный выбор задаётся правилом или словарём, а не удачей.

Эмоции — выбор голоса, а не ручка. Стабильно работает переключение готовых пресетов: «спокойный», «бодрый», «сочувственный». Непрерывное управление эмоцией («на 30% веселее») — нет; попытки выжать интонацию знаками препинания дают ограниченный эффект.

Где TTS окупается в бизнес-процессах

Колл-центры и голосовые роботы. Интерактивные сценарии, ночные очереди, статусы заказов, первичная квалификация обращений. Экономика: синтез по факту дешевле студийной записи при частых изменениях сценариев; статичные ветки при этом остаются на записанных роликах — гибрид дешевле полного перехода.

Аудирование документации. Регламенты, инструкции, новости, обучающие материалы в аудиоформате: текст меняется — аудио пересобирается автоматически. Для материалов с высокой частотой правок это единственный способ держать аудиоверсию актуальной.

Доступность и локализация. Версии для слабовидящих, аудиоверсии публикаций, быстрое озвучивание переводов при наличии мультиязычных голосов. Обратная сторона голосового пайплайна — распознавание речи — разобрана в отдельной статье.

Правовые рамки и риски

Согласие владельца голоса обязательно. Клонирование голоса реального человека без согласия — от сомнительной практики до прямого нарушения: имитация в коммерческой записи, обман клиентов, присвоение репутации. Для голосов сотрудников и дикторов — письменное согласие с описанием применения; ответственность за синтетические голоса вендора распределяется договором.

Запрещённые применения. Обход голосовой аутентификации, выдача синтетического голоса за реального человека, мошеннические звонки, дискредитация. Внутренняя политика компании должна фиксировать список запрещённых сценариев явно, а не по умолчанию.

Дисклеймеры и маркировка. В телефонных сценариях слушатель обычно должен понимать, что говорит робот: колл-центры в большинстве юрисдикций обязаны представляться; требования к маркировке синтетического аудио ужесточаются — техническую возможность маркировки закладывают в пайплайн заранее.

Персональные данные. Записи с голосами сотрудников и клиентов — персональные данные; передача текстов и сэмплов в облачный TTS-сервис попадает под правила обработки ПДн — подробности в материале о передаче персональных данных в нейросеть.

Типичные ошибки

  • Сэмпл из телефона с шумом. Модель клонирует шум вместе с тембром; час подбора параметров не заменит одну чистую запись.
  • Сырой текст в синтез. Аббревиатуры, номера, даты и таблицы без нормализации читаются как попало; перед TTS ставят отдельный этап подготовки текста.
  • Гонка за эмоциями. Попытки выжать выразительность знаками препинания дают неестественные скачки; рабочий путь — выбор голоса и пресета.
  • Один голос на всё. Один тембр на IVR, обучающие ролики и рекламу снижает разборчивость сценариев разных жанров; обычно достаточно двух-трёх голосов на домен.
  • Нет прослушки на краю. Синтез стабильнее диктора, но не безошибочен: выборочная проверка краевых случаев — имена, суммы, номера — должна быть частью процесса.

Частые вопросы

Насколько похоже получается клонирование?

Знакомые обычно узнают голос; идентичность побайтово не достигается. Если нужна строгая узнаваемость в коммерческом продукте — закладывайте тест: слепое сравнение с исходником на своей аудитории.

Что важнее: длина сэмпла или его чистота?

Чистота. Десять секунд без шума и реверберации работают лучше минуты записи в кафе; длинный грязный сэмпл портит и тембр, и произношение.

Можно ли доверить TTS чтение чисел и сумм?

Только с настроенной нормализацией и словарём: суммы, даты, номера договоров — зона ошибок по умолчанию. Правила чтения задаются явно и покрываются автотестами.

Реально ли работать в реальном времени?

Да, потоковыми моделями: старт звука за сотни миллисекунд достаточен для диалога. Сквозные модели уровня VITS для реального времени тяжелее — их берут для офлайн-производства.

Обязан ли робот представляться роботом?

В телефонных сценариях в большинстве юрисдикций — да; в контентных сценариях требования к маркировке синтетического аудио растут. Проверяйте под свою юрисдикцию и фиксируйте в политике.

Дешевле ли TTS, чем диктор?

На статичных текстах часто нет: одна студийная запись живёт годами. Экономика появляется там, где текст меняется часто или вариантов текста много: персонализация, статусы, динамические сценарии.

Что почитать по теме