Обсудить задачу
викиии · голос

Синтез речи (TTS)

Синтез речи, или TTS (text-to-speech) – озвучивание текста голосом. Современные модели не склеивают заранее записанные слова, а порождают звук целиком, поэтому речь получается слитной и с интонацией. Часть систем умеет клонировать голос: по короткому образцу воспроизводится тембр и манера конкретного человека. В голосовом боте это последнее звено – то, что слышит собеседник.

Где применяется: голосовые боты и автообзвон, озвучка роликов и обучающих курсов, объявления и автоинформаторы, доступность интерфейсов для незрячих, чтение статей вслух. Голос подбирают под задачу: для навигации и справок годится нейтральный диктор, для разговора с клиентом важнее живая интонация, чем идеальная дикция.

Что это даёт: озвучка перестаёт быть отдельным производственным этапом. Текст меняется – голос обновляется за минуты, без студии и повторной записи диктора, а язык и голос можно менять под аудиторию, не переснимая материал.

На что смотреть: в русском языке главная боль – ударения и омографы, где машина регулярно ошибается в словах вроде «замок» или «дорога», и такие места приходится размечать вручную. Эмоция пока даётся моделям хуже дикции: длинный текст звучит ровно и убаюкивает. И отдельный вопрос – право на голос: клонировать чужой тембр без разрешения человека нельзя.

связанные термины