Ии голоса за последние пару лет перестали быть роботами из навигатора. Настолько, что вопрос сместился: не «похоже ли на человека», а «сколько это стоит и что с задержкой».
Как это устроено внутри
Речь ии складывается из двух половин, и их постоянно путают. Первая – распознавание, когда звук превращается в текст. Вторая – синтез, когда текст превращается в звук.
Ии озвучка текста – это только синтез. Модель получает готовую строку и выдаёт аудио. Быстро, дёшево, предсказуемо.
Ии говорить в диалоге – это уже обе половины плюс логика между ними. Человек сказал, система распознала, поняла смысл, решила, что ответить, сформулировала и озвучила. Каждый шаг добавляет задержку, и именно сумма этих задержек определяет, будет разговор живым или мучительным.
Отсюда простое следствие: аудио ии для ролика и голосовой бот для телефона – это разные продукты с разной ценой, хотя на слух оба «говорят голосом».
Где голос уже применяют по делу
Приём звонков в нерабочее время. Самый частый запрос: клиент звонит в девять вечера, бот принимает заявку, утром менеджер перезванивает по готовому описанию.
Подтверждение записи и напоминания. Обзвон – скучная работа, которую никто не любит и все откладывают.
Первичная квалификация: узнать, что человеку нужно, и передать нужному отделу. Экономит время обеих сторон.
Озвучка обучающих материалов и инструкций. Здесь как раз хватает простого синтеза, и это самый дешёвый способ получить пользу от голоса.
Расшифровка встреч и диктовка. Обратное направление: голос превращается в текст. У меня есть проект, где человек наговаривает пять минут и получает готовую статью и посты под соцсети – работает на распознавании, а не на синтезе.
Чем говорят
Три разных подхода: чужой сервис, своя модель на сервере и локальная классика.
Тарифы проверял 2 августа 2026 – их меняют часто, так что перед работой загляните на сайт сервиса.
| сервис | что даёт бесплатно |
|---|---|
| ElevenLabs | Самая живая интонация из массовых. На бесплатном тарифе месячный лимит символов, коммерческое использование ограничено |
| Fish Speech | Открытая модель: ставится на свой сервер, умеет повторить голос по короткой записи. Платить не за что, но нужны видеокарта и вечер настройки |
| Silero TTS | Открытая русская модель, работает локально даже без видеокарты. Ставит ударения и не отправляет ваш текст наружу |
Почему голос сложнее переписки
В чате человек ждёт ответа спокойно: три секунды – нормально, можно и подумать. В телефонном разговоре те же три секунды воспринимаются как обрыв связи.
В переписке можно переспросить и уточнить без потерь. В разговоре каждое уточнение раздражает, потому что человек уже произнёс мысль и не хочет повторять.
Текст приходит уже готовым, а речь надо сначала распознать, и распознавание ошибается на шуме, акценте, именах и числах. Ошибка на входе тянет за собой неправильный ответ, даже если модель дальше отработала идеально.
Поэтому голосовые проекты требуют больше тестирования на живых людях и меньше веры в демонстрации. Красивое демо в тишине ничего не говорит о работе на улице.
Что спросить у подрядчика
Какая задержка от конца реплики человека до начала ответа. Правильный ответ – цифра в секундах, а не «быстро».
Что происходит при плохом распознавании. Правильный ответ – переспрашивает и подтверждает ключевые данные.
Как бот понимает, что человек договорил. Это отдельная инженерная задача, и если подрядчик о ней не думал – будет перебивать.
Можно ли поменять модель или голос без переписывания всего. Правильный ответ – да, это настройка, а не переделка.
С чего начать, если голос нужен впервые
Возьмите один тип звонка, самый частый и самый однообразный. Обычно это либо запись на приём, либо ответ на вопрос про цену и адрес.
Запишите пять реальных разговоров с этим сценарием. Не придуманных, а живых: там сразу видно, о чём люди спрашивают на самом деле и какими словами.
Прогоните сценарий на коллегах, прежде чем выпускать на клиентов. Половина неудобных мест ловится на первом же круге и правится за минуты.
И только потом подключайте телефонию. Порядок именно такой: сначала сценарий, потом техника, иначе будете чинить логику под давлением живого потока звонков.
Что выбрать под задачу
Нужен файл с озвучкой – берите бесплатные модели, я подробно писал, какие именно и на что смотреть. Тратить деньги здесь незачем.
Нужен голос в приложении или на сайте, без жёстких требований к скорости – подойдут облачные сервисы синтеза, платите за символы.
Нужен телефонный разговор – это разработка. Тестируя голосового агента на Яндексе, я сделал 55 замеров на трёх архитектурах, чтобы получить ответ за 0,4–0,5 секунды. Такие цифры из коробки не берутся.
Нужен ваш собственный голос – клонирование, отдельная история и отдельные деньги, плюс вопрос согласия того, чей голос клонируем.
Сколько это стоит
Озвучка текста – ноль рублей, если делать локально. Это не преувеличение: модель бесплатная, считает ваш процессор.
Голосовой бот – от 20 000 ₽ за ядро. В цену входит связка распознавания, логики и синтеза плюс один отлаженный сценарий.
Дальше растёт от интеграций и телефонии. Отдельно закладывайте доводку: голос капризнее текста, и первые две недели после запуска обычно уходят на правку формулировок и пауз.
Три ошибки, которые видно сразу
Первая – длинное приветствие. «Здравствуйте, вы позвонили в компанию, ваш звонок очень важен» – к концу этой фразы половина уже нажала отбой. Две секунды и по делу.
Вторая – попытка выдать бота за человека. Вскрывается почти всегда, и дальше клиент чувствует себя обманутым. Честное «я голосовой помощник, могу записать вас или соединить с менеджером» работает лучше.
Третья – бот, который умеет только один сценарий и на всё остальное отвечает непониманием. Лучше меньше веток, но с честным выходом на человека в каждой.
Что происходит после запуска
Первые две недели – это правки, и это нормально. Слушаете записи, находите места, где разговор буксует, меняете формулировки. Обычно после двадцати-тридцати реальных звонков сценарий устаканивается.
Дальше нужна регулярная проверка: раз в месяц послушать несколько разговоров. Люди меняют манеру спрашивать, появляются новые услуги, и бот тихо начинает отставать.
И считайте результат в тех же цифрах, что до запуска: сколько звонков принято, сколько дошло до записи, сколько ушло на человека. Без этого спор о пользе превращается в спор об ощущениях.
Грабли, на которые уже наступил
Люди прощают неидеальный тембр и не прощают задержку. Оптимизировать надо скорость, а не красоту голоса.
Имена, адреса и номера распознаются хуже всего. Их надо переспрашивать и подтверждать, иначе получите заявку на «улицу Ленинград» вместо «улицы Ленина».
Модель должна понимать конец реплики. Перебитый клиент – испорченный разговор, а слишком долгая пауза читается как обрыв связи.
И общее: сценарий важнее модели. В голосе это заметно сильнее, чем в переписке, потому что у человека нет времени переформулировать.
Вопросы и ответы
Чем распознавание отличается от синтеза?
Распознавание – звук в текст, синтез – текст в звук. Для диалога нужны оба плюс логика между ними.
Можно ли получить голос бесплатно?
Для озвучки текста – да, локальные модели бесплатны и работают без интернета. Для диалога по телефону – нет.
Насколько голос отличим от человека?
В коротких репликах почти неотличим. В длинных выдаёт ровная интонация, поэтому в сценариях лучше держать фразы короткими.
Сколько стоит голосовой бот?
От 20 000 ₽ за ядро, дальше по сценариям, интеграциям и телефонии.
Можно клонировать голос конкретного человека?
Технически да. Юридически нужно его согласие, и это не формальность.
Что быстрее окупается – озвучка или бот?
Бот, если у вас есть поток звонков. Озвучка экономит часы, бот – рабочие места на первой линии.
Расскажите, что должен делать голос: читать текст или разговаривать с клиентами. От этого зависит, обойдётесь вы бесплатной моделью или нужна разработка. Услуга «Голосовой бот» – от 20 000 ₽.