Обсудить задачу
статья · голосовой ии

ИИ-озвучка бесплатно: чем озвучиваю сам и где бесплатное упирается в потолок

коротко

Для разовой озвучки текста бесплатных инструментов хватает, я сам ими пользуюсь и ниже называю два конкретных. Потолок наступает там, где голос должен не читать, а разговаривать с человеком в реальном времени.

1 августа 2026·7 мин чтения·тема: голосовой ии

Ии озвучка бесплатно – запрос честный, и ответ на него тоже честный: да, можно, и результат будет приличный. Рассказываю, чем пользуюсь, а потом – где эта дорога заканчивается.

Два инструмента, которыми озвучиваю сам

Первый – Silero TTS, русская модель с открытым кодом, пятая версия. Ставится локально, весит около 140 МБ, работает на обычном процессоре: видеокарта не нужна, интернет тоже. Пять голосов, сама расставляет ударения и разбирает омографы – те самые «зАмок» и «замОк», на которых спотыкаются простые синтезаторы. Есть разметка для пауз, вопросительной интонации и скорости.

Сделать ии голос через неё – минуты. Лимитов на количество символов нет, потому что всё считается у вас на компьютере. Для озвучки роликов, обучающих материалов и внутренних записей этого хватает с запасом.

Второй – edge-tts, голоса Microsoft. Ставится одной командой, голосов больше, звучат мягче. У меня на нём работают голосовые ответы в телеграм-ботах, то есть проверено не на демо, а на живой нагрузке. Тонкость, которая съест вам вечер: нужна версия не ниже 7.2.8, на старых серверная часть просто отказывает.

Оба варианта дают ии голос бесплатно и без регистрации. Разница между ними – в мелочах: Silero не зависит от интернета, edge-tts звучит чуть живее.

Третий вариант, если этих двух мало и хочется свой голос, – Fish Speech. Тоже открытая модель, ставится на свой сервер и умеет повторить голос по короткой записи. Платить не за что, но понадобится видеокарта и вечер на настройку – это уже не «запустил за минуту».

Всё три проверял 2 августа 2026. Условия у открытых моделей меняются редко, но лицензию перед коммерческим использованием стоит перечитать на странице проекта.

Разница между озвучкой текста и голосовым ботом: текст на входе и аудиофайл на выходе против системы, которая слышит человека и отвечает за полсекунды – neurovod.ru
озвучка отдаёт файл, бот ведёт разговор

Что важно знать до того, как начнёте

Ударения в именах, названиях компаний и числах проверяйте руками. «ДоговОр» или «дОговор» в записи слышно моментально, и это единственное, что выдаёт дешёвую озвучку сильнее всего.

Не отдавайте синтезатору длинный абзац целиком. Режьте на короткие фразы: так вы управляете паузами, и речь перестаёт звучать как объявление на вокзале.

Ровная интонация – родовая черта бесплатных моделей. Лечится не настройками, а подачей: короткие реплики, смена темпа, музыка под фон.

Озвучка текста ии бесплатно хорошо работает на информационном материале и плохо – на эмоциональном. Реклама и художественное чтение по-прежнему требуют человека или платного клонирования голоса.

Где заканчивается бесплатное

Всё описанное выше – это озвучка. Текст на входе, аудиофайл на выходе. Совсем другая задача начинается там, где голос должен отвечать: человек позвонил, спросил не по сценарию, и ответ нужен через полсекунды.

Здесь нужен не синтезатор, а связка из трёх частей: распознавание речи, логика диалога и синтез. Каждая добавляет задержку, и вот с ней вся борьба. Я тестировал голосового агента на Яндексе: семь часов работы, 55 замеров, три разные архитектуры – и только после этого ответ стал укладываться в 0,4–0,5 секунды.

Отдельно я разбирал стек, который держит задержку около 850 мс: распознавание, модель для ответа и синтез речи, каждый компонент выбран под скорость. Ии голос онлайн из браузера так не умеет, и дело не в качестве голоса, а в архитектуре.

Из чего складывается задержка голосового бота: распознавание, логика ответа и синтез речи – neurovod.ru
три шага, из которых набегает задержка

Чем озвучивают

сервисы

Все три бесплатны по-настоящему, платить придётся временем на настройку.

Тарифы проверял 2 августа 2026 – их меняют часто, так что перед работой загляните на сайт сервиса.

сервисчто даёт бесплатно
Silero TTSОткрытая русская модель, работает локально даже без видеокарты. Ставит ударения и не отправляет ваш текст наружу
edge-ttsБесплатный доступ к голосам Microsoft из скрипта. Быстро и качественно, но версия нужна не ниже 7.2.8, иначе сервер откажет
Fish SpeechОткрытая модель: ставится на свой сервер, умеет повторить голос по короткой записи. Платить не за что, но нужны видеокарта и вечер настройки

Как понять, что вам нужен не синтез, а голосовой бот

Признак первый: вы хотите, чтобы система отвечала на входящие звонки. Синтез тут вообще ни при чём, это только последний шаг цепочки.

Признак второй: реплики зависят от того, что сказал человек. Заранее записать нельзя, потому что вариантов сотни.

Признак третий: важна задержка. Пауза дольше секунды в телефонном разговоре воспринимается как обрыв связи, человек начинает переспрашивать.

Если хотя бы два признака про вас – бесплатные синтезаторы задачу не решат, сколько их ни настраивай.

Сколько стоит голосовой бот и из чего складывается цена

Ядро – от 20 000 ₽. В него входит связка распознавания, логики и синтеза, один рабочий сценарий и тестирование на реальных фразах.

Дальше цена растёт от количества веток диалога и интеграций: посмотреть в CRM, проверить свободное время, записать клиента. Как и с текстовыми ботами, дорога не модель, а связки с вашими системами.

Отдельная строка – телефония. Бот должен куда-то звонить и откуда-то принимать звонки, и этот кусок обычно недооценивают при планировании.

И честное предупреждение: голосовой бот – самая капризная из всех ИИ-задач. Здесь больше всего мест, где всё разваливается по мелочи, поэтому закладывайте время на доводку, а не только на разработку.

Как звучит хороший сценарий разговора

Короткие реплики. Всё, что длиннее двух предложений, человек по телефону не дослушивает и начинает перебивать. Это не про красоту, а про то, дойдёт ли разговор до результата.

Один вопрос за раз. «Скажите ваше имя и удобное время» – и человек называет только время. Придётся переспрашивать, и разговор растягивается вдвое.

Подтверждение важного. Имя, адрес, номер и дату бот повторяет вслух: «записываю на вторник, четырнадцать часов, верно?». Распознавание ошибается именно здесь, и подтверждение спасает от неверной записи.

Быстрый выход на человека. Фраза «соединяю с менеджером» должна работать с первого раза и по любому поводу. Клиент, которого бот не отпускает, – это потерянный клиент и плохой отзыв.

Как проверить бота до запуска

Позвоните сами и говорите не по сценарию: с паузами, с «эээ», с уточнениями посреди фразы. Именно так разговаривают живые люди, а не так, как написано в тестовом диалоге.

Позвоните из шумного места. Улица, кафе, машина – три самых частых обстановки, и распознавание в них работает заметно хуже, чем в тишине кабинета.

Проверьте, что происходит при молчании. Человек отвлёкся на пять секунд – бот должен переспросить, а не завершить звонок.

И обязательно послушайте запись целиком, а не по кусочкам. Впечатление от разговора складывается из темпа, а его в отдельных репликах не видно.

Грабли, на которые уже наступил

Качество голоса почти не влияет на впечатление, а задержка влияет решающе. Люди прощают роботизированный тембр и не прощают паузу в две секунды.

Распознавание ошибается на именах, адресах и номерах. Эти места надо переспрашивать и подтверждать, а не надеяться на точность.

Бот обязан понимать, что человек закончил говорить. Звучит просто, а на практике это один из самых сложных кусков: перебьёте клиента – разговор испорчен.

И последнее: сценарий важнее модели. Я писал об этом отдельно, и в голосе это заметно ещё сильнее, чем в переписке.

Вопросы и ответы

Можно озвучить текст бесплатно и без ограничений?

Да. Локальная модель считает у вас на компьютере, лимитов на объём нет. Ограничение не в деньгах, а в задаче: получится файл, а не разговор.

Чем ИИ-озвучка отличается от голосового бота?

Озвучка превращает текст в аудио. Бот слушает человека, понимает смысл, решает, что ответить, и только потом озвучивает. Это три системы вместо одной.

Сколько стоит голосовой бот?

От 20 000 ₽ за ядро. Дальше зависит от числа сценариев, интеграций и телефонии.

Можно сделать бота своим голосом?

Это клонирование голоса, отдельная задача. Бесплатные решения её честно не тянут, нужен платный сервис или своя модель.

Какая задержка считается нормальной для телефона?

До секунды разговор ощущается живым. Полторы-две уже читаются как обрыв, человек начинает переспрашивать и раздражается.

А для роликов и обучающих материалов что взять?

Silero, если нужна независимость от интернета, или edge-tts, если хочется голос помягче. Обе бесплатные, обе рабочие.

автор – Семенов Евгений, Forward Deployed Software Engineer
статьи по теме

Читать дальше

все статьи →
Голосовой ИИ, Боты, Разработка

Голосовой бот с задержкой 850 мс: какой стек это выдерживает

Whisper + DeepSeek + Fish Speech: как потоковый конвейер отвечает быстрее оператора.

14 июля
Голосовой ИИ

ИИ-голоса: как работают и что выбрать

Озвучка текста и живой диалог по телефону – две разные технологии и два разных бюджета. Разбираю, где проходит граница.

2 августа
Приложения, Голосовой ИИ, Безопасность

Мессенджер Wildberries: разбор WB Chat

Wildberries открыл свой мессенджер без анонса. Разбираю, что он умеет, почему вход только через WB ID и стоит ли продавцам туда идти.

26 августа
кейсы по теме

Это уже работает

все кейсы →
голосовой ии · приложение

ExpertSpeech: голос эксперта → статьи

Наговорил пять минут – получил статью и посты под 9 соцсетей. Android + PWA из одной кодовой базы.

экспертыapp + PWASTT на CPU
голосовой ии · r&d

Голосовой агент Яндекс: 55 замеров, 3 архитектуры

Семь часов тестов, три способа собрать телефонного бота. Ответ за 0,4–0,5 секунды и вывод про конец реплики.

телефония0,4–0,5 с55 замеров
голосовой ИИ · омниканальность

Три канала обращений в одну воронку

Звонок, MAX и 1С-Коннект принимают заявки круглосуточно. Агент опознаёт клиента и сам выбирает систему: Service Desk на 1С или сделка в Битрикс24.

услуги3 канала24/7
лента по теме

Новости и посты

вся лента →
пост Самое недооценённое в голосовом боте – не модель и не голос пост ИИ-озвучка для рилсов: быстро и бесплатно новость Голосовой бот ужат до 850 мс задержки новость Sesame: голосовой ИИ, который на слух почти не отличить от человека
Именной сертификат курса «ИИ для новичков» – neurovod.ru
БЕСПЛАТНО
курс с сертификатом

ИИ для новичков

Семь коротких уроков с тестами: от «что такое ИИ» до первого собственного ИИ-помощника в вашем деле. Без воды и почтовых рассылок. В конце – сертификат.

Начать бесплатно