Спрашивают, чем озвучивать короткие видео, если платить за подписку не хочется. Отвечаю тем же, чем пользуюсь сам.
Silero TTS – русская open-source модель, пятая версия. Ставится локально, весит около 140 МБ, крутится на обычном процессоре без видеокарты, интернет ей не нужен вообще. Пять живых голосов, сама расставляет ударения и разбирает омографы – те самые «зАмок» и «замОк», на которых спотыкаются бесплатные синтезаторы. Есть SSML: паузы, вопросительная интонация, скорость. Для рилсов этого хватает с запасом, а главное – файл получаете за секунды и в любом количестве, никаких лимитов на символы.
Второй вариант – edge-tts, голоса Microsoft. Ставится одной командой, озвучка тоже одной, голосов больше, звучат чуть мягче. У меня на нём работают голосовые ответы в телеграм-ботах – проверено на живой нагрузке. Тонкость: версия 7.2.8, на более старых серверная часть отвечает отказом.
Грабли, которые съедят вам вечер, если о них не знать. Первое: ударения в именах, названиях и числах всё равно проверяйте – «дОговор» в рилсе слышно моментально. Второе: не отдавайте синтезатору длинный абзац одним куском, режьте на короткие фразы – так вы управляете паузами, и речь перестаёт звучать как объявление на вокзале. Третье: ровная интонация – родовая черта бесплатных моделей, и лечится она не настройками, а монтажом: короткие реплики, музыка, смена планов.
Когда всё-таки стоит платить. Если нужен ваш собственный голос, эмоция или актёрская подача – тут бесплатные решения честно не тянут, и лучше взять сервис с клонированием. Во всех остальных случаях за пятнадцать минут вы получаете рабочую озвучку, которая ничем не хуже той, что вставляют в половину роликов в ленте.