Обсудить задачу
викиии · модели

Fish Speech

Fish Speech – открытая нейросетевая модель синтеза речи (TTS) от команды Fish Audio с поддержкой мгновенного клонирования голоса: 10–30 секунд референсной записи – и модель говорит выбранным тембром и интонацией. Код и веса распространяются открыто (Fish Audio Research License), модель поддерживает несколько языков и обучена на сотнях тысяч часов аудио.

В отличие от классических дикторских TTS-голосов, Fish Speech и похожие модели этого поколения умеют отдавать синтез по частям в потоковом режиме – это делает их пригодными для голосовых ботов и другого real-time применения, где важна задержка первого звука.

связанные термины