Обсудить задачу
викиии · голос

Распознавание речи (STT)

Распознавание речи, или STT (speech-to-text) – перевод звучащей речи в текст. Модель получает аудио, разбирает его на звуки и восстанавливает наиболее вероятную последовательность слов, опираясь ещё и на смысл фразы: именно поэтому она обычно правильно выбирает между похожими по звучанию словами. Это первое звено любой голосовой системы – всё, что происходит дальше, работает уже с текстом.

Где применяется: голосовые боты и телефония, расшифровка звонков и встреч, субтитры к видео, голосовой ввод в приложениях, контроль качества в колл-центре. Рядом со STT обычно стоят две соседние задачи – определить, что человек вообще начал и закончил говорить, и разделить запись по говорящим, если их несколько.

Что это даёт: звук перестаёт быть непрозрачным. Часы разговоров превращаются в текст, который можно искать, суммировать, отдавать модели на анализ и хранить структурировано. Ручная расшифровка часовой встречи занимает несколько часов, машинная – минуты.

Слабые места честнее знать заранее. Точность падает на шуме, дальнем микрофоне, сильном акценте и перебивании собеседников. Хуже всего распознаются как раз самые ценные слова: имена, названия компаний, адреса, артикулы и профессиональные термины – их обычно приходится подсказывать модели отдельным словарём. В живом диалоге важна ещё и задержка: текст, готовый через три секунды, для разговора уже поздно.

связанные термины