Все вокруг обсуждают голосовых ботов так, будто главное – какая модель распознавания или какой голос синтеза используется. За последний год я видел десятки предложений «сделаем бота за 15–20 тысяч» от людей, прошедших курс по no-code за выходные.
Технология давно не узкое место. Whisper, DeepSeek, Fish Speech – открытые модели, собрать конвейер может любой, кто умеет читать документацию. Узкое место – то, что происходит вокруг модели: сценарий диалога, который реально ведёт клиента к записи, а не зацикливается на «извините, не понял»; аналитика, которая показывает не «бот запущен», а p95 задержки, долю перебиваний и конверсию в целевое действие; интеграция с воронкой – CRM, календарь, оплата, – чтобы разговор заканчивался не «спасибо, передам менеджеру», а реальной записью.
Проверка простая: спросите у подрядчика не «какая модель», а «что бот делает, если клиент перебивает» и «что происходит с диалогом, если клиент молчит десять секунд». Если ответа нет – продают технологию, а не результат.
Без сценария и аналитики бот – игрушка с приятным голосом. С ними – инструмент, который приносит заявки, а не звучит красиво в демо.