Довёл голосовой конвейер до средней задержки ответа ~850 миллисекунд – от конца фразы клиента до первого звука бота. Это уровень паузы живого собеседника: человек на том конце уже не успевает сказать «алло?».
Секрет не в «самой быстрой модели», а в том, что все этапы – распознавание, генерация, синтез – работают потоково и перекрываются: бот начинает говорить раньше, чем додумал ответ целиком. Подробный разбор с таблицей, куда уходит каждая миллисекунда, – в статье про голосовой стек и задержку 850 мс.