Озвучка начинается за 0,6 секунды

Если озвучка нужна для файла, скорость почти не важна: подождать три секунды и получить готовый WAV — нормально. А вот в разговоре пауза перед ответом слышна сразу. Собеседник не знает, думает робот или завис.
Что было и что стало
Раньше запрос к API отдавал первый звук примерно через 2,6 секунды. Сейчас — примерно через 0,6 секунды, и это почти не зависит от длины текста.
Разница не в том, что синтез стал вчетверо быстрее. Он начинает отдаваться до того, как готова вся фраза: первые слова уходят в эфир, пока движок доделывает остальное.
Почему так не было сразу
Причина оказалась не в мощности, а в режиме подачи. У нас два режима: быстрый — потоковый, и выразительный — он даёт более живую интонацию, но собирает фразу целиком и только потом отдаёт.
По умолчанию для API стоял выразительный. Логика была понятной: пусть звучит лучше. Но для интеграции это оказалось не тем выбором: разработчик подключает API, слышит секунды ожидания и решает, что сервис медленный.
Теперь для запросов по ключу API по умолчанию включён быстрый режим. Выразительный никуда не делся — он включается параметром, когда нужна именно подача, а не отклик.
Как проверить у себя
В ответе есть заголовок X-Tts-Timing — он показывает, сколько времени ушло на подготовку и сколько на сам движок. Если у вас задержка больше ожидаемой, по нему видно, где она возникла.
Важная тонкость при замере: не засекайте время до первого байта. Заголовки и служебная часть приходят почти мгновенно, а звук — позже. Мерить нужно до первого слышимого сэмпла, иначе цифра получится красивой и бесполезной.
Подробности параметров — в документации API. Голоса, пригодные для диалога, отмечены в каталоге.
Попробуйте сами — бесплатный стартовый пакет символов при регистрации.


