Сервис работает в тестовом режиме — идёт бета-тестирование. Возможны ошибки.
Главная/Блог/Озвучка начинается за 0,6 секунды
Технологии

Озвучка начинается за 0,6 секунды

Г
Команда Голосаря26 августа 2026 · 4 мин чтения
Озвучка начинается за 0,6 секунды

Если озвучка нужна для файла, скорость почти не важна: подождать три секунды и получить готовый WAV — нормально. А вот в разговоре пауза перед ответом слышна сразу. Собеседник не знает, думает робот или завис.

Что было и что стало

Раньше запрос к API отдавал первый звук примерно через 2,6 секунды. Сейчас — примерно через 0,6 секунды, и это почти не зависит от длины текста.

Разница не в том, что синтез стал вчетверо быстрее. Он начинает отдаваться до того, как готова вся фраза: первые слова уходят в эфир, пока движок доделывает остальное.

Почему так не было сразу

Причина оказалась не в мощности, а в режиме подачи. У нас два режима: быстрый — потоковый, и выразительный — он даёт более живую интонацию, но собирает фразу целиком и только потом отдаёт.

По умолчанию для API стоял выразительный. Логика была понятной: пусть звучит лучше. Но для интеграции это оказалось не тем выбором: разработчик подключает API, слышит секунды ожидания и решает, что сервис медленный.

Теперь для запросов по ключу API по умолчанию включён быстрый режим. Выразительный никуда не делся — он включается параметром, когда нужна именно подача, а не отклик.

Как проверить у себя

В ответе есть заголовок X-Tts-Timing — он показывает, сколько времени ушло на подготовку и сколько на сам движок. Если у вас задержка больше ожидаемой, по нему видно, где она возникла.

Важная тонкость при замере: не засекайте время до первого байта. Заголовки и служебная часть приходят почти мгновенно, а звук — позже. Мерить нужно до первого слышимого сэмпла, иначе цифра получится красивой и бесполезной.

Подробности параметров — в документации API. Голоса, пригодные для диалога, отмечены в каталоге.

Попробуйте сами — бесплатный стартовый пакет символов при регистрации.

Г
Команда Голосаря