Публичные TTS-сервисы берут плату за каждый символ и получают ваш текст на входе — для приватного контента, ботов и потоковой озвучки это неудобно вдвойне. Синтез речи на сервере снимает оба ограничения: движок работает на вашем железе, текст никуда не уходит, а озвучка не тарифицируется по объёму. Разберём три рабочих движка — Piper, Silero и XTTS, — установку каждого и то, как обернуть синтез в API, которым пользуются приложения.
Подробнее →