Репост из: Neurogen
Supertonic V3
Обновленная TTS, без api и лишних задержек. Синтез речи, работает локально через ONNX Runtime без отправки данных наружу, с упором на приватность, скорость и минимальные требования к железу
Поддерживает 31 язык, использует открытую модель на 99M параметров, выдает аудио 44.1 kHz и умеет добавлять expression tags вроде смеха и дыхания, чтобы речь звучала живее
Плюс у него есть SDK сразу для Python, Node.js, браузера через WebGPU, Java, C++, C#, Go, Swift, iOS, Rust и Flutter
Инструмент интересный, для локалок зайдет отлично думаю, особенно где офлайн режим нужен и быстрый отклик
Чтоб попробовать просто качаем Python SDK через pip install supertonic, а модель при первом запуске подтянется автоматически
https://github.com/supertone-inc/supertonic
Делаем портативку?
Обновленная TTS, без api и лишних задержек. Синтез речи, работает локально через ONNX Runtime без отправки данных наружу, с упором на приватность, скорость и минимальные требования к железу
Поддерживает 31 язык, использует открытую модель на 99M параметров, выдает аудио 44.1 kHz и умеет добавлять expression tags вроде смеха и дыхания, чтобы речь звучала живее
Плюс у него есть SDK сразу для Python, Node.js, браузера через WebGPU, Java, C++, C#, Go, Swift, iOS, Rust и Flutter
Инструмент интересный, для локалок зайдет отлично думаю, особенно где офлайн режим нужен и быстрый отклик
Чтоб попробовать просто качаем Python SDK через pip install supertonic, а модель при первом запуске подтянется автоматически
https://github.com/supertone-inc/supertonic
Делаем портативку?