Qwen выпустила TTS, где голосом можно управлять как актером
Alibaba представила Qwen-Audio-3.1-TTS, модель синтеза речи с клонированием голоса и детальным управлением подачей. Поддерживает 16 языков, включая русский.
Главная фишка в том, что голосом можно управлять обычным текстом. Попросить говорить быстрее, тише, испуганно или как радиоведущий. Еще есть 86 тегов для смеха, вздохов, дыхания, пауз и других деталей.
Для клонирования достаточно примера голоса. Модель справляется даже с шумными записями и умеет сохранять тембр при переходе на другой язык.
Также Qwen генерирует до трех минут речи за один проход с качеством до 48 кГц.
Alibaba представила Qwen-Audio-3.1-TTS, модель синтеза речи с клонированием голоса и детальным управлением подачей. Поддерживает 16 языков, включая русский.
Главная фишка в том, что голосом можно управлять обычным текстом. Попросить говорить быстрее, тише, испуганно или как радиоведущий. Еще есть 86 тегов для смеха, вздохов, дыхания, пауз и других деталей.
Для клонирования достаточно примера голоса. Модель справляется даже с шумными записями и умеет сохранять тембр при переходе на другой язык.
Также Qwen генерирует до трех минут речи за один проход с качеством до 48 кГц.