TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
SpeechAI Pro

30 Jul, 13:49

Telegram'da ochish Ulashish Shikoyat qilish

А вот забавная работа, уже на уровне самой задачи, которую пытаются решать - не видел раньше такого. Ниже авто-саммари:
**Идея.** Zero-shot TTS требует reference audio для клонирования голоса. Но что если есть только фото? (Исторические персоны, персонажи видеоигр.) F2S = Face-to-Speech: предсказывает правдоподобный голос из одного статичного фото лица.


**Архитектура.** Frozen StyleTTS 2 (генератор стиля/голоса не трогают) + легковесный Face Adapter, который берёт face-recognition фичи (из предобученной face-encoder) и мапит их в style-пространство StyleTTS. Upper blocks face-encoder'а софт-тюнятся; StyleTTS полностью заморожен.


**Результаты на LRS3** (TED-talk аудио+видео, held-out identities):


— UTMOS (натуральность): **3.7–4.0**, что **превышает ground truth (3.61)**


— Face-to-voice retrieval стабильно выше chance → голос узнаваемо соответствует лицу


— Голос консистентен с target speaker


— Бонус: adapter, обученный на английском, без ретрейна генерирует **фluent испанский** → face→style mapping language-agnostic


**Оговорки.** 5 страниц, workshop-уровень (IberSPEECH). «Plausible voice» — не «правильный голос этого человека» (это в принципе невозможно из фото), а правдоподобный. Но цифры сильные.
Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of...
Zero-shot text-to-speech (TTS) clones a voice from a short audio prompt, but this reliance on reference audio is a barrier when only visual information is available, e.g. for historical figures or...

142 0 4 1
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot