А вот забавная работа, уже на уровне самой задачи, которую пытаются решать - не видел раньше такого. Ниже авто-саммари:
**Идея.** Zero-shot TTS требует reference audio для клонирования голоса. Но что если есть только фото? (Исторические персоны, персонажи видеоигр.) F2S = Face-to-Speech: предсказывает правдоподобный голос из одного статичного фото лица.
**Архитектура.** Frozen StyleTTS 2 (генератор стиля/голоса не трогают) + легковесный Face Adapter, который берёт face-recognition фичи (из предобученной face-encoder) и мапит их в style-пространство StyleTTS. Upper blocks face-encoder'а софт-тюнятся; StyleTTS полностью заморожен.
**Результаты на LRS3** (TED-talk аудио+видео, held-out identities):
— UTMOS (натуральность): **3.7–4.0**, что **превышает ground truth (3.61)**
— Face-to-voice retrieval стабильно выше chance → голос узнаваемо соответствует лицу
— Голос консистентен с target speaker
— Бонус: adapter, обученный на английском, без ретрейна генерирует **фluent испанский** → face→style mapping language-agnostic
**Оговорки.** 5 страниц, workshop-уровень (IberSPEECH). «Plausible voice» — не «правильный голос этого человека» (это в принципе невозможно из фото), а правдоподобный. Но цифры сильные.