Легковесная full-band модель для шумоподавления и дереверберации
Большинство моделей speech enhancement решают только шумоподавление и работают с аудио 16 кГц. Исследователи НИУ ВШЭ и VK адаптировали архитектуру FSPEN для одновременного шумоподавления и дереверберации full-band аудио (48 кГц) — 95 тыс. параметров, RTF 0.11, качество шумоподавления на уровне ground truth.
В карточках кратко разбираем, что изменили в архитектуре, на каких данных обучали модель и каких результатов добились. Подробную статью читайте на Хабре.
#aivkhub #ml #звук
Большинство моделей speech enhancement решают только шумоподавление и работают с аудио 16 кГц. Исследователи НИУ ВШЭ и VK адаптировали архитектуру FSPEN для одновременного шумоподавления и дереверберации full-band аудио (48 кГц) — 95 тыс. параметров, RTF 0.11, качество шумоподавления на уровне ground truth.
В карточках кратко разбираем, что изменили в архитектуре, на каких данных обучали модель и каких результатов добились. Подробную статью читайте на Хабре.
#aivkhub #ml #звук