🔬🥲 CAFAS: как научить ИИ слышать эмоции в голосе и делать это легковесно
Голос выдаёт эмоции даже без слов: тон, темп, дрожь - всё это сигналы, которые слышит человек интуитивно. Наша задача - научить этому же нейросеть, причём так, чтобы для запуска модели не нужно было тратить кучу денег на аренду серверного GPU, а развернуть ее на обычном устройстве.
Наша команда представила новую архитектуру для распознавания эмоций в речи.
Современные SER-модели показывают хорошую точность, но платят за это огромным количеством параметров, становясь тяжёлыми и медленными. При этом большинство моделей опираются либо на акустические признаки (тон, частота), либо на семантические эмбеддинги из self-supervised моделей, но редко объединяют оба типа сигналов эффективно.
Наша архитектура CAFAS объединяет два потока информации через механизм cross-attention:
🎵 Акустическая ветка — MFCC-признаки проходят через специальный энкодер (LSTM + трансформер), который учит их «общаться» друг с другом;
🗣 Семантическая ветка — Wav2vec2.0 извлекает контекстуальные представления речи
🔀 Cross-Attention Fusion — запросы берутся из акустических признаков, а ключи и значения — из семантических, что позволяет модели выборочно подсвечивать релевантные детали
Дополнительно добавлен вспомогательный классификатор для более стабильного обучения.
📊 Немного сухих но показательных цифр
На датасете IEMOCAP (12 часов диалогов с аннотированными эмоциями) модель достигла:
✔️74.6% Weighted Accuracy, что делает модель конкурентной с современными аналогами;
✔️ Среди всех сравниваемых моделей CAFAS показал лучший показатель Unweighted Accuracy;
✔️ Всего 112 млн параметров, что почти в 3 раза меньше некоторых альтернатив (сравнимая модель с 317М параметров показывает похожую точность)
✔️ Латентность 24 мс на GPU, что для реальных приложений является практически мгновенным откликом
Модель показывает 91.87% точности лучшего бейзлайна, используя лишь 49.1% его параметров. Отдельно интересно: анализ attention-карт показал, что модель действительно «замечает» ключевые эмоционально нагруженные слова и игнорирует паузы, что делает её решения интерпретируемыми.
Применений этой модели может быть великое множество: от голосовых ассистентов до мониторинга психического здоровья - иными словами, везде, где нужно понимать не только «что» сказал человек, но и «как».
Если вы занимаетесь речевыми технологиями, обработкой аудио или HCI, мы открыты к коллаборации 🤝
🔬 Наш сайт
😌 Наш ТГ
Голос выдаёт эмоции даже без слов: тон, темп, дрожь - всё это сигналы, которые слышит человек интуитивно. Наша задача - научить этому же нейросеть, причём так, чтобы для запуска модели не нужно было тратить кучу денег на аренду серверного GPU, а развернуть ее на обычном устройстве.
Наша команда представила новую архитектуру для распознавания эмоций в речи.
Современные SER-модели показывают хорошую точность, но платят за это огромным количеством параметров, становясь тяжёлыми и медленными. При этом большинство моделей опираются либо на акустические признаки (тон, частота), либо на семантические эмбеддинги из self-supervised моделей, но редко объединяют оба типа сигналов эффективно.
Наша архитектура CAFAS объединяет два потока информации через механизм cross-attention:
🎵 Акустическая ветка — MFCC-признаки проходят через специальный энкодер (LSTM + трансформер), который учит их «общаться» друг с другом;
🗣 Семантическая ветка — Wav2vec2.0 извлекает контекстуальные представления речи
🔀 Cross-Attention Fusion — запросы берутся из акустических признаков, а ключи и значения — из семантических, что позволяет модели выборочно подсвечивать релевантные детали
Дополнительно добавлен вспомогательный классификатор для более стабильного обучения.
📊 Немного сухих но показательных цифр
На датасете IEMOCAP (12 часов диалогов с аннотированными эмоциями) модель достигла:
✔️74.6% Weighted Accuracy, что делает модель конкурентной с современными аналогами;
✔️ Среди всех сравниваемых моделей CAFAS показал лучший показатель Unweighted Accuracy;
✔️ Всего 112 млн параметров, что почти в 3 раза меньше некоторых альтернатив (сравнимая модель с 317М параметров показывает похожую точность)
✔️ Латентность 24 мс на GPU, что для реальных приложений является практически мгновенным откликом
Модель показывает 91.87% точности лучшего бейзлайна, используя лишь 49.1% его параметров. Отдельно интересно: анализ attention-карт показал, что модель действительно «замечает» ключевые эмоционально нагруженные слова и игнорирует паузы, что делает её решения интерпретируемыми.
Применений этой модели может быть великое множество: от голосовых ассистентов до мониторинга психического здоровья - иными словами, везде, где нужно понимать не только «что» сказал человек, но и «как».
Если вы занимаетесь речевыми технологиями, обработкой аудио или HCI, мы открыты к коллаборации 🤝
🔬 Наш сайт
😌 Наш ТГ