TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
iMak AI Lab

31 Jul, 12:49

Открыть в Telegram Поделиться Пожаловаться

🔬🥲 CAFAS: как научить ИИ слышать эмоции в голосе и делать это легковесно

Голос выдаёт эмоции даже без слов: тон, темп, дрожь - всё это сигналы, которые слышит человек интуитивно. Наша задача - научить этому же нейросеть, причём так, чтобы для запуска модели не нужно было тратить кучу денег на аренду серверного GPU, а развернуть ее на обычном устройстве.

Наша команда представила новую архитектуру для распознавания эмоций в речи.

Современные SER-модели показывают хорошую точность, но платят за это огромным количеством параметров, становясь тяжёлыми и медленными. При этом большинство моделей опираются либо на акустические признаки (тон, частота), либо на семантические эмбеддинги из self-supervised моделей, но редко объединяют оба типа сигналов эффективно.

Наша архитектура CAFAS объединяет два потока информации через механизм cross-attention:
🎵 Акустическая ветка — MFCC-признаки проходят через специальный энкодер (LSTM + трансформер), который учит их «общаться» друг с другом;
🗣 Семантическая ветка — Wav2vec2.0 извлекает контекстуальные представления речи
🔀 Cross-Attention Fusion — запросы берутся из акустических признаков, а ключи и значения — из семантических, что позволяет модели выборочно подсвечивать релевантные детали

Дополнительно добавлен вспомогательный классификатор для более стабильного обучения.

📊 Немного сухих но показательных цифр

На датасете IEMOCAP (12 часов диалогов с аннотированными эмоциями) модель достигла:
✔️74.6% Weighted Accuracy, что делает модель конкурентной с современными аналогами;
✔️ Среди всех сравниваемых моделей CAFAS показал лучший показатель Unweighted Accuracy;
✔️ Всего 112 млн параметров, что почти в 3 раза меньше некоторых альтернатив (сравнимая модель с 317М параметров показывает похожую точность)
✔️ Латентность 24 мс на GPU, что для реальных приложений является практически мгновенным откликом

Модель показывает 91.87% точности лучшего бейзлайна, используя лишь 49.1% его параметров. Отдельно интересно: анализ attention-карт показал, что модель действительно «замечает» ключевые эмоционально нагруженные слова и игнорирует паузы, что делает её решения интерпретируемыми.

Применений этой модели может быть великое множество: от голосовых ассистентов до мониторинга психического здоровья - иными словами, везде, где нужно понимать не только «что» сказал человек, но и «как».

Если вы занимаетесь речевыми технологиями, обработкой аудио или HCI, мы открыты к коллаборации 🤝

🔬 Наш сайт
😌 Наш ТГ

407 0 2 10
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot