TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
ML Underhood

23 Jul, 12:31

Открыть в Telegram Поделиться Пожаловаться

Scalable Keyword Spotting via Modular Network Expansion

Сегодня рассказываем о статье от команды технологий голосового ввода Яндекса. Работу приняли на конференцию Interspeech 2026, которая пройдёт с 27 сентября по 1 октября в Сиднее.

Авторы предложили новый способ обновлять набор голосовых команд в умных устройствах без забывания уже известных. Наш коллега Виктор Хаймоненко рассказал о методе подробнее.

Чтобы расширить набор команд, поддерживаемых устройством с голосовым управлением, нужно дообучить модель распознавания речи. Но есть проблема: часто такие модели забывают команды, которые уже знали, или начинают хуже понимать их. Это называют catastrophic forgetting.

Есть методы непрерывного обучения, например EWC (elastic weight consolidation), которые уменьшают эффект, но не устраняют его полностью. В работе предложили другой подход — модульное расширение модели. Он хорошо решает проблему и при этом требует меньше вычислительной мощности, чем те же LoRA и адаптеры.

Предлагается не менять всю работающую нейросеть, а просто добавлять к ней компактный модуль, отвечающий за распознавание новых команд. Эта ветка использует промежуточные признаки, которые извлекает основная модель, но имеет собственный классификатор для новых команд. При этом параметры базовой модели остаются неизменными, поэтому результаты её работы для старых команд не страдают.

Новый метод требует небольшого увеличения размера нейросети. Общее количество дополнительных параметров — не больше 10% от числа параметров изначальной модели.

Эффективность проверили на открытом датасете Google Speech Commands. В экспериментах модель должна была выучить новые пары команд и при этом продолжить поддерживать старые. Метод снизил среднюю долю пропущенных новых команд (FRR) с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера и превзошёл методы адаптеров и LoRA.

Для сравнения, при обычном полном дообучении всей модели она хорошо усваивала новые команды, но гораздо хуже распознавала старые: средняя доля пропущенных известных команд выросла с 2,71% до 69,08%.

Об особенностях процесса обучения и том, как обходили ограничения, рассказали на Хабре.

ML Underhood

1.8k 2 19 44
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot