MOSS-Audio
Открытая базовая модель для работы с аудио: речью, звуками, музыкой.
• распознаёт речь с привязкой ко времени
• анализирует эмоции и характеристики голоса
• разбирает фоновые звуки и контекст
• понимает музыку (стиль, динамику, инструменты) - кто там спрашивал про понимание музыки?
• отвечает на вопросы по аудио, делает резюме записей
• рассуждает в несколько шагов (chain‑of‑thought)
4–8B параметров (на базе Qwen3-4B/Qwen3-8B). Lо 70,80 на бенчмарках. Лучший CER в тестах ASR
Подойдёт для подкастов, транскрибации встреч, анализа аудиоконтента
Гитхаб
HF
Спасибо @EvgenyiPerm
#asr #alm #music2text #captioning #STT
Открытая базовая модель для работы с аудио: речью, звуками, музыкой.
• распознаёт речь с привязкой ко времени
• анализирует эмоции и характеристики голоса
• разбирает фоновые звуки и контекст
• понимает музыку (стиль, динамику, инструменты) - кто там спрашивал про понимание музыки?
• отвечает на вопросы по аудио, делает резюме записей
• рассуждает в несколько шагов (chain‑of‑thought)
4–8B параметров (на базе Qwen3-4B/Qwen3-8B). Lо 70,80 на бенчмарках. Лучший CER в тестах ASR
Подойдёт для подкастов, транскрибации встреч, анализа аудиоконтента
Гитхаб
HF
Спасибо @EvgenyiPerm
#asr #alm #music2text #captioning #STT