GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥
Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах
Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям
Interspeech 2026GigaAM MultilingualРасширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский
🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на
2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder
🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+)
📖 arXiv
🤗 ai-sage/GigaAM-Multilingual
👩💻 salute-developers/GigaAMGigaChat AudioAudio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками
🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио
🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7 у Qwen3-Omni), распознавание эмоций Dusha 90%+
🔘 Представляем датасет
TimeGround-1M — для обучения LLM привязке событий ко времени
📖 arXiv
🤗 ai-sage/GigaChat3.1-Audio-10B-A1.8B
🤗 ai-sage/TimeGround-1MПопробовать в продеЕще более мощные модели того же семейства доступны в наших сервисах:
🔘Обновленный GigaChat-Max-Audio — пользуйтесь на
giga.chat и
@gigachat_bot🔘Распознавание на 5 языках — добавляйте в свои группы
@smartspeech_sber_bot для распознавания голосовых
Что дальшеПроекту GigaAM уже третий год, и мы не перестаем его развивать: за последний квартал добавили таймстемпы для слов, конвертацию и запуск в Triton Inference Server, код дообучения под ваш домен и язык. Теперь выпустили в open-source и модель GigaChat-Audio, и уже обучаем следующий релиз. Следите за нашими обновлениями!