Сбер выкатил новые опенсорс-модели - теперь со звуком:
1) Новая GigaChat Audio.
Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding (локализацию событий во времени), описание интервала аудио и суммаризацию с временными метками.
В комплекте идет датасет TimeGround-1M — для обучения LLM привязке событий ко времени.
📖 arXiv
🤗 ai-sage/GigaChat3.1-Audio-10B-A1.8B
🤗 ai-sage/TimeGround-1M
2) Обновление GigaAM Multilingual.
Расширение модели распознавания речи на казахский, киргизский, узбекский и английский.
📖 arXiv
🤗 ai-sage/GigaAM-Multilingual
👩💻 salute-developers/GigaAM
1) Новая GigaChat Audio.
Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding (локализацию событий во времени), описание интервала аудио и суммаризацию с временными метками.
В комплекте идет датасет TimeGround-1M — для обучения LLM привязке событий ко времени.
📖 arXiv
🤗 ai-sage/GigaChat3.1-Audio-10B-A1.8B
🤗 ai-sage/TimeGround-1M
2) Обновление GigaAM Multilingual.
Расширение модели распознавания речи на казахский, киргизский, узбекский и английский.
📖 arXiv
🤗 ai-sage/GigaAM-Multilingual
👩💻 salute-developers/GigaAM