KORALLLL.AI


Гео и язык канала: Россия, Русский
Категория: Технологии


Новости, статьи и достижения в сфере ИИ с личной точки зрения начинающего исследователя

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


RuASD: датасет для детекции синтезированной речи на русском языке

Выложили RuASD - большой открытый датасет для исследования речевого антиспуфинга на русском языке.

В датасете собрана синтезированная речь от 37 систем синтеза и клонирования голоса: от open-source моделей до коммерческих API. В том числе мы генерировали данные через ElevenLabs, VK Cloud Voice и SaluteSpeech. В наборе данных примерно 700 часов синтетики и 235 настоящей речи из различных источников.

Также добавили реальную речь и набор искажений: шум, музыку, реверберацию и различные аудиокодеки.

На этом бенчмарке Spectra-0 показывает лучшие результаты среди сравниваемых моделей: EER 3.8% против 14.3% у ближайшей модели.

Предыдущие релизы из цикла антиспуфинга: Spectra-AASIST, LRLspoof, Spectra-0, AASIST3 interpretability

Ссылки:
🤗 https://huggingface.co/datasets/lab260/RuASD
😀 https://modelscope.cn/datasets/lab260/RuASD
❤️ https://arxiv.org/abs/2604.02374
😇 https://ieeexplore.ieee.org/document/11573975/








Эксклюзивно для подписчиков моего телеграмм канала в ближайший час будут выложены презентации сегодняшних спикеров с митапа


Отдельно я посмотрел статистику по авторам из российских организаций. Всего в выборку вошли 34 человека:

- Grach Mkrtchian и Kirill Borodin участвуют в трёх работах каждый;
- девять авторов в двух работах;
- 23 автора имеют всего по одной работе

Можно также выделить тематическое направление: как минимум три публикации напрямую посвящены deepfake- и spoofing-детекции. Кроме того, в программе представлены работы про большие аудиомодели, суперразрешение аудио, галлюцинации моделей, выразительную речь и технологии для языков с ограниченным количеством данных.

⚠️ Важно: это не официальная статистика Interspeech, а мой парсинг.


МТУСИ занял топ-1 по количеству публикаций на Interspeech в этом году среди российских организаций

Я решил посмотреть, как российские организации представлены в текущей программе Interspeech 2026. Вместе с кодексом спарсил программу конференции, собрал указанные у авторов аффилиации и проанализировал распределение публикаций по организациям и авторам.

В получившейся выборке МТУСИ занимает первое место: его представители участвуют в четырёх из 11 найденных работ от российских организаций.

Распределение по организациям выглядит так:

1) МТУСИ — четыре работы;
3) lab260, BitmanagerAI и ВШЭ — по три;
3) ИТМО и Salute — по две;
4) AXXX, Langswap, МИСИС, РАН, VK и Яндекс — по одной.

Больше половины работ (6/11) объединяют несколько организаций. В выборке хорошо заметны совместные проекты университетов, исследовательских лабораторий и индустриальных команд.

Например, три публикации ВШЭ выполнены с разными партнёрами: одна связана с МТУСИ, AXXX и РАН, другая с МИСИС, третья с VK. У Salute две публикации, над обеими работало общее ядро из шести авторов.


Респект от разработчиков из Visa

Да-да, мы делаем крутые модели и получаем письма от млщиков со всего мира. Относительно недавно получили такие приятные слова от разработчика из международного бигтеха. Это очень круто, я рад, что у нас получается строить такие нейросети.

Мне хотелось бы больше делиться такими моментами из работы ресерчером, поэтому буду пробовать постить чаще необычные и интересные кейсы


Приходите 10 августа, будем вас ждать)


Репост из: Сатуров строит команду
⚡️ 10 августа проводим в Москве первый Voice AI Dev Meetup.

Мы в Bitmanager.ai строим платформу для голосовых AI-агентов, поэтому много запариваемся над UX речевых интерфейсов. Тема бездонная, много сложной теории, которая конвертируется в практику через тернистый путь проб и ошибок. Об этом и поговорим.

Программу собирали с любовью. Выступают наши voice-инженеры, специалисты из VK и MWS, ресерчеры из lab260. Особенно жду доклад Кирилла Бородина: в этом году он отправляется в Сидней на Interspeech 2026 со своим пейпером.

Приходите, поговорим про войс. Участие бесплатное, но мест мало.

10 августа, 19:00, Москва, Никитский бульвар, 7Б, «Светлый лофт».

Смотрите программу и регистрируйтесь.


Репост из: GigaDev — разработка GigaChat
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥

Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах

Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026


GigaAM Multilingual
Расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский
🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder
🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+)

📖 arXiv
🤗
ai-sage/GigaAM-Multilingual
👩‍💻 salute-developers/GigaAM


GigaChat Audio
Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками
🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио
🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7 у Qwen3-Omni), распознавание эмоций Dusha 90%+
🔘 Представляем датасет TimeGround-1M — для обучения LLM привязке событий ко времени

📖 arXiv
🤗
ai-sage/GigaChat3.1-Audio-10B-A1.8B
🤗
ai-sage/TimeGround-1M


Попробовать в проде
Еще более мощные модели того же семейства доступны в наших сервисах:
🔘Обновленный GigaChat-Max-Audio — пользуйтесь на giga.chat и @gigachat_bot
🔘Распознавание на 5 языках — добавляйте в свои группы @smartspeech_sber_bot для распознавания голосовых


Что дальше
Проекту GigaAM уже третий год, и мы не перестаем его развивать: за последний квартал добавили таймстемпы для слов, конвертацию и запуск в Triton Inference Server, код дообучения под ваш домен и язык. Теперь выпустили в open-source и модель GigaChat-Audio, и уже обучаем следующий релиз. Следите за нашими обновлениями!


В прочем, я оказался прав


Репост из: datascience xc


Я бы даже поставил на две работы

GigaAM Multilingual: Foundation Model for Underrepresented Languages


Интересно, побьёт ли Виспер?


Предполагаю, что следующая статья сбер девайсов по аудио, будет по gigachat audio. Называться будет что-то вроде

GigaChat Audio: Time-aware Large Audio Language Model


Репост из: ФТИИ ИТМО
Статья студента ФТИИ — на Interspeech 2026 в Сиднее 🎉

Студент ФТИИ Иван Вяхирев стал соавтором научной статьи, которую приняли на Interspeech 2026, одну из главных мировых конференций по распознаванию и обработке речи (ранг A по рейтингу CORE). Проходить она будет в Сиднее, так что осенью Иван летит в Австралию ✈️

Статья — про галлюцинации Whisper. Это популярная модель распознавания речи, которая иногда «дописывает» слова, которых в аудио не было. Иван с соавторами разобрались, почему так выходит: с ростом размера модели её внутренние слои проходят фазовый переход — внимание перестаёт опираться на сам звук и начинает «сжимать» представление, отрываясь от акустики. Отсюда и выдуманные фрагменты.

Тема для команды не новая: сначала RASCAR представили постер про галлюцинации Whisper на летней школе AIRI, а теперь довели исследование до полноценной статьи на конференции уровня A.

Соавторы Ивана — Кирилл Бородин и Грач Мкртчян из МТУСИ. Препринт уже на arXiv: https://arxiv.org/abs/2604.08591

Поздравляем Ивана и желаем удачного выступления в Сиднее! 👏


А вот снизу наша работа, находится сейчас на CVPR - насколько мне известно топ-1 конфе по компьютерному зрению. В этом году она проходит Денвере.

К сожалению лично присутствовать у нас там не получилось, но мы познакомились с замечательными людьми, которые помогли нам разместить постер

Наша работа представлена снизу


Хет-трик.

Не могу не похвастаться. Прямо сейчас одна из наших работ представляется в Денвере. И только что мы получили аксепт по трём работам на Интерспич, который пройдёт в этом году в Австралии

А сами работы давно уже лежат на архиве и хаггинг фейсе

Балалайка
❤️https://arxiv.org/abs/2507.13563
🤗https://huggingface.co/collections/lab260/balalaika-dataset

LRLspoof
❤️https://arxiv.org/abs/2603.02364
🤗https://huggingface.co/datasets/lab260/LRLspoof

Теорема о Галлюцинациях в Виспере
❤️https://arxiv.org/abs/2604.08591

648 0 12 4 325

Работа по биометрии домашних животных на воркшопе CVPR

Раньше мы уже занимались человеческой биометрией: речевой и лицевой. В этой работе решили посмотреть на биометрию с другой стороны: не людей, а домашних животных.

Мы исследовали совместно с AvitoTech AI Lab задачу pet identification - поиск одного и того же питомца по разным данным. Важная особенность работы в том, что подход мультимодальный: мы используем не только изображения, но и текстовые описания. Это ближе к реальному сценарию, где у человека может быть фотография питомца, описание его внешности, особых примет или обстоятельств пропажи

Работу приняли на воркшоп CVPR FGVC13 - воркшоп про fine-grained visual categorization, где как раз важны тонкие визуальные отличия между похожими объектами.

Подобные методы могут помочь быстрее находить потерянных домашних животных, сопоставляя объявления, фотографии и описания между собой.

Ссылки:
🤪https://www.mdpi.com/2313-433X/12/1/30
🤗 https://huggingface.co/collections/AvitoTech/animal-identification


Комьюнити развивает Balalaika

На Hugging Face появился датасет paralingua_ru, построенный на базе Балалайки:

Что в нём есть:
1) разметка спикеров по паралингвистическим характеристикам: пол, возраст, высота голоса, тембр и голосовые особенности вроде «звонкий», «бархатный» и т.д.
2) TTS-промпты для аудио: 223 тыс. уникальных промптов на 355 тыс. аудиозаписей
3) промпты сгенерированы не просто шаблонами, а с учётом POS-теггинга, dependency parsing, лексического анализа и особенностей текста: прямой речи, пола персонажа, модификаторов речи и других деталей

Почему это важно?

Такой датасет может помочь TTS-моделям лучше понимать инструкции про голос, стиль и персонажа - особенно на русском языке. Ближайший план автора - дообучить инструктивный ТТС на части датасета и показать. что подход действительно работает.

Balalaika продолжает жить и развиваться силами комьюнити. Очень круто видеть, как открытые датасеты становятся основой для новых экспериментов.

Ссылка на датасет:
🤗 https://huggingface.co/datasets/turnipseason/paralingua_ru

Показано 20 последних публикаций.