SpeechAI Pro


Kanal geosi va tili: Rossiya, Ruscha


Технологии распознавания и синтеза речи, разработка, управление командами. Для связи - @vzaguskin

Bog‘liq kanallar

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


Коллега по предыдущей работе Саша опубликовал свой замечательный инструмент анализа качества распознавания и датасет аудио в телефонном канале, а также сравнение нескольких открытых моделей на этом датасете!
Инструмент крутой, нам очень помогал анализировать что конкретно происходит и показывать нашим потребителям. И хабростатья, кмк, хорошая получилась.


Тестирую очередную модельку ASR, задачка типичная - быстро и правильно получить гипотезу и отдать ее в ллм-ку.
Говорю ей в микрофон всякое, замеряю задержки. Вот эта галлюцинация сегодня сделала мой день. Оригинальный текст, думаю, все знают, его не привожу. А вот распознавание:
раз два три четыре пять.
вышел зайчик погулять.
вдруг охотник прибегает.
прямо в зайчика стреляет.
и в ахуе наблюдает зайчик.


А вот забавная работа, уже на уровне самой задачи, которую пытаются решать - не видел раньше такого. Ниже авто-саммари:
**Идея.** Zero-shot TTS требует reference audio для клонирования голоса. Но что если есть только фото? (Исторические персоны, персонажи видеоигр.) F2S = Face-to-Speech: предсказывает правдоподобный голос из одного статичного фото лица.


**Архитектура.** Frozen StyleTTS 2 (генератор стиля/голоса не трогают) + легковесный Face Adapter, который берёт face-recognition фичи (из предобученной face-encoder) и мапит их в style-пространство StyleTTS. Upper blocks face-encoder'а софт-тюнятся; StyleTTS полностью заморожен.


**Результаты на LRS3** (TED-talk аудио+видео, held-out identities):


— UTMOS (натуральность): **3.7–4.0**, что **превышает ground truth (3.61)**


— Face-to-voice retrieval стабильно выше chance → голос узнаваемо соответствует лицу


— Голос консистентен с target speaker


— Бонус: adapter, обученный на английском, без ретрейна генерирует **фluent испанский** → face→style mapping language-agnostic


**Оговорки.** 5 страниц, workshop-уровень (IberSPEECH). «Plausible voice» — не «правильный голос этого человека» (это в принципе невозможно из фото), а правдоподобный. Но цифры сильные.


Когда я только начал разбираться, что такое LLM агенты - я нашел очень интересный проектик AI meme arena. Сейчас он уже закрыт, но на тот момент - был конкурc с призами, компенсация расходов на LLM.
Я для этого конкурса сделал агента LOLgen и одноименного ботика в телеграм.
В отпуске было немного свободного времени, ну и разрабтку пет проектов сейчас можно делать посылая запросы через чат бота в гермес со смартфона.
Поэтому теперь у меня есть лолген v2. Больше шаблонов, лучше система промптинга, сабагенты оркестратора и цензора. Теперь в вк. (для генерации мема написать в личку сообщества)
Кмк, вполне забавно шутит на актуальные темы.


AI4Dev — AI for Development dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O


🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave




Nvidia выпустила cutile-rs и статью Fearless concurrency on GPU - dsl для написания кастомных куда ядер на rust с сохранением абстракций безопасного параллелизма из rust без потери производительности.
В целом, в топ компаниях курс на замещение C++ rust-ом продолжается, в том числе в AI-inference домене, думаю, песпективы языка - по прежнему неплохие.


В обучающей выборке для ребенка нашлась прекрасная актуалочка 😀


Коллега из Together AI рассказывает про голосовых агентв примерно то же, что и я недавно.
Из любопытного:
1. Многие их клиенты пытаются юзать speech-to-speech модели, но так и не справляются починить следование инструкциям и тул коллинг - и возвращаются на старый добрый конвеер.
2. Если модели в конвеере в разных геолокациях - это плюс 75мс на сетевой хоп, и суммируется по стадиям, в результате - все плохо.
3. На ллм они выделяют бюджет TTFT в 200-300 мс, что очень мало. Реально с этим справляются модельки в 8-30B параметров.
4. Turn detection - нерешенная проблема.

#voice #ai


В процессе написания небольшого ллм приложения гермес случайно отключил фильтрацию вывода промежуточных рассуждений у себя. Теперь я вижу как думает GLM 5 Turbo. Это очень забавно.
ФИНАЛЬНЫЙ ПЛАН:
1. [terminal] Проверить маркеры thinking у Qwen 3.6
2. [process kill] Убить старый сервер
3. [patch] Откатить enable_thinking=False
4. [patch] Добавить ThinkingFilter и использовать в stream/generate
5. [terminal background] Запустить сервер
6. [terminal] Подождать загрузки + протестировать

ОК. ДЕЙСТВУЮ. ПОЕХАЛИ. СЕЙЧАС. ПРАВДА. ДА. ОК. ПРИСТУПАЮ. НАЧИНАЮ. ВООБЩЕ ПРЯМО СЕЙЧАС. БЕЗ ДАЛЬНЕЙШИХ РАЗМЫШЛЕНИЙ. АКТИВИРУЮ.

АХАХАХ, лол. Ок, хватит. Просто делаю tool calls. Вот. Сейчас. Прямо. Без задержек. Моментально. Да. Вот.

1. terminal — проверить маркеры
2. process kill
3. patch — откат + ThinkingFilter

И потом 4-6. ОК. Поехали!!! ВОТ!!! СЕЙЧАС!!! ПРЯМО ПРЯМО ПРЯМО!!! ААААА!!! 😤

Глубокий вдох. Спокойно. Всё под контролем. У меня есть план. Он хороший. Я выполню его. Шаг за шагом. Без паники. Вот.


Калифорнийские коллеги задались вопросом - действительно ли т.н Audio LLM слушают аудио, или скорее распознают в текст, и потом читают?
Для этого собрали противоречивый датасет - например явно молдой человек говорит о том, как тяжело быть старым, человек с интонацией вверх говорит что у него сейчас интонация идет вниз, мужчина говорит что он женщина, собеседние номер 2 говорит что он собеседник номер 4 итп.
Дальше кормят этим все основные опенсорсные и коммерческие аудио ллм-ки и задают каверзные вопросы.
И меряют реальную точность ответов и точность относительно ответов на основе текста. Ну то есть в первом примере если модель сказала что собеседник молодой - это плюс в Ground Truth Accuracy, а если что старый - в Adversarial Label Agreement.
Ну и ожидаемо получили для всех моделей ALA » GT
На этом не остановились, нашди способ дотюнить Audio Flamingo нормально проходить этот бенчмарк.
#speech #llm #ai


AI4Dev — AI for Development dan repost
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, расскажет Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O

Когда?
Завтра, 26 мая, в 12:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Виктору!




Сегодня интересная работа - DuplexSLA, A Full-Duplex Spoken Language Model with
Synchronized Speech, Language, and Action Так же как в других полнодуплексных системах обрабатываются одновременно каналы юзера и ассистента в виде аудиотокенов, но добавляется отдельно текстовый канал действий.
Действия - бывают двух категорий.
1. События как в семантическом ваде - пауза, перебивание, либо бэкченеллинг. Последнее - это всякие угу, ага, хорошо - когда пользователь что-то сказал, но реагировать на это не нужно.
2. Вызовы инструментов. Если возврщать их в том же канале, где речь ассистента - это дополнительная задержка либо паузы, а в отдельном канале - можно в параллель.

Сделали свой бенчмарк, померились с опенсорсом и коммерческими апи. Заявлена точность вызова инструментов в 94%, на уровне gpt realtime и gemini-flash-live, но при этом задержка 300мс против >1с у конкурентов.

#voice #agents #realtime


Speechmatics померили свое и чужие решения на бенчмарке от pipecat.
Две наиболее важные метрики -
TTFS(Time to Final Segment) - время от реального конца речи до финальной гипотезы.
Semantic WER - насколько сохранился смысл высказывания.
Бенчмарк без жести, нету фоновой речи, телевизоров, криков животных. ПРосто человек говорит, а потом - тишина.
На таких примерах топовые системы дают 400мс задержки максимум и около 200 в медиане - это можно считать стандартом качества.
Хотя, конечно - на реальных телефонных разговорах было бы интереснее.
#stt #asr


А вот забавная идея - когда LLM хочет вызвать функцию - сказать ей вот тебе future, и если результат прям вот нужен уже - вот тебе инструмент await.
И внезапно, без дообучения моделей - тул колы страновятся асинхронными.
Заявляется ускорение 1.26× на BFCL, 1.44× на SWE-bench. Без изменения модели.


Исследования на тему потоковой обработки аудиопотока сразу LLM моделью без промежуточного перевода входа в текст - постепенно от единичных переходят к массовым. Вот интересная статья - в первую очередь там, что основательно сравнились со всеми основными решениями, реализованными ранее.
Технически - взяли два подхода к тому, как добавить аудиомодальность к заранее обученной тестовой ллм.
Концептуально похоже на moshi берутся токены ввода(аудио), тестовые и аудио токены ответа, выравниваются по времени, и на каждом шаге генерации - подается фьюжн всех трех через конкатенацию и проекцию(вариант 1) или через кросс-эттеншн(вариант 2).
Качество и скорость работы замерется на двух типах бенчмарков - 1. Понимание аудио и ответы на вопросы. 2. Полнодуплексные диалоги - обработка перебиваний, задержки перехода активной роли в диалоге, следование сценариям.
Первый способ лучше работает для бенчмарков на понимание, второй - на потоковых диалогах, но в целом - достойные результаты и там и там.
За основу взят Qwen 1.7, дополнительно Qwen 0.6 плюс токенизатор и вокодер из CosyVoice для TTS части, Whisper encoder для вместо-ASR части.
Код и веса, традиционно, обещают чуть позже.
Пока есть демо-страничка с одним примером.

#asr #tts #llm #ai #voice


OpenAI обновила свою линейку realtime api до версии 2.
Заявляется модель с ризонингом того же класса, как GPT5, нативно обрабатывающая аудио. Плюс вчетверо увеличился контекст и добавилось агентских способностей.
Дополнительно, появляется онлайн voice-to-voice переводчик и потоковый API виспера.
Крайне любопытно, появится ли последний в опенсорсе.
Про остальное в опенсорсе, думаю, еще пару лет можно не мечтать.

#ai #voice


Все-таки причина моих неудач с локальными агентами на моем железе - больше в моих руках, чем в недостатках нынешних технологий.
Сейчас на Mac M1 Pro 32Gb уже можно крутить вполне мощные модельки и они довольно шустрые, если правильно настроить.
Там довольно много тонкостей, и если просто написать клоду "засетапь мне квен на моем маке" - скорее всего, не сразу выйдет оптимально. Надо самому хоть что-то знать и задавать наводящие вопросы.
Но в итоге получилось примерно так. Наиболее подходящие модели - Qwen 3.6 35B - A3b или Gemma 4 27B-A4b. Движок для инференса - oMLX либо llama.cpp. Версии моделей- 4бит квантизация от unsloth. KV cache без квантизации, контекст в 131к токенов.
Для кодинга вполне можно nanocoder или oh my pi, последний - поприятнее. Сейчас играюсь с hermes, qwen в нем отвечает вполне шустро, и признаков интеллекта проявляет вполне достаточно.


В выходные решил поинраться со всякими альтернативными и локальными инструментами кодинга.
1. Порт агента pi на rust - не заработал, у меня виснет на выполнении bash каждый раз.
2. Надстройка над оригинальным pi под названием oh my pi - прекрасна. И визуально не хуже клода, есть mcp, скиллы, и при этом намного прозрачнее - рассказывает все, что делает. Сейчас пользуюсь ей, ностальгии по клоду не испытываю. Чистый pi не пробовал, том слишком много всего настраивать.
3. Локально запустил на маке Qwen-3.6-35B-A3B Q4 от unsloth, с тем же omp агентом. Неюзабельно, ну либо у меня руки не оттуда. Контекст больше 32К - не дождешься ответа. Префилл промта на 20К - две минуты. Дальше в принципе - отвечает шустро, но рассуждания зацикливаются. В общем в задаче "напиши клон ls на расте" - написал спеку, но так и не осилил выполнить даже первую таску. наверно его можно как-то дотюнить, параметры там, ризонинг отключить, чтобы он хоть что-то в итоге сделал. Но когда смотришь как в соседнем окне omp с glm-5-turbo фигачит по mvp-шке за полчаса - инвестировать в это время не хочется.
#agi

20 ta oxirgi post ko‘rsatilgan.