приключения ноликов и единичек


Kanal geosi va tili: Rossiya, Ruscha
Toifa: Ta’lim


истории из жизни ноликов и единичек
состояние:
делаем лучший аудио рисерч
что-то ещё:
@theinformationman, @crescendocore

Bog‘liq kanallar

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


RnD ML Team dan repost
🎙 Full-duplex voice mode

Наша команда ведет исследования в речевых технологиях, и одна из задач, которую мы решаем — это создание полнодуплексного голосового режима. Это такой класс моделей, которые могут одновременно слушать и говорить, не разбивая диалог на последовательные вызовы.

В рамках прошедшей AI RnD Day наши ребята Артемий и Данило рассказали, как это всё устроено и куда движется мир.

📌 TLDR
Классический голосовой ассистент — это каскад ASR → LLM → TTS + VAD. Пользователь говорит, VAD ждёт конец реплики, ASR переводит речь в текст, LLM думает, TTS озвучивает ответ. Задержка у такой системы складывается из нескольких компонент, а диалог с моделью не нативен. Full-duplex устроен иначе: модель может слушать пользователя, говорить, реагировать на перебивания и менять свою реплику прямо во время разговора.

Главный вызов — сделать такую модель не только естественной, но и управляемой: задать ей роль, характер, голос и при этом не потерять качество основной LLM. А в самом продвинутом варианте добавить мультимодальность, ризонинг, тулколинг и прочий "обвес", включая опции для решения VLA-задач в роботах. 🤖

🧭 Откуда всё началось
В 2022-2023 году появились GSLM и AudioLM — работы, показавшие, что речь можно моделировать непосредственно аудио-токенами, без обязательного промежуточного текста.
В 2024 году Moshi от Kyutai сделал следующий шаг — открытая full-duplex модель, которая одновременно слушает и говорит, моделируя аудио пользователя и модели вместе с текстовым внутренним представлением. В начале 2026 появились подходы вроде PersonaPlex от NVIDIA 🖥 (надстройка над Moshi), где к full-duplex добавляется управляемость: текстовый prompt задаёт персонажа, а аудио-референс — голос.

А дальше индустрия начала двигаться к более общему подходу: разделению реалтайм взаимодействия и мышления на части. Эту идею, в частности, развивает Thinking Machines, стартап Миры Мурати.

⚙️ Что не так с обычным Full-duplex
Исходная модель действительно умеет разговаривать, но для продукта этого недостаточно: каждый запуск с новым голосом, персонаж и манера речи не фиксированы, нельзя задать бизнес-роль ассистента. И самое важное: модель "тупеет" при улучшении качества речи, и наоборот, а компромиссного варианта нет.
.
🧠 Thinker + Duplex Talker
Чтобы не заставлять одну модель делать всё сразу, мы перешли к тандемной архитектуре. Thinker — большая LLM, которая отвечает за содержание и сложный ризонинг. Duplex Talker — лёгкая RQ-трансформерная "говорилка", работающая в full-duplex режиме. Talker продолжает слушать и говорить в реалтайме, а Thinker своевременно подсказывает, что стоит сказать.

Ключевой момент — обмен идёт в общем текстовом домене. Благодаря этому основную LLM можно менять независимо от голосового слоя.

💡 Как работают подсказки
Мы не заставляем Thinker генерировать новый ответ на каждый аудиокадр. Для обучающих данных берём реплику пользователя и постепенно раскрываем её. На каждом этапе большая LLM предсказывает, что ответит второй участник диалога. Так формируется поток подсказок. Talker может начать отвечать раньше окончания фразы пользователя, а по мере появления нового контекста получать более точные подсказки.

📚 Как обучали
Обучение проходило в несколько этапов:
— text-to-text + TTS для связи текста и аудио
— естественные и синтетические диалоги
— system prompts и audio references
— симуляция hint stream от большой LLM
— синтетика, аугментации и дообучение под конкретные сценарии

В датасетах смешиваются TTS, естественные разговоры, синтетические диалоги, фактологические данные, voice-референсы и примеры работы с подсказками.

🔚 Выводы
Тандем Thinker + Duplex Talker позволяет разделить задачи и сохранить главное преимущество full-duplex-систем — realtime-взаимодействие без возврата к классическому каскаду. А в конечном счёте, он расширяется до нативной омнимодальности со всей мощью ризонинга, тулколинга и действий в среде.

🔗 Более подробно смотрите в презентации ребят (оставим в комментариях файлом) и в записи выступления (6:29 тайминг).

#speech #voice #fullduplex #paperwatch


это мои коллеги! 😎


поддерживаем и набираем ауру в выходные


RnD ML Team dan repost
🚀 AI R&D DAY — 17 сентября, Москва

3️⃣ Мы собираемся третий год подряд!
Ждём не только исследователей и инженеров, но и тех, кто переводит смелые идеи в реальные продукты: R&D-специалистов, AI-архитекторов, продактов и техлидов, отвечающих за внедрение технологий следующего поколения.

Наша R&D-команда поделится результатами флагманского проекта NextGenAI и расскажет о продуктах и технологических треках, над которыми мы работаем для развития ИИ следующего поколения. Также на конференции будут доклады, постеры и демо-стенды от наших коллег из Kandisnky, Physical AI, AIRI, Giga и других.

🔬 О чём:
— альтернативные архитектуры
— процессы обучения, инструменты и агенты
— омнимодальная долгосрочная память и ризонинг
— модальности и коммуникации
— бенчмаркинг, стандарты качества и производительности AI

🎯 Что вас ждёт:
— 22 доклада на двух сценах от ведущих специалистов
— живое общение с коллегами и экспертами
— интерактивные зоны, которые сделают день по-настоящему запоминающимся

Это шанс из первых уст узнать, над какими технологиями работают исследовательские команды Сбера сегодня, обсудить идеи и даже стать частью нашей команды! 💚

📍 Где: Москва (очно или онлайн)
⏰ Когда: 17 сентября
🎁 Цена: Участие бесплатное

Количество мест ограничено! 😉
Регистрация: https://airndday.ontico.ru/

#rndml #conference @rndml_team


приходите в гости 17 сентября!

коллеги будут рассказывать про управляемый FullDuplex.

кто такой этот полный дуплекс? а вот приходите, узнаете.


достал бутсы с гвоздей и сходил в Лужники поиграть в футбол.

планировал как Месси ходить пешком и включаться, но в защите. а в итоге назвали Иньестой и Райсом после разрезающей голевой через пол поля.

голова работает и хочет сделать красиво, но ноги пока подводят. на первый раз за не пойми какое время пойдёт.


сбылось, получается!


Фестиваль Motherland dan repost
В этом году мы отогнали обещанный ураган, вы выпили все брендированное пиво фестиваля за первые два часа, мы успешно пережили отключение электричества на Саммере из-за ливня, смотрели на нашу новую Ракушку (как будто она стала ещё краше), флексили на новых партнерских зонах, и, как обычно, слушали очень много музыки и радовались жизни

Вообще очень много ещё чего хочется сказать, но это позже

Пока что только

Спасибо вам

И до встречи




второй невероятный день motherland 2026

сначала о любимчиках:

улыбался, танцевал, потерял голос и был влюблён целый час жизни под hehehe 💔

планировал промокнуть под ливнем, а в итоге очень преисполнился энергией и танцами под Жанну Агузарову ИСПАНСКИЙ СТЫД (чаще их последнего альбома ничего не слушал в этом году, советую и вам)

а теперь странно специфично про всё остальное:

бит под поедание поке - какой-то список из пяти рэперов, я не знаю
пустил слезу, не зная ни одной песни - Конус Маха
светло-тёмные чувства - Settlers
вы не сможете меня переубедить, что они не вдохновлялись Blurryface и твп - uncle pecos
хедлайнеры мазерленда через год или два - хмыров
лучший фестиваль в лучшем городе на земле - Сироткин

заключение:

мазерленд как точка притяжения - заволакивает любимыми исполнителями, дополняя всё это каждый раз чем-то новым, что становится родным

мазерленд как точка отсчёта - закрывает один концертный год и открывает новый

в это раз было много любви и танцев, пусть и год будет таким

а количество счастливых людей на квадратный метр в очередной раз выросло в сравнении с прошлым годом

поэтому если это был последний фест в гпз-1, в новое место обязательно пойдём

а пока немного грусти, потом улыбнуться, начать отсчёт с нуля и заполнять пустоты музыкой и новыми концертами ❤️


фото для цифровых археологов и на случай деменции через пятьдесят лет


первый день матьземля 2026

самый клёвый сет - passmurny
перформанс - Хаски
раздали стиля - нееет, ты что
сто из ста - Порез на Собаке
в сердечке - Хадн Дадн
не сыграли ни одной любимой песни сестры - Перемотка


мы сегодня дома.




не поверите, приснился сегодня сон, как мы сходили на @motherland_fest 11-12 июля, а после него все вокруг говорили, что это были лучшие два дня этого лета. надеюсь, сбудется!



16 ta oxirgi post ko‘rsatilgan.