Как устроены voice-2-voice модели: под капотом
V2V — это pipeline, где на входе и на выходе аудио, а не текст. Механически это близкий родственник языковых моделей: тот же принцип предсказания следующего токена, но токены описывают не символы, а фрагменты звука.
Ключевые компоненты:
- нейронные кодеки — превращают волну в дискретные звуковые токены и обратно;
- трансформеры — моделируют последовательность этих аудио-токенов;
- три принципиально разные архитектуры V2V, которые отличаются именно механизмом, а не маркетингом.
В продакшене (например, во внедрениях Newo.ai Давида Яна, создателя ABBYY) счёт идёт на миллисекунды, а неудачный тон ответа слышен в оттоке клиентов — поэтому важны стриминг и ограничения, а не только качество на демо.
Полный маршрут разбора: представления звука → три парадигмы → обучение → стриминг → ограничения. Для тех, кто знает API, GPU и трансформер, но не касался speech ML.
😎 — токены из звука, красиво
🤔 — три архитектуры, надо въехать
Источник: habr.com
@ai_for_dev
V2V — это pipeline, где на входе и на выходе аудио, а не текст. Механически это близкий родственник языковых моделей: тот же принцип предсказания следующего токена, но токены описывают не символы, а фрагменты звука.
Ключевые компоненты:
- нейронные кодеки — превращают волну в дискретные звуковые токены и обратно;
- трансформеры — моделируют последовательность этих аудио-токенов;
- три принципиально разные архитектуры V2V, которые отличаются именно механизмом, а не маркетингом.
В продакшене (например, во внедрениях Newo.ai Давида Яна, создателя ABBYY) счёт идёт на миллисекунды, а неудачный тон ответа слышен в оттоке клиентов — поэтому важны стриминг и ограничения, а не только качество на демо.
Полный маршрут разбора: представления звука → три парадигмы → обучение → стриминг → ограничения. Для тех, кто знает API, GPU и трансформер, но не касался speech ML.
😎 — токены из звука, красиво
🤔 — три архитектуры, надо въехать
Источник: habr.com
@ai_for_dev