Видео недоступно для предпросмотра
Смотреть в Telegram
Talk-llama-fast 2 - перезапуск на питоне
Я начал переносить свой проект говорящего аватара с C++ на питон.
Сборка на видео:
- Whisper.cpp streaming, large-q4
- llama.cpp server
- gemma4-31b-q4
- omnivoice TTS + omnivoice-server
- основное приложение на питоне.
- wav2lip липсинк (пока нету).
- Всё это влазит на одну 3090.
- Текущая задержка от голоса до голоса - 4 секунды, возможно, удастся сократить до 3-х. На 5000 серии будет быстрее.
- ГУЙ пока не планируется, ставка на голосовое общение, но ввод с клавиатуры тоже есть.
- Можно поставить любую ЛЛМ, хоть локальную, хоть Claude Opus.
Всё будет в опенсорсе, как и раньше. Выкладывать буду модулями.
Сегодня выкладываю модуль whisper.cpp-streaming. До этого я быстро пробежался по конкурентам типа whisperX, faster whisper и t-one ASR. У всех есть свои плюсы, но я решил пока остаться на проверенном ранее решении. Меня оно устраивает по скорости и жрёт менее 1 гига VRAM. Чистая задержка без VAD - 300мс, вместе с vad - 700мс на коротких фразах.
Код и exe для whisper-streaming CUDA. Для других платформ - сами скомпилируете.
https://github.com/Mozer/whisper.cpp-streaming/releases/tag/0.0.1
Уже пару недель играюсь с голосовым ассистентом на gemma4-31b-q5, у нее очень классный русский язык, знает современный сленг. Цепляю беспроводные наушники, хожу по квартире, занимаюсь своими делами и болтаю о чем угодно. Качество распознавания меня устраивает.
Следующим модулем выложу свою чуть модифицированную версию omnivoice. У меня на 3090 задержка - 1с. Юзеры в чате с 5000 серией говорят, что у них задержка до 0.5с
Я начал переносить свой проект говорящего аватара с C++ на питон.
Сборка на видео:
- Whisper.cpp streaming, large-q4
- llama.cpp server
- gemma4-31b-q4
- omnivoice TTS + omnivoice-server
- основное приложение на питоне.
- wav2lip липсинк (пока нету).
- Всё это влазит на одну 3090.
- Текущая задержка от голоса до голоса - 4 секунды, возможно, удастся сократить до 3-х. На 5000 серии будет быстрее.
- ГУЙ пока не планируется, ставка на голосовое общение, но ввод с клавиатуры тоже есть.
- Можно поставить любую ЛЛМ, хоть локальную, хоть Claude Opus.
Всё будет в опенсорсе, как и раньше. Выкладывать буду модулями.
Сегодня выкладываю модуль whisper.cpp-streaming. До этого я быстро пробежался по конкурентам типа whisperX, faster whisper и t-one ASR. У всех есть свои плюсы, но я решил пока остаться на проверенном ранее решении. Меня оно устраивает по скорости и жрёт менее 1 гига VRAM. Чистая задержка без VAD - 300мс, вместе с vad - 700мс на коротких фразах.
Код и exe для whisper-streaming CUDA. Для других платформ - сами скомпилируете.
https://github.com/Mozer/whisper.cpp-streaming/releases/tag/0.0.1
Уже пару недель играюсь с голосовым ассистентом на gemma4-31b-q5, у нее очень классный русский язык, знает современный сленг. Цепляю беспроводные наушники, хожу по квартире, занимаюсь своими делами и болтаю о чем угодно. Качество распознавания меня устраивает.
Следующим модулем выложу свою чуть модифицированную версию omnivoice. У меня на 3090 задержка - 1с. Юзеры в чате с 5000 серией говорят, что у них задержка до 0.5с