Как поставить друзей в дискорде на запись
Уже пару недель использую Meetily для записи созвонов последующей транскрибации и саммари, но релиз установщик имел изъян, в него не забилдили GPU использование.
В самом же репозитории написано что поддержка видеокарт и CUDA есть, без этого транскрипция идет на CPU как я понял, что х100 медленней. Поэтому решил пересобрать сам(claude) с поддержкой видеокарты и заодно подкрутить под себя.
Что вышло
Локальный AI обработчик который слушает микро и системное аудио параллельно, пишет в один файл, транскрибирует на GPU через whisper.cpp и делает саммари через любую выбранную модель, можно и локальную. 65 минутный созвон пролетел за 3 минуты.
При сборке было много граблей, поскольку я во всем этом не шарю, да и написано на Rust, я просто дал задачу клоду все это переупаковать и подправить пару функций, вдаваться в подробности не вижу смысла, оставлю вам промт для клода если захотите пересобрать себе.
Модель audio-to-text whisper russian podlodka, дотюненая ориг виспер модель на ру подкастах
Так же добавил кастомный шаблон саммари, там уже есть встроенные но хотелось по своему составлять вывод
на саммари использую просто sonnet4.6 по API
Что еще хочется
Хочу прикрутить преочистку транскрипта через Haiku, сам разговорный текст довольно грязный, много лишнего шума для нейронки по саммари, много артефактов, возможно качество саммари вырастет
Так же думаю про две раздельные дорожки записи, мик и системный звук как отдельные файлы. Внутри Meetily они уже разделены, только доработать
Полный гайдик со всеми патчами и обходом граблей в комментах кину, там просто многострочный .md для сборки на винде
Приятно оказалось пользоваться опенсорсом, теперь еще и под себя можно что угодно допиливать с клодом
Уже пару недель использую Meetily для записи созвонов последующей транскрибации и саммари, но релиз установщик имел изъян, в него не забилдили GPU использование.
В самом же репозитории написано что поддержка видеокарт и CUDA есть, без этого транскрипция идет на CPU как я понял, что х100 медленней. Поэтому решил пересобрать сам(claude) с поддержкой видеокарты и заодно подкрутить под себя.
Что вышло
Локальный AI обработчик который слушает микро и системное аудио параллельно, пишет в один файл, транскрибирует на GPU через whisper.cpp и делает саммари через любую выбранную модель, можно и локальную. 65 минутный созвон пролетел за 3 минуты.
При сборке было много граблей, поскольку я во всем этом не шарю, да и написано на Rust, я просто дал задачу клоду все это переупаковать и подправить пару функций, вдаваться в подробности не вижу смысла, оставлю вам промт для клода если захотите пересобрать себе.
Модель audio-to-text whisper russian podlodka, дотюненая ориг виспер модель на ру подкастах
Так же добавил кастомный шаблон саммари, там уже есть встроенные но хотелось по своему составлять вывод
на саммари использую просто sonnet4.6 по API
Что еще хочется
Хочу прикрутить преочистку транскрипта через Haiku, сам разговорный текст довольно грязный, много лишнего шума для нейронки по саммари, много артефактов, возможно качество саммари вырастет
Так же думаю про две раздельные дорожки записи, мик и системный звук как отдельные файлы. Внутри Meetily они уже разделены, только доработать
Полный гайдик со всеми патчами и обходом граблей в комментах кину, там просто многострочный .md для сборки на винде
Приятно оказалось пользоваться опенсорсом, теперь еще и под себя можно что угодно допиливать с клодом