Как меньше писать на клавиатуре и больше голосом
Наконец-то дошли руки попробовать Whisper. Мне был интересен именно локальный вариант, чтобы мой голос не отправлялся в 50 разных заинтересованных компаний.
tl;dr
попробовал , отлично годится для написания промптов, и неплох для сообщений в чатах. Нормальный STS наконец-то стал доступным.
⬇️⬇️⬇️
Есть уже готовые приложения-обертки с этой моделью на борту. Одно из них я и поставил.
Качаем по этой ☑️ ссылке. Доступно для macOS, Windown, Linux. Инструкция по настройке на той же странице.
⬇️
А пока оно загружается , можете глянуть цифры по производительности, которые у меня получились для разных вариантов модели: tiny, small и large. Модель Medium у меня почему-то не захотела запуститься.
⏺ Tiny:
- скорость: 13,98 с/с *
- размер: 78 МБ
- аккуратность: низкая
⏺ Small:
- скорость: 7,36 с/с
- размер: 488 МБ
- аккуратность: удовлетворительно
⏺ Large v3 Turbo:
- скорость: 4,3 с/с
- размер: 1.6 ГБ
- аккуратность: хорошая
Чтобы вы понимали разницу между аккуратностью, ниже результаты для одного и того же аудио, которое я подал на вход трем моделям.
Оригинал:
Tiny:
Small:
Large:
* c/c это у меня "X секунд аудио распознается за 1 секунду времени". Такой единицы измерения официальной нет, но мне показалось удобным так сравнивать скорость,
Например: 5 с/с означает, что 5 секунд аудио распознается за 1 секунду времени. Т.е. если вы наболтаете 15 секунд, то вам придется ждать 3 секунды , пока аудио распознается.
** Измерения проводились на Macbook 14 m1 pro 2021 16gb. Взяты средние значения, тест из 8-10 предложений.
В комментариях отдельно закину ещё очень интересную фишку по этой теме
Наконец-то дошли руки попробовать Whisper. Мне был интересен именно локальный вариант, чтобы мой голос не отправлялся в 50 разных заинтересованных компаний.
Для тех, кто не в курсе: Whisper – это одна из топовых локальных моделей для распознавания речи (speech to text) от OpenAI.
tl;dr
попробовал , отлично годится для написания промптов, и неплох для сообщений в чатах. Нормальный STS наконец-то стал доступным.
⬇️⬇️⬇️
Есть уже готовые приложения-обертки с этой моделью на борту. Одно из них я и поставил.
Качаем по этой ☑️ ссылке. Доступно для macOS, Windown, Linux. Инструкция по настройке на той же странице.
⬇️
А пока оно загружается , можете глянуть цифры по производительности, которые у меня получились для разных вариантов модели: tiny, small и large. Модель Medium у меня почему-то не захотела запуститься.
⏺ Tiny:
- скорость: 13,98 с/с *
- размер: 78 МБ
- аккуратность: низкая
⏺ Small:
- скорость: 7,36 с/с
- размер: 488 МБ
- аккуратность: удовлетворительно
⏺ Large v3 Turbo:
- скорость: 4,3 с/с
- размер: 1.6 ГБ
- аккуратность: хорошая
Чтобы вы понимали разницу между аккуратностью, ниже результаты для одного и того же аудио, которое я подал на вход трем моделям.
Оригинал:
Ассаляму Iалейкум! Сервер на Ubuntu 24.04 снова вернул ошибку 503. Мохьмад, ты точно закоммитил в main?
Tiny:
Осоляму Олегом. Сервенный у бунду 244 с новой вернул ошибку 533. Мама ты точно закомитил в Мэйн.
Small:
Осяляма Алейкум, серверный Ubuntu 2.4.04 снова вернул ошибку 503. Мама, ты точно закомитил мейн?
Large:
Ас-саляму алейкум. Сервер на Ubuntu 24.04 снова вернул ошибку 503. Мама, ты точно закоммитил в мейн?
* c/c это у меня "X секунд аудио распознается за 1 секунду времени". Такой единицы измерения официальной нет, но мне показалось удобным так сравнивать скорость,
Например: 5 с/с означает, что 5 секунд аудио распознается за 1 секунду времени. Т.е. если вы наболтаете 15 секунд, то вам придется ждать 3 секунды , пока аудио распознается.
** Измерения проводились на Macbook 14 m1 pro 2021 16gb. Взяты средние значения, тест из 8-10 предложений.
В комментариях отдельно закину ещё очень интересную фишку по этой теме