ГОЛОСОВОЕ УПРАВЛЕНИЕ АГЕНТАМИ
Многие видели маску для диктовки промптов, которая позволяет не мешать друг другу в офисе. Я долго вбивал текст руками, пока все пользовались аудио. Пришла пора перестать печатать🎙
Я привык вбивать любой текст руками. Мне казалось, что я печатаю быстро, но на практике скорость речи в 2.5 раза быстрее. Да, точность снижается, но скорость речи = 850 знаков в минуту против 330 знаках при печати.
Мне казалось, что при общении с агентами важна точность. На самом деле важно дать агенту как можно больше деталей для понимания задачи. А это как раз удобнее делать с помощью речи.
После первого общения с агентами в аудио возникли вопросы: зачем вообще ждать, пока этот микрофон включится? Почему нельзя всё время работать с активно включённым микрофоном? Почему не наговаривать текст в тот же Telegram или прямо в файл, не ограничиваясь Claude Code или Codex?
В Windows есть Win+H, но он требует интернета и не активен постоянно. Да и гибкости ему явно не хватает.
Как всегда - придумываем своё решение 🧠
Распознавание голоса оказалось гораздо проще, чем я ожидал. Не нужно задействовать API и платить деньги. Всё можно сделать на своём компе. С помощью Claude написал небольшую программу на базе Сберовской аудио-модели GigaAM v3 e2e CTC. Теперь прога постоянно крутится локально, слушает мою речь и транслирует в текст. Кстати, этот пост частично написан с помощью аудио.
Если не пытаться слушать музыку, многие процессы становятся в разы быстрее. Это и работа с текстами, и постановка задач агентам, и сообщения, и просто сбор полезных мыслей.
Отдельный кайф - настраиваемая автозамена. Говоришь одно слово, а печатается заранее заготовленная длинная команда.
Можно даже повесить на голосовую команду выполнение скрипта: сказал слово - запустилась программа. Звучит как что-то невероятное 😵💫
Есть конечно и недочёты: если пишешь пост или важное сообщение, сходу правильно надиктовать почти нереально, придётся править. Хотя и при печати также☺️
По скорости и ресурсам у себя проблем не замечал (на серверах тоже ок), но если ресурсов не хватает, диктовка может подтормаживать.
За последнее время создал много небольших, но полезных инструментов. В основном для себя, не рассчитывая их продать, так как цена копеечная. Скоро обязательно соберу всё воедино, выложу на платформе и сделаю про них подробное видео🤗
А вы как, уже пользуетесь голосовым промптингом?
Многие видели маску для диктовки промптов, которая позволяет не мешать друг другу в офисе. Я долго вбивал текст руками, пока все пользовались аудио. Пришла пора перестать печатать🎙
Я привык вбивать любой текст руками. Мне казалось, что я печатаю быстро, но на практике скорость речи в 2.5 раза быстрее. Да, точность снижается, но скорость речи = 850 знаков в минуту против 330 знаках при печати.
Мне казалось, что при общении с агентами важна точность. На самом деле важно дать агенту как можно больше деталей для понимания задачи. А это как раз удобнее делать с помощью речи.
После первого общения с агентами в аудио возникли вопросы: зачем вообще ждать, пока этот микрофон включится? Почему нельзя всё время работать с активно включённым микрофоном? Почему не наговаривать текст в тот же Telegram или прямо в файл, не ограничиваясь Claude Code или Codex?
В Windows есть Win+H, но он требует интернета и не активен постоянно. Да и гибкости ему явно не хватает.
Как всегда - придумываем своё решение 🧠
Распознавание голоса оказалось гораздо проще, чем я ожидал. Не нужно задействовать API и платить деньги. Всё можно сделать на своём компе. С помощью Claude написал небольшую программу на базе Сберовской аудио-модели GigaAM v3 e2e CTC. Теперь прога постоянно крутится локально, слушает мою речь и транслирует в текст. Кстати, этот пост частично написан с помощью аудио.
Если не пытаться слушать музыку, многие процессы становятся в разы быстрее. Это и работа с текстами, и постановка задач агентам, и сообщения, и просто сбор полезных мыслей.
Отдельный кайф - настраиваемая автозамена. Говоришь одно слово, а печатается заранее заготовленная длинная команда.
произносишь "окружение"
-> печатается "source /home/user/venv/bin/activate"🔥
Можно даже повесить на голосовую команду выполнение скрипта: сказал слово - запустилась программа. Звучит как что-то невероятное 😵💫
Есть конечно и недочёты: если пишешь пост или важное сообщение, сходу правильно надиктовать почти нереально, придётся править. Хотя и при печати также☺️
По скорости и ресурсам у себя проблем не замечал (на серверах тоже ок), но если ресурсов не хватает, диктовка может подтормаживать.
За последнее время создал много небольших, но полезных инструментов. В основном для себя, не рассчитывая их продать, так как цена копеечная. Скоро обязательно соберу всё воедино, выложу на платформе и сделаю про них подробное видео🤗
А вы как, уже пользуетесь голосовым промптингом?