Как сделать таймкоды
Начнем с базы — AI на ПК.
Для средних и больших моделей (small, medium, large): желательно наличие NVIDIA GPU (CUDA, 10–12 GB VRAM и выше). Например, RTX 3060/4060.
Размер модели отвечает за список языков, качество и скорость работы. Для таймкодов выше я использовал просто Small. Мои железки прописаны в гайде на генерацию картинок.
Теперь ставим Whisper
Софт от OpenAI, который с вашего аудио файла вытаскивает текст. Сейчас пройдемся по установке и запуску.
0. На вашем MacOS/Windows/Linux разбираемся с Python и PIP, это не сложно, оно прописано в гитхабе проекта + любая ИИ модель подскажет
1. Гитхаб проекта, идем к Setup и юзаем команды. В случае ошибки pip — спрашиваем иишку. Она подскажет как сделать виртуальное окружение в 1 клик.
2. После успешной установки можно запускать командами:
whisper ПУТЬ_К_ФАЙЛУ.ogg --model small --language ru --output_format vtt
После успешной обработки у вас появится файлик с названием изначального аудио. В нем будет весь текст, который вы хотели.
В моем случае он появился в корневой папке, а не в загрузках (где было аудио).
Теперь кормим файлик нейросети
Тут на ваш выбор, я использовал для этой цели Grok. Скинул ему .vtt файл. Затем дал промпт: "Мне нужно выделить темы и разбить по таймкодам".
Он конечно долго думал, потерял 20 минут за полтора часа, но справился на отлично. Я там попросил его еще раз проверить и он дописал упущенное время, хотя пока думал — руками доделал.
Но опыт пользования приятный, 80% таймкодов было поставлено без надобности переслушивать все. Я конечно проверил после за ним, ошибок не найдено.
Лайфхак для всех инфлов, крипто работяг и тех, кто хочет выжать для себя суть любого войса.
Начнем с базы — AI на ПК.
Для средних и больших моделей (small, medium, large): желательно наличие NVIDIA GPU (CUDA, 10–12 GB VRAM и выше). Например, RTX 3060/4060.
Размер модели отвечает за список языков, качество и скорость работы. Для таймкодов выше я использовал просто Small. Мои железки прописаны в гайде на генерацию картинок.
Теперь ставим Whisper
Софт от OpenAI, который с вашего аудио файла вытаскивает текст. Сейчас пройдемся по установке и запуску.
0. На вашем MacOS/Windows/Linux разбираемся с Python и PIP, это не сложно, оно прописано в гитхабе проекта + любая ИИ модель подскажет
1. Гитхаб проекта, идем к Setup и юзаем команды. В случае ошибки pip — спрашиваем иишку. Она подскажет как сделать виртуальное окружение в 1 клик.
2. После успешной установки можно запускать командами:
whisper ПУТЬ_К_ФАЙЛУ.ogg --model small --language ru --output_format vtt
Путь к файлу — очевидно
small — поменяйте на любую другую модель, которая нужна. Таблицу найдете в гитхабе.
vtt — формат текста с таймкодами, которые нам помогут в будущем. Нужна просто выжимка? Поставьте вместо этого txt
После успешной обработки у вас появится файлик с названием изначального аудио. В нем будет весь текст, который вы хотели.
В моем случае он появился в корневой папке, а не в загрузках (где было аудио).
Теперь кормим файлик нейросети
Тут на ваш выбор, я использовал для этой цели Grok. Скинул ему .vtt файл. Затем дал промпт: "Мне нужно выделить темы и разбить по таймкодам".
Он конечно долго думал, потерял 20 минут за полтора часа, но справился на отлично. Я там попросил его еще раз проверить и он дописал упущенное время, хотя пока думал — руками доделал.
Но опыт пользования приятный, 80% таймкодов было поставлено без надобности переслушивать все. Я конечно проверил после за ним, ошибок не найдено.
Скинь друзьям, пусть больше не страдают и покупают себе видео карту с RTX. И будем им счастье в этой жизни.