Единственный ответ из трех пунктов, который я готов советовать:
В 2023 году OpenAI выпустили модель для транскрибации (распознания текста) - Whisper v3.
И она до сих пор актуальна на 100%.
Версия Large хорошо распознает русский и даже мемы.
После неё появился turbo, которая быстрее, но... хуже (по оценкам самих OpenAI - на уровне второй версии).
И я на днях сравнивал распознание профильной модели для транскрибации (локальной) и нынешние продвинутые общие модели.
На фоне новостей про развитие и продвижение вглубь и вширь...
Старый конь борозды не испортил.
Новой профильной модели нет (хотя 3 виспер подкосячивает по мелочам или при использовании сокращений, англицизмов), а не профильные не смотря на 2 года прогресса не стали лучше старой модели.
Можно говорить об узкопрофильности модели, и я соглашусь.
А можно сказать шире - не каждый инструмент нужно заменять.
При условии, что он делает задачу хорошо и быстро.
В 2023 году OpenAI выпустили модель для транскрибации (распознания текста) - Whisper v3.
И она до сих пор актуальна на 100%.
Версия Large хорошо распознает русский и даже мемы.
После неё появился turbo, которая быстрее, но... хуже (по оценкам самих OpenAI - на уровне второй версии).
И я на днях сравнивал распознание профильной модели для транскрибации (локальной) и нынешние продвинутые общие модели.
На фоне новостей про развитие и продвижение вглубь и вширь...
Старый конь борозды не испортил.
Новой профильной модели нет (хотя 3 виспер подкосячивает по мелочам или при использовании сокращений, англицизмов), а не профильные не смотря на 2 года прогресса не стали лучше старой модели.
Можно говорить об узкопрофильности модели, и я соглашусь.
А можно сказать шире - не каждый инструмент нужно заменять.
При условии, что он делает задачу хорошо и быстро.