Я долго приходил к голосовому вводу в ллмки. Было тяжело, были сомнения типа "а вот он распознает плохо и не поймет"
Но оказалось, что вообще норм
И тут мне пришла мысль (платиновая) - А вот бы в модель не транскрипт шел, а прям аудио и оно еще понимало паузы когда я задумался или считывало что я разрдражен и лучше работало.
Так вот, оказалось что я не первый такой умный и такие модели уже есть
У Гемини 2.5 Флеш, у Кими такая есть, у Квена
И знаете что? Не помогает, они в основном все равно на текст ориентируются
https://benchmarklist.com/benchmarks/voxparadox/
Даже пол не могут нормально угадать!
Но оказалось, что вообще норм
И тут мне пришла мысль (платиновая) - А вот бы в модель не транскрипт шел, а прям аудио и оно еще понимало паузы когда я задумался или считывало что я разрдражен и лучше работало.
Так вот, оказалось что я не первый такой умный и такие модели уже есть
У Гемини 2.5 Флеш, у Кими такая есть, у Квена
И знаете что? Не помогает, они в основном все равно на текст ориентируются
https://benchmarklist.com/benchmarks/voxparadox/
Даже пол не могут нормально угадать!