Speko – OpenRouter для голосового AI
Вчера попался интересный проект, который как-то хотел сделать сам :)
Ребята из стартапа YCombinator сделали один API, за которым 60+ голосовых моделей, и роутер, который сам выбирает лучшую под язык и задачу.
Что внутри:
– 61 модель и 10 языков в бенчмарке; на платформе 16 STT, 16 LLM и 17 TTS. Русского в бенчмарках нет, есть европейские и индийские (сразу видно, откуда фаундеры), но можно самому потестить все модели (в списках есть все сотня языков)
– говорите «оптимизируй под точность / задержку / цену», указываете язык и регион – роутер сам подбирает модель и в ответе честно пишет, кого позвал
– 1 ключ, API совместим с OpenAI, из коробки заводится в LiveKit и Pipecat, есть TS, Python и MCP
– тарифы: +5% к прайсу провайдера за роутинг либо $0.09/мин all-in за весь стек STT+LLM+TTS. На старте дают $100 кредитов, то есть можно обпробоваться по полной и потом если что уйти к исходным провайдерам
– сам шлюз выложен в опенсорс под MIT – можно поднять у себя
Но самое конечно интересное - поковыряться в бенчмарках :)
https://benchmarks.speko.ai/
Пишут, что на 9 языках чтобы быть в топе надо использовать 4 разные модели (согласен с этим, аналогично было для перевода текстов у intento).
Надергал вам скриншотов оттуда, куча данных для сравнения. Практически везде лучшие результаты не у популярных моделей, а у например qwen ASR или inworld, так что сравнивайте обязательно.
Ещё пара фактов оттуда же: 95% продовых голосовых систем до сих пор каскадные (STT → LLM → TTS), а не end-to-end. Ну собственно поэтому они и делают сравнение 3 разных подсистем, а не end2end (за что им прилетело кстати на hackernews).
Еще из прикольного - сравнение в реальном времени или на файлах. Вот например можете проверить всех провайдеров, которые заявляют русский - https://benchmarks.speko.ai/compare/stt?lang=ru&scenario=ru-support
Советую! Будут крайне неожиданные результаты чаще всего :)
Короче, очень понравился сайт. Прям кладезь инфы и тестов про голосовые модели.
https://speko.ai
Вчера попался интересный проект, который как-то хотел сделать сам :)
Ребята из стартапа YCombinator сделали один API, за которым 60+ голосовых моделей, и роутер, который сам выбирает лучшую под язык и задачу.
Что внутри:
– 61 модель и 10 языков в бенчмарке; на платформе 16 STT, 16 LLM и 17 TTS. Русского в бенчмарках нет, есть европейские и индийские (сразу видно, откуда фаундеры), но можно самому потестить все модели (в списках есть все сотня языков)
– говорите «оптимизируй под точность / задержку / цену», указываете язык и регион – роутер сам подбирает модель и в ответе честно пишет, кого позвал
– 1 ключ, API совместим с OpenAI, из коробки заводится в LiveKit и Pipecat, есть TS, Python и MCP
– тарифы: +5% к прайсу провайдера за роутинг либо $0.09/мин all-in за весь стек STT+LLM+TTS. На старте дают $100 кредитов, то есть можно обпробоваться по полной и потом если что уйти к исходным провайдерам
– сам шлюз выложен в опенсорс под MIT – можно поднять у себя
Но самое конечно интересное - поковыряться в бенчмарках :)
https://benchmarks.speko.ai/
Пишут, что на 9 языках чтобы быть в топе надо использовать 4 разные модели (согласен с этим, аналогично было для перевода текстов у intento).
Надергал вам скриншотов оттуда, куча данных для сравнения. Практически везде лучшие результаты не у популярных моделей, а у например qwen ASR или inworld, так что сравнивайте обязательно.
Ещё пара фактов оттуда же: 95% продовых голосовых систем до сих пор каскадные (STT → LLM → TTS), а не end-to-end. Ну собственно поэтому они и делают сравнение 3 разных подсистем, а не end2end (за что им прилетело кстати на hackernews).
Еще из прикольного - сравнение в реальном времени или на файлах. Вот например можете проверить всех провайдеров, которые заявляют русский - https://benchmarks.speko.ai/compare/stt?lang=ru&scenario=ru-support
Советую! Будут крайне неожиданные результаты чаще всего :)
Короче, очень понравился сайт. Прям кладезь инфы и тестов про голосовые модели.
https://speko.ai