🪨 Как мы создаём генеративные медитации: технические нюансы и ловушки генерации голоса
🙂 на связи Никита)
Кроме наших проектов с Антоном, я CTO-шу в проекте моего друга, который создаёт генеративные медитации. Вот этот бот. Звучит просто, но по факту тут есть много подводных камней. Давайте разберём, как мы делали такое приложение:
1. Выбор практики — каждая практика это отдельный ИИ-агент.
2. Ввод запроса — твой запрос проходит фильтрацию LLM (на адекватность и безопасность).
3. Анализ — LLM оценивает параметры, понимает контекст.
4. Генерация медитации — цепочка моделей генерирует индивидуальный текст по определённой методологии.
5. Озвучка — ElevenLabs “озвучивает” текст по частям (не более 120 символов).
6. Сведение — наш особый алгоритм аккуратно склеивает аудиофрагменты, добавляет правильные паузы и музыку.
Результат получается достойный — люди реально отмечают глубину и индивидуальность. Сам проект привлёк уже 800 пользователей.
Делиться инсайтами и ноу-хау могу не всем, но вот несколько важных моментов, которые точно пригодятся:
---
📝 На что обратить внимание при генерации медитаций и синтезе речи:
1. Качество ударений и окончаний
YandexGPT и GigaChat хуже справляются с ударениями и окончаниями (даже на русском!), чем западные GPT. Для подобных задач лучше не рассчитывать на отечественные модели — пока они заметно отстают.
2. Промпт-инженерия
GPT-4.1 — чемпион по “послушности” промпта. Проверено на ИИ-саппорте, продажах и сложных цепочках: именно 4.1 максимально стабильно следует инструкциям. GPT-4.5 и Claude-4 креативнее, но часто игнорируют детали промпта.
3. Особенности ElevenLabs
— Текст нужно разбивать на куски максимум по 120-150 символов (а иногда и меньше) — иначе голос начинает “глючить” и галлюцинировать.
— Даже PRO-голоса иногда косячат: где-то не умеют говорить с тире, где-то путают окончания или странно проговаривают обычные фразы.
— Иногда сгенерированный голос внезапно вставляет китайские слова или идиш (!).
— У ElevenLabs нет работающего через API словаря ударений — приходится вручную ставить “ё” и расставлять ударения (например, “ноги”, “бёдра” почти всегда вызывают проблемы).
— LLM-модели тоже не всегда корректно ставят ударения, так что оптимально делать цепочку: одна модель пишет текст, другая — расставляет ударения и “ё”.
P.S. Несмотря на все “костыли”, ElevenLabs — пока лучшее решение для синтеза речи на русском. По ощущениям, наши голосовые модели отстают на 2 года. (Google по качеству крута, но там нельзя клонировать голос; fish.audio тестируем — примерно на уровне playHT, пока уступает ElevenLabs.)
Так что простой схемы “отправил текст — получил идеальное аудио” пока не существует. Всегда приходится дорабатывать вручную. У многих зарубежных сервисов по медитациям ещё проще: голос роботизирован, интонации почти нет, а скорость чтения — как у диктора на FM-радио.
Для примера — вот демо:
- PRO голос 1
- PRO голос 2
- Генеративный голос (то есть создали прям в elevenlabs без реферкенсов живого человека)
⚡️ Кстати, сегодня проект запустился на Product Radar. Если идея понравилась — можете поддержать его голосом)
▫ @russian_neuro
🙂 на связи Никита)
Кроме наших проектов с Антоном, я CTO-шу в проекте моего друга, который создаёт генеративные медитации. Вот этот бот. Звучит просто, но по факту тут есть много подводных камней. Давайте разберём, как мы делали такое приложение:
1. Выбор практики — каждая практика это отдельный ИИ-агент.
2. Ввод запроса — твой запрос проходит фильтрацию LLM (на адекватность и безопасность).
3. Анализ — LLM оценивает параметры, понимает контекст.
4. Генерация медитации — цепочка моделей генерирует индивидуальный текст по определённой методологии.
5. Озвучка — ElevenLabs “озвучивает” текст по частям (не более 120 символов).
6. Сведение — наш особый алгоритм аккуратно склеивает аудиофрагменты, добавляет правильные паузы и музыку.
Результат получается достойный — люди реально отмечают глубину и индивидуальность. Сам проект привлёк уже 800 пользователей.
Делиться инсайтами и ноу-хау могу не всем, но вот несколько важных моментов, которые точно пригодятся:
---
📝 На что обратить внимание при генерации медитаций и синтезе речи:
1. Качество ударений и окончаний
YandexGPT и GigaChat хуже справляются с ударениями и окончаниями (даже на русском!), чем западные GPT. Для подобных задач лучше не рассчитывать на отечественные модели — пока они заметно отстают.
2. Промпт-инженерия
GPT-4.1 — чемпион по “послушности” промпта. Проверено на ИИ-саппорте, продажах и сложных цепочках: именно 4.1 максимально стабильно следует инструкциям. GPT-4.5 и Claude-4 креативнее, но часто игнорируют детали промпта.
3. Особенности ElevenLabs
— Текст нужно разбивать на куски максимум по 120-150 символов (а иногда и меньше) — иначе голос начинает “глючить” и галлюцинировать.
— Даже PRO-голоса иногда косячат: где-то не умеют говорить с тире, где-то путают окончания или странно проговаривают обычные фразы.
— Иногда сгенерированный голос внезапно вставляет китайские слова или идиш (!).
— У ElevenLabs нет работающего через API словаря ударений — приходится вручную ставить “ё” и расставлять ударения (например, “ноги”, “бёдра” почти всегда вызывают проблемы).
— LLM-модели тоже не всегда корректно ставят ударения, так что оптимально делать цепочку: одна модель пишет текст, другая — расставляет ударения и “ё”.
P.S. Несмотря на все “костыли”, ElevenLabs — пока лучшее решение для синтеза речи на русском. По ощущениям, наши голосовые модели отстают на 2 года. (Google по качеству крута, но там нельзя клонировать голос; fish.audio тестируем — примерно на уровне playHT, пока уступает ElevenLabs.)
Так что простой схемы “отправил текст — получил идеальное аудио” пока не существует. Всегда приходится дорабатывать вручную. У многих зарубежных сервисов по медитациям ещё проще: голос роботизирован, интонации почти нет, а скорость чтения — как у диктора на FM-радио.
Для примера — вот демо:
- PRO голос 1
- PRO голос 2
- Генеративный голос (то есть создали прям в elevenlabs без реферкенсов живого человека)
⚡️ Кстати, сегодня проект запустился на Product Radar. Если идея понравилась — можете поддержать его голосом)
▫ @russian_neuro