Первое видео было записано в ноябре 2021 года. ChatGPT появится только через год, ElevenLabs даже не запланирован.
Заказчик медицинской онлайн-конференции сказал: «Хотим, видеоприглашение каждому врачу — лично! По имени-отчеству!». Круто же, человек открывает видео, а там ведущий конфы прямо к нему обращается.
Ладно, без проблем.
Тогда ведущий Роман Богданов @RomanBogdanovv героически записал 120 сочетаний имен-отчеств:
– Уважаемый Алексей Александрович!
– Уважаемая Анна Алексеевна!
– Уважаемый Борис Борисович!
и так еще 117 раз.
Задача у Ромы была непростая: нужно было сохранять темп, а также мимику и положение тела в конце приветствия такими, как они были в начале основного текста, чтобы идеально склеилось при смене плана.
После чего монтажер несколько дней и ночей вручную собирал видео приглашений.
Сегодня мы бы значительно сократили бюджет, время на производство и предложили бы сделать не просто приглашения с приветствием по имени, а написали каждому врачу свой текст.
ChatGPT придумал бы тексты, а ElevenLabs или Hailuo AI MiniMax создали бы готовые видео с озвучкой.
Есть и бесплатные варианты. Например Fish Speech делает синтез по голосовому образцу, а LatentSync подгоняет губы к речи (липсинк).
Без срывов сроков, без дублей, без монтажных ночей.
Второе видео было сделано пару месяцев назад, в 2025 году. На нем — спикер «Сцены» Саид Нигматулин. Когда мы попросили всех спикеров прислать видеоприглашение на фестиваль, Саид выслал файл через несколько часов. Ему не нужно было искать место для записи, выставлять камеру и свет. Он просто внес текст в нейросеть и получил готовое видео. Вот это эффективность!
Сейчас у каждого из нас, тех, кто работает в ивенте и других креативных индустриях, большая насмотренность. Мы быстро отличаем реальное видео от нейросети. Но это ненадолго. Уже совсем скоро появятся продвинутые версии, которые сделают видео и голос неотличимым от реальных и даже лучше.
Заказчик медицинской онлайн-конференции сказал: «Хотим, видеоприглашение каждому врачу — лично! По имени-отчеству!». Круто же, человек открывает видео, а там ведущий конфы прямо к нему обращается.
Ладно, без проблем.
Тогда ведущий Роман Богданов @RomanBogdanovv героически записал 120 сочетаний имен-отчеств:
– Уважаемый Алексей Александрович!
– Уважаемая Анна Алексеевна!
– Уважаемый Борис Борисович!
и так еще 117 раз.
Задача у Ромы была непростая: нужно было сохранять темп, а также мимику и положение тела в конце приветствия такими, как они были в начале основного текста, чтобы идеально склеилось при смене плана.
После чего монтажер несколько дней и ночей вручную собирал видео приглашений.
Сегодня мы бы значительно сократили бюджет, время на производство и предложили бы сделать не просто приглашения с приветствием по имени, а написали каждому врачу свой текст.
ChatGPT придумал бы тексты, а ElevenLabs или Hailuo AI MiniMax создали бы готовые видео с озвучкой.
Есть и бесплатные варианты. Например Fish Speech делает синтез по голосовому образцу, а LatentSync подгоняет губы к речи (липсинк).
Без срывов сроков, без дублей, без монтажных ночей.
Второе видео было сделано пару месяцев назад, в 2025 году. На нем — спикер «Сцены» Саид Нигматулин. Когда мы попросили всех спикеров прислать видеоприглашение на фестиваль, Саид выслал файл через несколько часов. Ему не нужно было искать место для записи, выставлять камеру и свет. Он просто внес текст в нейросеть и получил готовое видео. Вот это эффективность!
Сейчас у каждого из нас, тех, кто работает в ивенте и других креативных индустриях, большая насмотренность. Мы быстро отличаем реальное видео от нейросети. Но это ненадолго. Уже совсем скоро появятся продвинутые версии, которые сделают видео и голос неотличимым от реальных и даже лучше.