Видео недоступно для предпросмотра
Смотреть в Telegram
Новые продукты Kling -видео с нативным звуком, ИИ-видеоредактор и реалистичные аватары - мой обзор
Kling долго оставались в стороне, и вот наконец выкатили пачку крутых обновлений. Давайте разберемся 👇🏻
🪼 Их видеогенератор я люблю давно, за то, что позволяет оживлять животных и реальных людей, когда другие капризничают (привет VEO-3.1 🙋🏻♀️). Более того, Kling всегда умел работать со сложными запросами лучше остальных. И вот наконец вышел Kling 2.6! Там появилась native audio. Казалось бы, ну видео со звуком для нас уже не ново 🤷🏻♀️ Но новый сам подход - модель генерирует видео и звук в одном проходе, а не сначала генерирует картинку, а потом уже накладывает звук. Так решается проблема рассинхрона. В одном проходе генерируется: речь (монологи, диалоги, озвучка за кадром, даже пение и рэп); фоновые шумы и атмосфера; звуковые эффекты (шаги, хлопки, шум улицы и т.д.).
- По сути, эти text-to-audio-visual и image-to-audio-visual - обычные text-to-video и image-to-video, но уже с интегрированным звуком.
- Пока это короткие клипы по 5–10 секунд в 1080p.
- Так же, как и в других видеогенераторах, в Kling 2.6 сейчас можно прописать диалоги, и действующие лица их произнесут.
- Kling 2.6 доступен через сайт, и в агрегаторах (Fal, Freepik, Higgsfield и др)
🪼 По части Avatar 2.0 - в липсинке HeyGen круче, как по мне, но жестикуляция прикольная и реалистичная. Лучше работает с изображениями и ненастоящими людьми. Мне в процессе движения слепил руки между собой 🫠 По части липсинка - если печатаете текст, понимает лучше. Я загрузила свой голос, и движения губ были не синхронными с текстом. Отмечу, что действительно, жестикуляция руками стала активнее) Можно генерировать ролики до ~5 минут за один прогон, удобно для лекций, продающих монологов и сторителлинга.
🪼 Kling VIDEO O1 (Omni One) - это уже своя видеостудия, единая система для генерации и редактирования видео. Поддерживает text-to-video, image-to-video, video-to-video, работу с ключевыми кадрами, комбинированные референсы и редактирование по тексту ("убери прохожих", "измени одежду", "измени стиль на pixar” и т.п). Но самое главное, сохраняет консистентность персонажей и объектов - это оно из ключевых преимуществ 🔥 Видео от 5 до 10 секунд.
🪼 А теперь мой опыт: Я решила заменить объект на уже готовом видео от Kling. Я загрузила через Elements фото очков Prada в высоком качестве, и попросила поменять очки на готовом видео со мной. Очень круто распознает по фото, делает разные ракурсы объекта, чтобы лучше воспроизвести в видео. Но у меня результат какой-то посредственный. Для сравнения, я просто загрузила фото очков как Image и так же попросила заменить - результат примерно одинаковый 💁🏻♀️ Но это пока мои первые впечатления, кто пробовал, как вам?
@NeuralProfit
Kling долго оставались в стороне, и вот наконец выкатили пачку крутых обновлений. Давайте разберемся 👇🏻
🪼 Их видеогенератор я люблю давно, за то, что позволяет оживлять животных и реальных людей, когда другие капризничают (привет VEO-3.1 🙋🏻♀️). Более того, Kling всегда умел работать со сложными запросами лучше остальных. И вот наконец вышел Kling 2.6! Там появилась native audio. Казалось бы, ну видео со звуком для нас уже не ново 🤷🏻♀️ Но новый сам подход - модель генерирует видео и звук в одном проходе, а не сначала генерирует картинку, а потом уже накладывает звук. Так решается проблема рассинхрона. В одном проходе генерируется: речь (монологи, диалоги, озвучка за кадром, даже пение и рэп); фоновые шумы и атмосфера; звуковые эффекты (шаги, хлопки, шум улицы и т.д.).
- По сути, эти text-to-audio-visual и image-to-audio-visual - обычные text-to-video и image-to-video, но уже с интегрированным звуком.
- Пока это короткие клипы по 5–10 секунд в 1080p.
- Так же, как и в других видеогенераторах, в Kling 2.6 сейчас можно прописать диалоги, и действующие лица их произнесут.
- Kling 2.6 доступен через сайт, и в агрегаторах (Fal, Freepik, Higgsfield и др)
🪼 По части Avatar 2.0 - в липсинке HeyGen круче, как по мне, но жестикуляция прикольная и реалистичная. Лучше работает с изображениями и ненастоящими людьми. Мне в процессе движения слепил руки между собой 🫠 По части липсинка - если печатаете текст, понимает лучше. Я загрузила свой голос, и движения губ были не синхронными с текстом. Отмечу, что действительно, жестикуляция руками стала активнее) Можно генерировать ролики до ~5 минут за один прогон, удобно для лекций, продающих монологов и сторителлинга.
🪼 Kling VIDEO O1 (Omni One) - это уже своя видеостудия, единая система для генерации и редактирования видео. Поддерживает text-to-video, image-to-video, video-to-video, работу с ключевыми кадрами, комбинированные референсы и редактирование по тексту ("убери прохожих", "измени одежду", "измени стиль на pixar” и т.п). Но самое главное, сохраняет консистентность персонажей и объектов - это оно из ключевых преимуществ 🔥 Видео от 5 до 10 секунд.
🪼 А теперь мой опыт: Я решила заменить объект на уже готовом видео от Kling. Я загрузила через Elements фото очков Prada в высоком качестве, и попросила поменять очки на готовом видео со мной. Очень круто распознает по фото, делает разные ракурсы объекта, чтобы лучше воспроизвести в видео. Но у меня результат какой-то посредственный. Для сравнения, я просто загрузила фото очков как Image и так же попросила заменить - результат примерно одинаковый 💁🏻♀️ Но это пока мои первые впечатления, кто пробовал, как вам?
@NeuralProfit