#AI107 Runway Gen 4.5
Обзор подъехал ^_^
Модель не новая, но доступ давали очень неторопливо, а img2video добавили так вообще как будто вчера.
Итак что модель может?
._. Тут будет блок наблюдений/объяснений, мотайте дальше, если вам нужно ёмко ._.
На момент до релиза Kling 3.0 у неё был добротный уровень дорисовывания неизвестного в кадре.
что это значит?
Вот у вас есть комната и вы хотите повернуть камеру вправо, но модель не знает что ей там рисовать ведь в изображении этой информации нет. Модели обычно додумывают отталкиваясь от предугадывания того что там будет на основе тех токенов, что были в исходном изображении и чаще всего такие резкие движения камеры вызывали гору артефактов и всратый результат. Для того чтобы было не всрато нужны специальные надстройки в модели, которые будут додумывать то чего в кадре нет. Как в старые добрые, помните как буквально годик-два назад было сложно просто повернуть объект на 360 сохранив объект, получались люди с лицами с двух сторон и тому подобные забавные нежданчики. Так вот тут как раз у Runway с Gen 4.5 получилось сделать действительно впечатляющий шаг - да алгоритм не работает как Sora 2 и не дотягивает до нынешнего Kling 3, но додумывать у него получилось действительно добротно.
Из забавных штук, что они завезли:
- motion sketch - это уже было много у кого (veo/kling - ребята и в комфи себе такое собирали) берём картинку рисуем на ней что и как хотим анимировать и получаем результат - не идеальный, но довольно не плохой (движения персонажа иногда могут работать не так как было описано - может пойти не в ту сторону например и да первые кадры генерятся почему-то с инструкцией)
- пресеты (camera/motion/action) - у них они были и раньше, а Higgsfield так вообще обмазан ими везде где только можно, но в этот раз пресеты вышли действительно добротными, вопрос нужны ил они сейчас, когда Kling 3.0 вышел и Veo 4 на подходе.
- завезли к себе нодовую систему (да там и банана есть и Veo 3.1 и LLMки, но из плюсов наверное будет, то что и сшиватель видео есть), ну она тоже сейчас уже много где присутствует, но я как фанат нодовых систему рад любым шагам в эту сторону.
- работающий ассистент для генерации видосов - у него правда что-то получается=)
- замену персонажей с помощью NanoBanana=)
- ну и кое-что что они сейчас готовят - это GWM-1 (General World Model), да уже порядком навыходило моделей с виртуальными мирами, но ребята тоже активно готовят свою
^_^ Кратко ^_^
Runway всё ещё в отстающих, но сделаны поздние, но верные шаги.
Что у модели есть:
- ассистент, который что-то может
- хорошая надстройка для додумывания того чего нет в кадре
- хорошие пресеты
- апскейл до 4к (как и раньше)
- 10 секунд генерации
- генерация нескольких сцен/крупностей в одном видео
Чего у модели нет и это прям плохо:
- звука до сих пор нет ни в каком виде
- консистентность персонажей на дне
Ну и собственно примерчики Gen 4.5 прикрепленны. На подходе обзор на Kling 3.0 - это просто бомба, ребят. Во мне пробуждается режиссёр, когда я в нём что-то генерю, как же он хорош!
Обзор подъехал ^_^
Модель не новая, но доступ давали очень неторопливо, а img2video добавили так вообще как будто вчера.
Итак что модель может?
._. Тут будет блок наблюдений/объяснений, мотайте дальше, если вам нужно ёмко ._.
На момент до релиза Kling 3.0 у неё был добротный уровень дорисовывания неизвестного в кадре.
что это значит?
Вот у вас есть комната и вы хотите повернуть камеру вправо, но модель не знает что ей там рисовать ведь в изображении этой информации нет. Модели обычно додумывают отталкиваясь от предугадывания того что там будет на основе тех токенов, что были в исходном изображении и чаще всего такие резкие движения камеры вызывали гору артефактов и всратый результат. Для того чтобы было не всрато нужны специальные надстройки в модели, которые будут додумывать то чего в кадре нет. Как в старые добрые, помните как буквально годик-два назад было сложно просто повернуть объект на 360 сохранив объект, получались люди с лицами с двух сторон и тому подобные забавные нежданчики. Так вот тут как раз у Runway с Gen 4.5 получилось сделать действительно впечатляющий шаг - да алгоритм не работает как Sora 2 и не дотягивает до нынешнего Kling 3, но додумывать у него получилось действительно добротно.
Из забавных штук, что они завезли:
- motion sketch - это уже было много у кого (veo/kling - ребята и в комфи себе такое собирали) берём картинку рисуем на ней что и как хотим анимировать и получаем результат - не идеальный, но довольно не плохой (движения персонажа иногда могут работать не так как было описано - может пойти не в ту сторону например и да первые кадры генерятся почему-то с инструкцией)
- пресеты (camera/motion/action) - у них они были и раньше, а Higgsfield так вообще обмазан ими везде где только можно, но в этот раз пресеты вышли действительно добротными, вопрос нужны ил они сейчас, когда Kling 3.0 вышел и Veo 4 на подходе.
- завезли к себе нодовую систему (да там и банана есть и Veo 3.1 и LLMки, но из плюсов наверное будет, то что и сшиватель видео есть), ну она тоже сейчас уже много где присутствует, но я как фанат нодовых систему рад любым шагам в эту сторону.
- работающий ассистент для генерации видосов - у него правда что-то получается=)
- замену персонажей с помощью NanoBanana=)
- ну и кое-что что они сейчас готовят - это GWM-1 (General World Model), да уже порядком навыходило моделей с виртуальными мирами, но ребята тоже активно готовят свою
^_^ Кратко ^_^
Runway всё ещё в отстающих, но сделаны поздние, но верные шаги.
Что у модели есть:
- ассистент, который что-то может
- хорошая надстройка для додумывания того чего нет в кадре
- хорошие пресеты
- апскейл до 4к (как и раньше)
- 10 секунд генерации
- генерация нескольких сцен/крупностей в одном видео
Чего у модели нет и это прям плохо:
- звука до сих пор нет ни в каком виде
- консистентность персонажей на дне
Ну и собственно примерчики Gen 4.5 прикрепленны. На подходе обзор на Kling 3.0 - это просто бомба, ребят. Во мне пробуждается режиссёр, когда я в нём что-то генерю, как же он хорош!