LTX-2.5 пайплайн генерации с Гермесом
⚡️ В общем вчера Lightricks выкатили LTX-2.5 — модель генерации видео по тексту и изображению и я решил попробовать его на своём М5, настроив его с помощью с Гермеса.
📦 В порядке эксперимента собрали пайплайн последовательной генерации (исходник в комментарии): chain_i2v.py берёт исходное изображение (генерация в OpenAI (gpt-image-2)) и три промпта, каждый из которых описывает происходящее в 3х секундном сегменте, после каждого сегмента ffmpeg вырезает последний кадр, он становится входом для следующего, и так по цепочке. На выходе - склеенное видео.
Делали без звука, потому, что очевидно он рассыпется и будет разным в каждом кусочке. т.е. звук надо отдельно генерить и сверху накладывать.
скажем слой музыки, слой сфх и слой голоса, если нужно.
На Apple Silicon работает через MPS, один сегмент в 3 секунды (73 кадра) генерируется за 3–3,5 минуты на M5 Max.
🖼 Для демки взяли портрет киберпанк-Гермеса — хромированная маска, голографические крылья, кадуцей с цифровыми змеями.
Прописали три сцены: наплыв на лицо с пульсацией крыльев, затем змеи сползают по жезлу в синих искрах, и камера отъезжает, открывая панораму с античными колоннами и кибер-Афинами. Суммарно 9,12 секунд из одного исходника.
Получилось, конечно, забавно - что из кадра пропало, - назад уже не вернуть :)
как-будто нужно полный комплект артефактов сначала вырезать в папочку с артефактами, а потом на каждую генерацию их обратно подставлять чтобы не рассыпалось.
Зато локально и бесплатно :)
#LTX #I2V #videoGeneration #нейрорендер
------
@tsingular
⚡️ В общем вчера Lightricks выкатили LTX-2.5 — модель генерации видео по тексту и изображению и я решил попробовать его на своём М5, настроив его с помощью с Гермеса.
📦 В порядке эксперимента собрали пайплайн последовательной генерации (исходник в комментарии): chain_i2v.py берёт исходное изображение (генерация в OpenAI (gpt-image-2)) и три промпта, каждый из которых описывает происходящее в 3х секундном сегменте, после каждого сегмента ffmpeg вырезает последний кадр, он становится входом для следующего, и так по цепочке. На выходе - склеенное видео.
Делали без звука, потому, что очевидно он рассыпется и будет разным в каждом кусочке. т.е. звук надо отдельно генерить и сверху накладывать.
скажем слой музыки, слой сфх и слой голоса, если нужно.
На Apple Silicon работает через MPS, один сегмент в 3 секунды (73 кадра) генерируется за 3–3,5 минуты на M5 Max.
🖼 Для демки взяли портрет киберпанк-Гермеса — хромированная маска, голографические крылья, кадуцей с цифровыми змеями.
Прописали три сцены: наплыв на лицо с пульсацией крыльев, затем змеи сползают по жезлу в синих искрах, и камера отъезжает, открывая панораму с античными колоннами и кибер-Афинами. Суммарно 9,12 секунд из одного исходника.
Получилось, конечно, забавно - что из кадра пропало, - назад уже не вернуть :)
как-будто нужно полный комплект артефактов сначала вырезать в папочку с артефактами, а потом на каждую генерацию их обратно подставлять чтобы не рассыпалось.
Зато локально и бесплатно :)
#LTX #I2V #videoGeneration #нейрорендер
------
@tsingular