Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
MiniMax H3 - длинные видосы. Для гиков.
Сразу два проекта пытаются сделать очень ловкий продолжатор:
H3 Motion Context и H3 Continuum.
Оба пришли к одной правильной идее: хватит декодировать последний кадр в картинку, снова запихивать его через VAE и надеяться, что лицо, одежда, цвет и движение не поплывут. Вместо этого следующий кусок получает сырой video+audio latent предыдущего. Motion Context по умолчанию переносит последние 22 видеокадра и отдельно 24 кадра аудиоконтекста (ровно 1 с), после чего повторившийся кусок автоматически отрезается. Авторы особенно заморочились со звуком:
аудио помещается именно в предыдущую часть таймлайна, а не подаётся как обычный reference.
Motion Context - более компактный и типа более педантичный инструмент именно для бесшовного продолжения одного дубля. Уже есть Ref2VA, сохранение references и стресс-тест на 16 клипов / 4:34 видео на RTX 5070 Ti. Но автор советует не включать Spectrum: прогнозирование transformer steps может портить pinned latent context, особенно звук. Turbo тоже работает, но чем агрессивнее ускорение, тем хуже continuity. То есть идея здесь простая: сначала не сломать временную непрерыность, потом уже думать, как ее ускорять.
H3 Continuum 3.3 идёт гораздо дальше и превращает эту идею в production-систему. Он автоматически генерирует до 16 связанных чанков, умеет T2VA/I2VA/FL2VA/Ref2VA, держит до трёх reference images, reference audio, отдельные prompts для каждого участка и Timeline Video conditioning. Есть автоматическое сохранение каждого raw AV latent, Resume после падения и "Regenerate From Chunk N", поэтому ради неудачного 40-го секунды не приходится пересчитывать всю минуту. Со Spectrum здесь, наоборот, все шиштяк: на каждом новом стыке первые два transformer evaluations обязательно считает настоящий H3, и только затем Spectrum начинает прогнозировать шаги. Поэтому рекомендуемый quality-режим - около 20 steps + Spectrum, speed-режим - Turbo 8-step без Spectrum. Turbo + Spectrum пока считается экспериментом.
На итоге:
Motion Context - для максимально чистого непрерывного дубля, особенно с речью или музыкой.
Continuum - для производства длинных 30-80-секундных сцен, где нужны персонажи, references, таймлайн, восстановление после падения и нормальное управление десятком генераций.
Ссылки:
H3 Motion Context
https://github.com/NikoDemon80/ComfyUI-H3-Motion-Context
Motion Context MultiRef
https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef
H3 Continuum
https://github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum
Реддит тред Motion Context
https://www.reddit.com/r/StableDiffusion/comments/1vhppmv/clip_chaining_for_minimax_h3_motion_and_audio/
Motion Context v0.2 / Ref2VA
https://www.reddit.com/r/StableDiffusion/comments/1vjvx4l/h3_motion_context_v020_reference_mode_support_and/
@cgevent
Сразу два проекта пытаются сделать очень ловкий продолжатор:
H3 Motion Context и H3 Continuum.
Оба пришли к одной правильной идее: хватит декодировать последний кадр в картинку, снова запихивать его через VAE и надеяться, что лицо, одежда, цвет и движение не поплывут. Вместо этого следующий кусок получает сырой video+audio latent предыдущего. Motion Context по умолчанию переносит последние 22 видеокадра и отдельно 24 кадра аудиоконтекста (ровно 1 с), после чего повторившийся кусок автоматически отрезается. Авторы особенно заморочились со звуком:
аудио помещается именно в предыдущую часть таймлайна, а не подаётся как обычный reference.
Motion Context - более компактный и типа более педантичный инструмент именно для бесшовного продолжения одного дубля. Уже есть Ref2VA, сохранение references и стресс-тест на 16 клипов / 4:34 видео на RTX 5070 Ti. Но автор советует не включать Spectrum: прогнозирование transformer steps может портить pinned latent context, особенно звук. Turbo тоже работает, но чем агрессивнее ускорение, тем хуже continuity. То есть идея здесь простая: сначала не сломать временную непрерыность, потом уже думать, как ее ускорять.
H3 Continuum 3.3 идёт гораздо дальше и превращает эту идею в production-систему. Он автоматически генерирует до 16 связанных чанков, умеет T2VA/I2VA/FL2VA/Ref2VA, держит до трёх reference images, reference audio, отдельные prompts для каждого участка и Timeline Video conditioning. Есть автоматическое сохранение каждого raw AV latent, Resume после падения и "Regenerate From Chunk N", поэтому ради неудачного 40-го секунды не приходится пересчитывать всю минуту. Со Spectrum здесь, наоборот, все шиштяк: на каждом новом стыке первые два transformer evaluations обязательно считает настоящий H3, и только затем Spectrum начинает прогнозировать шаги. Поэтому рекомендуемый quality-режим - около 20 steps + Spectrum, speed-режим - Turbo 8-step без Spectrum. Turbo + Spectrum пока считается экспериментом.
На итоге:
Motion Context - для максимально чистого непрерывного дубля, особенно с речью или музыкой.
Continuum - для производства длинных 30-80-секундных сцен, где нужны персонажи, references, таймлайн, восстановление после падения и нормальное управление десятком генераций.
Ссылки:
H3 Motion Context
https://github.com/NikoDemon80/ComfyUI-H3-Motion-Context
Motion Context MultiRef
https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef
H3 Continuum
https://github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum
Реддит тред Motion Context
https://www.reddit.com/r/StableDiffusion/comments/1vhppmv/clip_chaining_for_minimax_h3_motion_and_audio/
Motion Context v0.2 / Ref2VA
https://www.reddit.com/r/StableDiffusion/comments/1vjvx4l/h3_motion_context_v020_reference_mode_support_and/
@cgevent