Видео недоступно для предпросмотра
Смотреть в Telegram
Minimax H3 - ускоряем генерацию
Кратко:
int8 + lightx2v лора + Spectrum + sage-attention + Sol-Attn + EasyCache
Железо:
- 3090-24GB
- 64 GB DDR4
- Потребление vram около 40 гигов, ram около 50 гигов.
Пишут, что Minimax можно юзать и на 3060-12GB + 32 RAM. Это так, но разрешение будет низким (480p), максимальная длина короткая (5s) и генерация уйдет в в файл подкачки. И я не уверен, что у вас режим редактирования видео r2v запустится вовсе, он жрет еще больше vram\ram. У меня на 3090 при r2v влазит максимум 5s 768p(1mpx), дальше OOM. В обычном режиме (t2v и fl2v) влазит 15-20s 1mpx. На своей 3060 я минимакс пока не запускал, мне лень.
Скорость на 3090:
fl2v, 5s 1mpx,
4 шага - 01:46, 26.59s/it, полное время - 5.7 мин
R2V (редактирование видео) 5s 1 mpx,
4 шага - 12:39, 189.87s/it, полное время - 15 минут
20 шагов - 33:47, 101.36s/it, полное время - 38 минут
Новая 4 шаговая лора от lightx2v:
https://huggingface.co/Kijai/MiniMax-H3_comfy/blob/main/loras/minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy.safetensors
предыдущая turbo лора на 4 шага от larryvrh мне не понравилась, в своих тестах я не заметил существенной разницы на 4-х шагах между лорой и ее отсутствием.
int8 pruned
int8 pruned модель (21 GB) на 13 гигов меньше полноразмерной int8 без потери качества. GGUF модели я не тестил, Q4_K_M весит 19.9 GB, видимо, она не pruned. MiniMax-H3-Pruned-GGUF еще не выложили на HF, но обещают.
https://huggingface.co/Comfy-Org/MiniMax-H3/tree/main/diffusion_models
int8 video vae
чуть меньше vram, чуть быстрее чем fp16 vae на этапе vae encode\decode. Нужно обновить комфи. Почти без потерь качества.
https://huggingface.co/Kijai/MiniMax-H3-experimental/blob/main/minimax_h3_video_vae_int8_convrot.safetensors
Spectrum
дает до 45% прироста скорости без ухудшения качества. Ноды обновились 7 июля, там еще больше ускорение стало, надо обновить комфи. Устанавливать через git clone.
https://github.com/xmarre/ComfyUI-Spectrum-MiniMax-H3
sage-attention
дает небольшой прирост 5-10% и чуть меньше vram. Нужен triton
https://www.reddit.com/r/comfyui/comments/1n8v3zy/detailed_stepbystep_full_comfyui_with_sage/
Sol-Attn
дает небольшое ускорение на 5-10%, почти без потери качества. Нужен triton
https://github.com/kijai/ComfyUI-SolAttn_triton
EasyCache (нода встроена в комфи)
я еще не тестил. На 4-х шагах, она не работает. Она дает ускорение, но ухудшает качество. Надо поискать оптимальные настройки, чтобы был баланс.
Для плавности кадров юзаю ноду RIFE VFI, она увеличает фреймрейт с 24 до 48 fps. Занимает 3-5 минут.
https://github.com/Fannovel16/ComfyUI-Frame-Interpolation
Для режима image2video, если хочется максимальной похожести, надо использовать первый и последний кадр (fl2va).
NSFW лоры уже начинают выходить, но те, что я видел, пригодны только для режимов i2v и t2v. Для режима r2v они пока не подходят. Ссылки давать не буду, я их еще не тестил по назначению, найдете сами на civitai red: NaughtyTimes, hmmotion.
2 официальных промпт гайда для разных режимов для скармливания LLM:
https://huggingface.co/MiniMaxAI/MiniMax-H3/tree/main/docs
у меня также есть нода Mozer/ComfyUI-OpenAI для атоматического описания картинки через llama.cpp server для создания промпта, но я ее пока решил не юзать. За частую, промпт после LLM приходится перепроверять вручную. Но зато с ней можно автоматизировать пакетную конвертацию папки картинок в видео.
Мои воркфлоу:
fl2va (танец по первому и последнему кадру):
https://github.com/Mozer/comfy_stuff/blob/main/workflows/minimax_h3_fl2v_4steps.json
r2v (редактирование видео, замена одежды):
https://github.com/Mozer/comfy_stuff/blob/main/workflows/minimax_h3_r2v_4steps_clothing_change.json
Кратко:
int8 + lightx2v лора + Spectrum + sage-attention + Sol-Attn + EasyCache
Железо:
- 3090-24GB
- 64 GB DDR4
- Потребление vram около 40 гигов, ram около 50 гигов.
Пишут, что Minimax можно юзать и на 3060-12GB + 32 RAM. Это так, но разрешение будет низким (480p), максимальная длина короткая (5s) и генерация уйдет в в файл подкачки. И я не уверен, что у вас режим редактирования видео r2v запустится вовсе, он жрет еще больше vram\ram. У меня на 3090 при r2v влазит максимум 5s 768p(1mpx), дальше OOM. В обычном режиме (t2v и fl2v) влазит 15-20s 1mpx. На своей 3060 я минимакс пока не запускал, мне лень.
Скорость на 3090:
fl2v, 5s 1mpx,
4 шага - 01:46, 26.59s/it, полное время - 5.7 мин
R2V (редактирование видео) 5s 1 mpx,
4 шага - 12:39, 189.87s/it, полное время - 15 минут
20 шагов - 33:47, 101.36s/it, полное время - 38 минут
Новая 4 шаговая лора от lightx2v:
https://huggingface.co/Kijai/MiniMax-H3_comfy/blob/main/loras/minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy.safetensors
предыдущая turbo лора на 4 шага от larryvrh мне не понравилась, в своих тестах я не заметил существенной разницы на 4-х шагах между лорой и ее отсутствием.
int8 pruned
int8 pruned модель (21 GB) на 13 гигов меньше полноразмерной int8 без потери качества. GGUF модели я не тестил, Q4_K_M весит 19.9 GB, видимо, она не pruned. MiniMax-H3-Pruned-GGUF еще не выложили на HF, но обещают.
https://huggingface.co/Comfy-Org/MiniMax-H3/tree/main/diffusion_models
int8 video vae
чуть меньше vram, чуть быстрее чем fp16 vae на этапе vae encode\decode. Нужно обновить комфи. Почти без потерь качества.
https://huggingface.co/Kijai/MiniMax-H3-experimental/blob/main/minimax_h3_video_vae_int8_convrot.safetensors
Spectrum
дает до 45% прироста скорости без ухудшения качества. Ноды обновились 7 июля, там еще больше ускорение стало, надо обновить комфи. Устанавливать через git clone.
https://github.com/xmarre/ComfyUI-Spectrum-MiniMax-H3
sage-attention
дает небольшой прирост 5-10% и чуть меньше vram. Нужен triton
https://www.reddit.com/r/comfyui/comments/1n8v3zy/detailed_stepbystep_full_comfyui_with_sage/
Sol-Attn
дает небольшое ускорение на 5-10%, почти без потери качества. Нужен triton
https://github.com/kijai/ComfyUI-SolAttn_triton
EasyCache (нода встроена в комфи)
я еще не тестил. На 4-х шагах, она не работает. Она дает ускорение, но ухудшает качество. Надо поискать оптимальные настройки, чтобы был баланс.
Для плавности кадров юзаю ноду RIFE VFI, она увеличает фреймрейт с 24 до 48 fps. Занимает 3-5 минут.
https://github.com/Fannovel16/ComfyUI-Frame-Interpolation
Для режима image2video, если хочется максимальной похожести, надо использовать первый и последний кадр (fl2va).
NSFW лоры уже начинают выходить, но те, что я видел, пригодны только для режимов i2v и t2v. Для режима r2v они пока не подходят. Ссылки давать не буду, я их еще не тестил по назначению, найдете сами на civitai red: NaughtyTimes, hmmotion.
2 официальных промпт гайда для разных режимов для скармливания LLM:
https://huggingface.co/MiniMaxAI/MiniMax-H3/tree/main/docs
у меня также есть нода Mozer/ComfyUI-OpenAI для атоматического описания картинки через llama.cpp server для создания промпта, но я ее пока решил не юзать. За частую, промпт после LLM приходится перепроверять вручную. Но зато с ней можно автоматизировать пакетную конвертацию папки картинок в видео.
Мои воркфлоу:
fl2va (танец по первому и последнему кадру):
https://github.com/Mozer/comfy_stuff/blob/main/workflows/minimax_h3_fl2v_4steps.json
r2v (редактирование видео, замена одежды):
https://github.com/Mozer/comfy_stuff/blob/main/workflows/minimax_h3_r2v_4steps_clothing_change.json