https://huggingface.co/Asirus/minimax_h3_ref2va_pruned_int8_convrot_taomate_8_step
Я собрал собственную merged-версию MiniMax H3 Ref2VA, в которую непосредственно интегрирована TaoMate 3-Step MAXQUALITY LoRA. Главная задача этой сборки — получить качественную reference-driven audio/video генерацию: несколько референсных изображений персонажа + аудио → стабильное видео с сохранением внешности и хорошим lip-sync.
⚙️ Рекомендуемые настройки
Steps: 8
Sampler: Euler
Scheduler: Simple
CFG: 1.0
Video Sigma Shift: 12
Audio Sigma Shift: 3
Denoise: 1.0
После серии тестов я остановился именно на 12 / 3. На 8 / 3 изображение местами получается немного «пережаренным» — особенно кожа и мелкая детализация. При Video Sigma Shift 12 картинка выглядит более естественно, при этом сохраняется высокая детализация и стабильность.
🧬 Из чего создана модель
В качестве базы использован официальный:
MiniMax H3 Ref2VA — pruned INT8 ConvRot-256
и наша:
TaoMate H3 3-Step MAXQUALITY BF16 LoRA
TaoMate не подключается как отдельная LoRA во время генерации — она полностью встроена непосредственно в веса модели.
🔬 Как выполнялся merge
Мы не делали обычный:
INT8 model + LoRA Loader
📦 Структура финальной модели
Всего в checkpoint:
932 тензора
Из них TaoMate интегрирована в:
208 LoRA target modules / 416 LoRA tensors
Распределение:
200 модулей — основной Transformer
8 модулей — Token Refiner
При этом важные компоненты не были принудительно переведены в INT8:
Main Transformer: INT8 ConvRot-256
Token Refiner: BF16
AdaLN: исходная precision Ref2VA — FP16 + FP32
ConvRot Group Size: 256
Scaling: row-wise
TaoMate Merge Strength: 0.9
Таким образом, мы сохранили высокоточную структуру критически важных компонентов и не стали ради уменьшения размера квантовать всё подряд.
🎯 Для чего эта модель
В первую очередь модель предназначена для Ref2VA-сценариев:
Reference Image(s) + Audio → Video + Audio
Особенно хорошо она подходит для:
сохранения внешности персонажа по одному или нескольким reference images;
персонажей, которые говорят или поют;
audio-driven facial animation;
lip-sync;
cinematic video generation;
multi-reference workflows;
высококачественной генерации на 8 шагах.
В моих тестах модель показала очень хорошее сохранение идентичности персонажа, стабильность лица и естественную артикуляцию при работе с аудио.
🏆 Отдельно про качество
Интересный результат дал двухпроходный workflow:
Pass 1: около 0.4 MP — основная структура и движение
Pass 2: около 1 MP — детализация и refinement
Такой подход позволяет получить значительно более качественный финальный результат, чем пытаться сразу делать весь процесс на максимальном разрешении.
Я собрал собственную merged-версию MiniMax H3 Ref2VA, в которую непосредственно интегрирована TaoMate 3-Step MAXQUALITY LoRA. Главная задача этой сборки — получить качественную reference-driven audio/video генерацию: несколько референсных изображений персонажа + аудио → стабильное видео с сохранением внешности и хорошим lip-sync.
⚙️ Рекомендуемые настройки
Steps: 8
Sampler: Euler
Scheduler: Simple
CFG: 1.0
Video Sigma Shift: 12
Audio Sigma Shift: 3
Denoise: 1.0
После серии тестов я остановился именно на 12 / 3. На 8 / 3 изображение местами получается немного «пережаренным» — особенно кожа и мелкая детализация. При Video Sigma Shift 12 картинка выглядит более естественно, при этом сохраняется высокая детализация и стабильность.
🧬 Из чего создана модель
В качестве базы использован официальный:
MiniMax H3 Ref2VA — pruned INT8 ConvRot-256
и наша:
TaoMate H3 3-Step MAXQUALITY BF16 LoRA
TaoMate не подключается как отдельная LoRA во время генерации — она полностью встроена непосредственно в веса модели.
🔬 Как выполнялся merge
Мы не делали обычный:
INT8 model + LoRA Loader
📦 Структура финальной модели
Всего в checkpoint:
932 тензора
Из них TaoMate интегрирована в:
208 LoRA target modules / 416 LoRA tensors
Распределение:
200 модулей — основной Transformer
8 модулей — Token Refiner
При этом важные компоненты не были принудительно переведены в INT8:
Main Transformer: INT8 ConvRot-256
Token Refiner: BF16
AdaLN: исходная precision Ref2VA — FP16 + FP32
ConvRot Group Size: 256
Scaling: row-wise
TaoMate Merge Strength: 0.9
Таким образом, мы сохранили высокоточную структуру критически важных компонентов и не стали ради уменьшения размера квантовать всё подряд.
🎯 Для чего эта модель
В первую очередь модель предназначена для Ref2VA-сценариев:
Reference Image(s) + Audio → Video + Audio
Особенно хорошо она подходит для:
сохранения внешности персонажа по одному или нескольким reference images;
персонажей, которые говорят или поют;
audio-driven facial animation;
lip-sync;
cinematic video generation;
multi-reference workflows;
высококачественной генерации на 8 шагах.
В моих тестах модель показала очень хорошее сохранение идентичности персонажа, стабильность лица и естественную артикуляцию при работе с аудио.
🏆 Отдельно про качество
Интересный результат дал двухпроходный workflow:
Pass 1: около 0.4 MP — основная структура и движение
Pass 2: около 1 MP — детализация и refinement
Такой подход позволяет получить значительно более качественный финальный результат, чем пытаться сразу делать весь процесс на максимальном разрешении.