TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
MITV

5 Oct, 20:07

Открыть в Telegram Поделиться Пожаловаться

https://huggingface.co/Asirus/minimax_h3_ref2va_pruned_int8_convrot_taomate_8_step

Я собрал собственную merged-версию MiniMax H3 Ref2VA, в которую непосредственно интегрирована TaoMate 3-Step MAXQUALITY LoRA. Главная задача этой сборки — получить качественную reference-driven audio/video генерацию: несколько референсных изображений персонажа + аудио → стабильное видео с сохранением внешности и хорошим lip-sync.
⚙️ Рекомендуемые настройки
Steps: 8
Sampler: Euler
Scheduler: Simple
CFG: 1.0
Video Sigma Shift: 12
Audio Sigma Shift: 3
Denoise: 1.0
После серии тестов я остановился именно на 12 / 3. На 8 / 3 изображение местами получается немного «пережаренным» — особенно кожа и мелкая детализация. При Video Sigma Shift 12 картинка выглядит более естественно, при этом сохраняется высокая детализация и стабильность.
🧬 Из чего создана модель
В качестве базы использован официальный:
MiniMax H3 Ref2VA — pruned INT8 ConvRot-256
и наша:
TaoMate H3 3-Step MAXQUALITY BF16 LoRA
TaoMate не подключается как отдельная LoRA во время генерации — она полностью встроена непосредственно в веса модели.
🔬 Как выполнялся merge
Мы не делали обычный:
INT8 model + LoRA Loader
📦 Структура финальной модели
Всего в checkpoint:
932 тензора
Из них TaoMate интегрирована в:
208 LoRA target modules / 416 LoRA tensors
Распределение:
200 модулей — основной Transformer
8 модулей — Token Refiner
При этом важные компоненты не были принудительно переведены в INT8:
Main Transformer: INT8 ConvRot-256
Token Refiner: BF16
AdaLN: исходная precision Ref2VA — FP16 + FP32
ConvRot Group Size: 256
Scaling: row-wise
TaoMate Merge Strength: 0.9
Таким образом, мы сохранили высокоточную структуру критически важных компонентов и не стали ради уменьшения размера квантовать всё подряд.
🎯 Для чего эта модель
В первую очередь модель предназначена для Ref2VA-сценариев:
Reference Image(s) + Audio → Video + Audio
Особенно хорошо она подходит для:
сохранения внешности персонажа по одному или нескольким reference images;
персонажей, которые говорят или поют;
audio-driven facial animation;
lip-sync;
cinematic video generation;
multi-reference workflows;
высококачественной генерации на 8 шагах.
В моих тестах модель показала очень хорошее сохранение идентичности персонажа, стабильность лица и естественную артикуляцию при работе с аудио.
🏆 Отдельно про качество
Интересный результат дал двухпроходный workflow:
Pass 1: около 0.4 MP — основная структура и движение
Pass 2: около 1 MP — детализация и refinement
Такой подход позволяет получить значительно более качественный финальный результат, чем пытаться сразу делать весь процесс на максимальном разрешении.
Asirus/minimax_h3_ref2va_pruned_int8_convrot_taomate_8_step · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.

3 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot