🌟 MiniMax открыла веса видеомодели H3
Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
Полный конвейер H3 состоит из трёх частей:
🟠H3-Context-IR разбирает запрос пользователя со всем инпутом (картинки, видео, аудио) и переводит его во внутренний формат, с которым дальше работает модель.
🟢H3-Base по этому формату генерирует видео в разрешении 768p.
🟠H3-Regenerate-2K затем пересобирает сгенерированный ролик в 2K.
🟡H3-Base опубликована в 2-х вариантах
H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.
Помимо СomfyUI есть кукбуки под SGLang, vLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
📌Лицензирование: MiniMax H3 Community License
🟡Модель
@ai_machinelearning_big_data
#AI #ML #Video #H3 #Minimax
Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
Полный конвейер H3 состоит из трёх частей:
🟠H3-Context-IR разбирает запрос пользователя со всем инпутом (картинки, видео, аудио) и переводит его во внутренний формат, с которым дальше работает модель.
🟢H3-Base по этому формату генерирует видео в разрешении 768p.
🟠H3-Regenerate-2K затем пересобирает сгенерированный ролик в 2K.
Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
🟡H3-Base опубликована в 2-х вариантах
H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
По рейтингу Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.
Помимо СomfyUI есть кукбуки под SGLang, vLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле. Официального кода для трейна пока нет.
⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
📌Лицензирование: MiniMax H3 Community License
🟡Модель
@ai_machinelearning_big_data
#AI #ML #Video #H3 #Minimax