За последнюю неделю вышли две довольно любопытные работы по мультимодальной генерации. Первая рассматривает UMM в контексте нынче модных pixel-space картиночных диффузионок. Вторая — тех репорт про то как запихнуть аж 7 разных модальностей в одну модель.
Representation Forcing for Bottleneck-Free Unified Multimodal Models
Новелти работы в том что делают мультимодалку с генерацией картинок без использования VAE.
Для этого:
• Общая тушка сначала авторегрессионно предсказывает семантические картиночные токены,
• Та же тушка, но уже в режиме пиксельной диффузионки догенерирует картинку.
По заявлению авторов, в t2i их pixel-space RF догоняет SOTA мультимодальные генеративки использующие VAE, а по VLM бенчам даже лучше VAE-based варианта.
Archon: A Unified Multimodal Model for Holistic Digital Human Generation
Лютые китайцы взяли и обучили модельку с 72 задачами в 7 модальностях (text/audio/motion/visual/…) на входе и выходе. Минус в том что все сетапы игрушечные (CELEB-A для генерации картинок и тд).
Ключевой инженерный трюк — сильно ужали представление видео (4× меньше токенов) + сделали семантический декодер для сохранения консистентности генерации.
Еще понравилась часть про разложение неоднозначной мультимодальной генерации в пошаговую цепочку по модальностям для контроля/фиделити. Выглядит как будто модель для каждой модальности делает ризонинг в этой модальности. Метрик в абстракте нет, но заявляют сопоставимое качество на наборе генеративных задач.
Отдельно хочется отметить показанный в аблейшене буст качества от кросс-модального взаимодействия. Утверждается, что модель умнеет от того что учится на все модальности сразу, но сетап для проверки этого утверждения не особо расписан, что уменьшает уверенность в нем.
Representation Forcing for Bottleneck-Free Unified Multimodal Models
Новелти работы в том что делают мультимодалку с генерацией картинок без использования VAE.
Для этого:
• Общая тушка сначала авторегрессионно предсказывает семантические картиночные токены,
• Та же тушка, но уже в режиме пиксельной диффузионки догенерирует картинку.
По заявлению авторов, в t2i их pixel-space RF догоняет SOTA мультимодальные генеративки использующие VAE, а по VLM бенчам даже лучше VAE-based варианта.
Archon: A Unified Multimodal Model for Holistic Digital Human Generation
Лютые китайцы взяли и обучили модельку с 72 задачами в 7 модальностях (text/audio/motion/visual/…) на входе и выходе. Минус в том что все сетапы игрушечные (CELEB-A для генерации картинок и тд).
Ключевой инженерный трюк — сильно ужали представление видео (4× меньше токенов) + сделали семантический декодер для сохранения консистентности генерации.
Еще понравилась часть про разложение неоднозначной мультимодальной генерации в пошаговую цепочку по модальностям для контроля/фиделити. Выглядит как будто модель для каждой модальности делает ризонинг в этой модальности. Метрик в абстракте нет, но заявляют сопоставимое качество на наборе генеративных задач.
Отдельно хочется отметить показанный в аблейшене буст качества от кросс-модального взаимодействия. Утверждается, что модель умнеет от того что учится на все модальности сразу, но сетап для проверки этого утверждения не особо расписан, что уменьшает уверенность в нем.