Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия?
В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время.
Что говорит литература
▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом UI-датасете VQA-точность растёт с 76.6 до 98.7, FID падает с 210.9 до 190.2 при совместном обучении. Валидация на реальных данных (ShareGPT4V) сделана в куда меньшем масштабе, и там эффект уже скромнее.
▶️ FAIR Beyond Language Modeling (март 2026). Смесь текста и видео в претрене совместима с чисто текстовым бейзлайном, а иногда даже его обыгрывает по перплексити. А вот добавление картиночно-текстовых кепшенов (MetaCLIP) в тот же микс даёт худшую текстовую перплексити среди всех рассмотренных смесей. Тот самый налог за мультимодальность теперь измерен на пре-трейне.
▶️ Do Understanding and Generation Fight? (март 2026). Диагностика прямо на Janus-Pro (7B и 1B): попытка одновременно улучшить понимание и генерацию через DPO. На 7B ни один метод не двигает генерационный CLIPScore, на 1B все методы генерацию ухудшают. Градиенты двух задач почти ортогональны (cos ~ 0), а их магнитуды различаются в 11-14 раз — сигналы буквально дерутся между собой. Причина по мнению авторов в дисбалансе информации (~576 токенов на картинку против 30-100 на текст).
▶️ Сам BAGEL — это Mixture-of-Transformer с раздельными параметрами и общим self-attn. С точки зрения весов это уже частичное разделение, спрятанное под словом "унифицированная".
▶️ BLIP3-o и UniFork. Первая показывает, что последовательный претрен (сначала понимание, потом генерация) сохраняет понимание лучше, чем полностью совместный. Вторая ловит, что две задачи хотят противоположных траекторий алаймента модальностей по глубине модели, то есть полностью общий бэкбон противоречит обеим.
Замечания
Во-первых, чистого аблейшена (тот же датасет, та же архитектура, совместно против пары специализированных) на большом скейле за 14 месяцев так и не появилось. Зато появился анализ градиентов, показывающий, что сигналы двух задач ортогональны на уровне обновлений весов. Синергия не опровергнута окончательно, но её измеряют всё хуже, а интерференцию — всё лучше.
Во-вторых, все успешные "унифицированные" системы явно или неявно прячут разделение: в энкодерах (Janus), в раздельных параметрах и MoT (BAGEL), в порядке обучения (BLIP3-o), в отдельных ветках (UniFork). Возможно, это тихое признание сообществом того, что базовое совместное обучение скорее вредит, чем помогает.
В-третьих, параллельно расцвела агентская парадигма: оркестратор берёт две сильные специализированные модели (VLM для понимания, T2I/T2V для генерации), пользуется ими как инструментами и склеивает результаты. На сквозных задачах агентский подход зачастую бьёт унифицированные модели, не сражаясь ни с какой интерференцией между модальностями.
На мой вкус
Обещанное майскими работами 2025-го светлое будущее пока не наступило. Взаимное усиление модальностей реально существует в узких сетапах и на уровне представлений, но не превращается в убедительный практический выигрыш на скейле, а именно этот выигрыш и продавали. Инфраструктурная сложность унифицированных моделей выше, чем у пары специализированных плюс роутер, поэтому бо́льшая часть прод-систем идёт агентским путём. Пока не появится независимой аблейшн на большом скейле — разговор так и будет крутиться вокруг архитектурных уловок.
В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время.
Что говорит литература
▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом UI-датасете VQA-точность растёт с 76.6 до 98.7, FID падает с 210.9 до 190.2 при совместном обучении. Валидация на реальных данных (ShareGPT4V) сделана в куда меньшем масштабе, и там эффект уже скромнее.
▶️ FAIR Beyond Language Modeling (март 2026). Смесь текста и видео в претрене совместима с чисто текстовым бейзлайном, а иногда даже его обыгрывает по перплексити. А вот добавление картиночно-текстовых кепшенов (MetaCLIP) в тот же микс даёт худшую текстовую перплексити среди всех рассмотренных смесей. Тот самый налог за мультимодальность теперь измерен на пре-трейне.
▶️ Do Understanding and Generation Fight? (март 2026). Диагностика прямо на Janus-Pro (7B и 1B): попытка одновременно улучшить понимание и генерацию через DPO. На 7B ни один метод не двигает генерационный CLIPScore, на 1B все методы генерацию ухудшают. Градиенты двух задач почти ортогональны (cos ~ 0), а их магнитуды различаются в 11-14 раз — сигналы буквально дерутся между собой. Причина по мнению авторов в дисбалансе информации (~576 токенов на картинку против 30-100 на текст).
▶️ Сам BAGEL — это Mixture-of-Transformer с раздельными параметрами и общим self-attn. С точки зрения весов это уже частичное разделение, спрятанное под словом "унифицированная".
▶️ BLIP3-o и UniFork. Первая показывает, что последовательный претрен (сначала понимание, потом генерация) сохраняет понимание лучше, чем полностью совместный. Вторая ловит, что две задачи хотят противоположных траекторий алаймента модальностей по глубине модели, то есть полностью общий бэкбон противоречит обеим.
Замечания
Во-первых, чистого аблейшена (тот же датасет, та же архитектура, совместно против пары специализированных) на большом скейле за 14 месяцев так и не появилось. Зато появился анализ градиентов, показывающий, что сигналы двух задач ортогональны на уровне обновлений весов. Синергия не опровергнута окончательно, но её измеряют всё хуже, а интерференцию — всё лучше.
Во-вторых, все успешные "унифицированные" системы явно или неявно прячут разделение: в энкодерах (Janus), в раздельных параметрах и MoT (BAGEL), в порядке обучения (BLIP3-o), в отдельных ветках (UniFork). Возможно, это тихое признание сообществом того, что базовое совместное обучение скорее вредит, чем помогает.
В-третьих, параллельно расцвела агентская парадигма: оркестратор берёт две сильные специализированные модели (VLM для понимания, T2I/T2V для генерации), пользуется ими как инструментами и склеивает результаты. На сквозных задачах агентский подход зачастую бьёт унифицированные модели, не сражаясь ни с какой интерференцией между модальностями.
На мой вкус
Обещанное майскими работами 2025-го светлое будущее пока не наступило. Взаимное усиление модальностей реально существует в узких сетапах и на уровне представлений, но не превращается в убедительный практический выигрыш на скейле, а именно этот выигрыш и продавали. Инфраструктурная сложность унифицированных моделей выше, чем у пары специализированных плюс роутер, поэтому бо́льшая часть прод-систем идёт агентским путём. Пока не появится независимой аблейшн на большом скейле — разговор так и будет крутиться вокруг архитектурных уловок.