TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Concise Research

2 Jul, 16:07

Open in Telegram Share Report

Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия?

В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время.

Что говорит литература

▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом UI-датасете VQA-точность растёт с 76.6 до 98.7, FID падает с 210.9 до 190.2 при совместном обучении. Валидация на реальных данных (ShareGPT4V) сделана в куда меньшем масштабе, и там эффект уже скромнее.

▶️ FAIR Beyond Language Modeling (март 2026). Смесь текста и видео в претрене совместима с чисто текстовым бейзлайном, а иногда даже его обыгрывает по перплексити. А вот добавление картиночно-текстовых кепшенов (MetaCLIP) в тот же микс даёт худшую текстовую перплексити среди всех рассмотренных смесей. Тот самый налог за мультимодальность теперь измерен на пре-трейне.

▶️ Do Understanding and Generation Fight? (март 2026). Диагностика прямо на Janus-Pro (7B и 1B): попытка одновременно улучшить понимание и генерацию через DPO. На 7B ни один метод не двигает генерационный CLIPScore, на 1B все методы генерацию ухудшают. Градиенты двух задач почти ортогональны (cos ~ 0), а их магнитуды различаются в 11-14 раз — сигналы буквально дерутся между собой. Причина по мнению авторов в дисбалансе информации (~576 токенов на картинку против 30-100 на текст).

▶️ Сам BAGEL — это Mixture-of-Transformer с раздельными параметрами и общим self-attn. С точки зрения весов это уже частичное разделение, спрятанное под словом "унифицированная".

▶️ BLIP3-o и UniFork. Первая показывает, что последовательный претрен (сначала понимание, потом генерация) сохраняет понимание лучше, чем полностью совместный. Вторая ловит, что две задачи хотят противоположных траекторий алаймента модальностей по глубине модели, то есть полностью общий бэкбон противоречит обеим.

Замечания

Во-первых, чистого аблейшена (тот же датасет, та же архитектура, совместно против пары специализированных) на большом скейле за 14 месяцев так и не появилось. Зато появился анализ градиентов, показывающий, что сигналы двух задач ортогональны на уровне обновлений весов. Синергия не опровергнута окончательно, но её измеряют всё хуже, а интерференцию — всё лучше.

Во-вторых, все успешные "унифицированные" системы явно или неявно прячут разделение: в энкодерах (Janus), в раздельных параметрах и MoT (BAGEL), в порядке обучения (BLIP3-o), в отдельных ветках (UniFork). Возможно, это тихое признание сообществом того, что базовое совместное обучение скорее вредит, чем помогает.

В-третьих, параллельно расцвела агентская парадигма: оркестратор берёт две сильные специализированные модели (VLM для понимания, T2I/T2V для генерации), пользуется ими как инструментами и склеивает результаты. На сквозных задачах агентский подход зачастую бьёт унифицированные модели, не сражаясь ни с какой интерференцией между модальностями.

На мой вкус

Обещанное майскими работами 2025-го светлое будущее пока не наступило. Взаимное усиление модальностей реально существует в узких сетапах и на уровне представлений, но не превращается в убедительный практический выигрыш на скейле, а именно этот выигрыш и продавали. Инфраструктурная сложность унифицированных моделей выше, чем у пары специализированных плюс роутер, поэтому бо́льшая часть прод-систем идёт агентским путём. Пока не появится независимой аблейшн на большом скейле — разговор так и будет крутиться вокруг архитектурных уловок.

512 0 5 4 8
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot