TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Concise Research

2 Jul, 16:07

Открыть в Telegram Поделиться Пожаловаться

Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия?

В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время.

Что говорит литература

▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом UI-датасете VQA-точность растёт с 76.6 до 98.7, FID падает с 210.9 до 190.2 при совместном обучении. Валидация на реальных данных (ShareGPT4V) сделана в куда меньшем масштабе, и там эффект уже скромнее.

▶️ FAIR Beyond Language Modeling (март 2026). Смесь текста и видео в претрене совместима с чисто текстовым бейзлайном, а иногда даже его обыгрывает по перплексити. А вот добавление картиночно-текстовых кепшенов (MetaCLIP) в тот же микс даёт худшую текстовую перплексити среди всех рассмотренных смесей. Тот самый налог за мультимодальность теперь измерен на пре-трейне.

▶️ Do Understanding and Generation Fight? (март 2026). Диагностика прямо на Janus-Pro (7B и 1B): попытка одновременно улучшить понимание и генерацию через DPO. На 7B ни один метод не двигает генерационный CLIPScore, на 1B все методы генерацию ухудшают. Градиенты двух задач почти ортогональны (cos ~ 0), а их магнитуды различаются в 11-14 раз — сигналы буквально дерутся между собой. Причина по мнению авторов в дисбалансе информации (~576 токенов на картинку против 30-100 на текст).

▶️ Сам BAGEL — это Mixture-of-Transformer с раздельными параметрами и общим self-attn. С точки зрения весов это уже частичное разделение, спрятанное под словом "унифицированная".

▶️ BLIP3-o и UniFork. Первая показывает, что последовательный претрен (сначала понимание, потом генерация) сохраняет понимание лучше, чем полностью совместный. Вторая ловит, что две задачи хотят противоположных траекторий алаймента модальностей по глубине модели, то есть полностью общий бэкбон противоречит обеим.

Замечания

Во-первых, чистого аблейшена (тот же датасет, та же архитектура, совместно против пары специализированных) на большом скейле за 14 месяцев так и не появилось. Зато появился анализ градиентов, показывающий, что сигналы двух задач ортогональны на уровне обновлений весов. Синергия не опровергнута окончательно, но её измеряют всё хуже, а интерференцию — всё лучше.

Во-вторых, все успешные "унифицированные" системы явно или неявно прячут разделение: в энкодерах (Janus), в раздельных параметрах и MoT (BAGEL), в порядке обучения (BLIP3-o), в отдельных ветках (UniFork). Возможно, это тихое признание сообществом того, что базовое совместное обучение скорее вредит, чем помогает.

В-третьих, параллельно расцвела агентская парадигма: оркестратор берёт две сильные специализированные модели (VLM для понимания, T2I/T2V для генерации), пользуется ими как инструментами и склеивает результаты. На сквозных задачах агентский подход зачастую бьёт унифицированные модели, не сражаясь ни с какой интерференцией между модальностями.

На мой вкус

Обещанное майскими работами 2025-го светлое будущее пока не наступило. Взаимное усиление модальностей реально существует в узких сетапах и на уровне представлений, но не превращается в убедительный практический выигрыш на скейле, а именно этот выигрыш и продавали. Инфраструктурная сложность унифицированных моделей выше, чем у пары специализированных плюс роутер, поэтому бо́льшая часть прод-систем идёт агентским путём. Пока не появится независимой аблейшн на большом скейле — разговор так и будет крутиться вокруг архитектурных уловок.

512 0 5 4 8
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot