TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Concise Research

18 May, 11:47

Открыть в Telegram Поделиться Пожаловаться

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
[код и веса]

Inclusion AI делает unified multimodal dLLM для understanding + generation. В отличие от MAR / Fluid / UniFluid / NexusGen, где генерация строится вокруг AR/MAR-предсказания visual tokens/latents, и от Qwen-Image / HunyuanImage / BAGEL / Transfusion, где обычно есть отдельный VLM/LLM и diffusion/flow head или гибрид NTP + diffusion, здесь ставка на общий discrete diffusion backbone: текст и semantic visual tokens учатся через один block-wise mask prediction objective.

Важное уточнение: Diffusion Decoder тут всё равно отдельный. Поэтому это не «один модуль для всего». Унификация скорее в том, что understanding и generation сходятся в одном dLLM-пространстве SigLIP-VQ токенов; decoder только превращает эти semantic tokens обратно в картинку.


Архитектура


•
SigLIP-VQ tokenizer: картинка кодируется не VAE-like реконструктивными токенами, а семантическими дискретными токенами. Codebook: 16,384 токена, dim 2048. Это должно помогать understanding-задачам, где обычные VQ-VAE токены часто теряют семантику.

• Backbone: 16B MoE dLLM на базе LLaDA2.0-mini. Текстовые и визуальные токены моделируются через block-level masked diffusion objective.

• Diffusion Decoder: отдельный decoder на базе Z-Image-Base, который восстанавливает картинку из semantic visual tokens. То есть dLLM генерирует не пиксельные латенты, а семантические токены, а уже decoder превращает их в изображение.

SPRINT acceleration

Training-free ускорение для dLLM-инференса:
• Sparse prefix retention: прунят KV-cache, причём image tokens можно резать агрессивнее, чем text tokens;
• Non-uniform token unmasking: токены размаскируются не по фиксированному расписанию, а по confidence.

По таблицам это даёт ~1.6x speedup при небольшом среднем падении качества (-0.6 score). Но есть заметные просадки на OCRBench и DPG, что логично: раннее принятие токенов хуже работает там, где важны точные символы и детали.

Данные и обучение

Три стадии:
1. Vision-language alignment: image-caption + text, генерация 256 → 512.
2. Multi-task pretraining: OCR, grounding, counting, VQA, T2I, editing, interleaved generation.
3. SFT: 8k → 16k context, high-quality VQA, генерация, редактирование, CoT и interleaved reasoning.

Для T2I собрали 200M web image-text, после фильтрации осталось 140M. Отдельно увеличивали долю human body и rendered text. Для editing смешивают open-source датасеты и свои синтетические пары, фильтруя/переписывая инструкции через Qwen3-VL.

Результаты

На understanding модель действительно сильно закрывает разрыв с VLM: местами на уровне Qwen2.5-VL-7B, при этом заметно лучше предыдущих diffusion unified моделей.

В генерации:
• GenEval: 0.89, лучший результат среди unified моделей.
• DPG: 87.76, тоже сильный уровень.
• CVTG-2K: лучшая среди unified моделей по text rendering, но dense text всё ещё остаётся слабым местом.
• WISE-Bench: reasoning mode даёт +10%, что хорошо ложится в идею “сначала подумать, потом нарисовать”.

В editing результаты смешанные. На ImgEdit модель лучшая среди unified, но на GEdit уступает специализированным редакторам вроде Qwen-Image-Edit / Z-Image-Edit. Зато на multi-reference editing MICo-Bench показывает SOTA среди сравниваемых моделей: 47.1 overall.

Что важно

Мне кажется, главный вклад не в абсолютном SOTA по каждой задаче, а в аккуратной попытке сделать unified diffusion-LLM без dual-encoder костылей: один semantic discrete tokenizer, один dLLM backbone, один mask prediction objective.

Но слабые места тоже честно видны:
• SigLIP-VQ хорошо несёт семантику, но хуже сохраняет fine-grained details.
• Dense text rendering пока не на уровне лучших специализированных моделей.
• Interleaved reasoning выглядит скорее как ранняя демонстрация направления, чем как полностью зрелая capability.

В целом это одна из самых интересных работ в линии unified multimodal генеративок: ближе не к “VLM + DiT head”, а к настоящей общей дискретной модели для understanding и generation.

446 0 11 2 10
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot