LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model[
код и
веса]
Inclusion AI делает unified multimodal dLLM для understanding + generation. В отличие от MAR / Fluid / UniFluid / NexusGen, где генерация строится вокруг AR/MAR-предсказания visual tokens/latents, и от Qwen-Image / HunyuanImage / BAGEL / Transfusion, где обычно есть отдельный VLM/LLM и diffusion/flow head или гибрид NTP + diffusion, здесь ставка на общий discrete diffusion backbone: текст и semantic visual tokens учатся через один block-wise mask prediction objective.
Важное уточнение: Diffusion Decoder тут всё равно отдельный. Поэтому это не «один модуль для всего». Унификация скорее в том, что understanding и generation сходятся в одном dLLM-пространстве SigLIP-VQ токенов; decoder только превращает эти semantic tokens обратно в картинку.
Архитектура
• SigLIP-VQ tokenizer: картинка кодируется не VAE-like реконструктивными токенами, а семантическими дискретными токенами. Codebook: 16,384 токена, dim 2048. Это должно помогать understanding-задачам, где обычные VQ-VAE токены часто теряют семантику.
•
Backbone: 16B MoE dLLM на базе LLaDA2.0-mini. Текстовые и визуальные токены моделируются через block-level masked diffusion objective.
•
Diffusion Decoder: отдельный decoder на базе Z-Image-Base, который восстанавливает картинку из semantic visual tokens. То есть dLLM генерирует не пиксельные латенты, а семантические токены, а уже decoder превращает их в изображение.
SPRINT acceleration
Training-free ускорение для dLLM-инференса:
• S
parse prefix retention: прунят KV-cache, причём image tokens можно резать агрессивнее, чем text tokens;
•
Non-uniform token unmasking: токены размаскируются не по фиксированному расписанию, а по confidence.
По таблицам это даёт ~1.6x speedup при небольшом среднем падении качества (-0.6 score). Но есть заметные просадки на OCRBench и DPG, что логично: раннее принятие токенов хуже работает там, где важны точные символы и детали.
Данные и обучениеТри стадии:
1.
Vision-language alignment: image-caption + text, генерация 256 → 512.
2.
Multi-task pretraining: OCR, grounding, counting, VQA, T2I, editing, interleaved generation.
3.
SFT: 8k → 16k context, high-quality VQA, генерация, редактирование, CoT и interleaved reasoning.
Для T2I собрали 200M web image-text, после фильтрации осталось 140M. Отдельно увеличивали долю human body и rendered text. Для editing смешивают open-source датасеты и свои синтетические пары, фильтруя/переписывая инструкции через Qwen3-VL.
РезультатыНа understanding модель действительно сильно закрывает разрыв с VLM: местами на уровне Qwen2.5-VL-7B, при этом заметно лучше предыдущих diffusion unified моделей.
В генерации:• GenEval: 0.89, лучший результат среди unified моделей.
• DPG: 87.76, тоже сильный уровень.
• CVTG-2K: лучшая среди unified моделей по text rendering, но dense text всё ещё остаётся слабым местом.
• WISE-Bench: reasoning mode даёт +10%, что хорошо ложится в идею “сначала подумать, потом нарисовать”.
В editing результаты смешанные. На ImgEdit модель лучшая среди unified, но на GEdit уступает специализированным редакторам вроде Qwen-Image-Edit / Z-Image-Edit. Зато на multi-reference editing MICo-Bench показывает SOTA среди сравниваемых моделей: 47.1 overall.
Что важноМне кажется, главный вклад не в абсолютном SOTA по каждой задаче, а в аккуратной попытке сделать unified diffusion-LLM без dual-encoder костылей: один semantic discrete tokenizer, один dLLM backbone, один mask prediction objective.
Но слабые места тоже честно видны:
• SigLIP-VQ хорошо несёт семантику, но хуже сохраняет fine-grained details.
• Dense text rendering пока не на уровне лучших специализированных моделей.
• Interleaved reasoning выглядит скорее как ранняя демонстрация направления, чем как полностью зрелая capability.
В целом это одна из самых интересных работ в линии unified multimodal генеративок: ближе не к “VLM + DiT head”, а к настоящей общей дискретной модели для understanding и generation.