Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла унификация?
В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают.
Где мультимодальность реально нужна и агенты её вытягивают
▶️ Знание-ориентированная генерация.
Чистые T2I не знают счёта NBA-финала, курса акций на дату, как выглядит малоизвестное лого. Gen-Searcher через web- и image-search даёт Qwen-Image +16 пунктов на KnowGen и +15 на WISE. Mind-Brush вытягивает Qwen-Image с 0.02 до 0.31 на своём Mind-Bench.
▶️ Reasoning-heavy генерация.
Задачи, где ответ надо сначала посчитать, а потом отрендерить — математика, лабиринты, геометрия. Mind-Brush +27.3% на RISEBench. GenAgent поверх FLUX.1-dev — +23.6 на GenEval++ и +14 на WISE.
▶️ Композитный редактируемый выход.
Слайды, баннеры, инфографика. BannerAgency — 4-агентный пайплайн, отдающий готовый Figma/SVG вместо растра. Ни одна T2I этого не умеет и не будет.
▶️ Multi-reference блендинг и multi-turn.
Qwen-Image-Agent с фидбек-луп и памятью на IA-Bench вытягивает Qwen-Image-2.0 с IA-score 17.4 до 45.4, обгоняя Nano Banana Pro 42.6 и GPT-Image-1.5 35.7.
Что делает западный бигтех
Все они катят агентские фичи (tool use, реальный поиск, ризонинг, оркестрация приложений), а не BAGEL-стайл единую модель.
- Google.
Nano Banana Pro: grounding through Google Search as a tool плюс thinking-режим — модель генерирует до двух промежуточных картинок и уточняет композицию, прежде чем выдать финальную. До 14 референсных изображений в одном шоте.
- OpenAI.
Responses API документирует явную tool-архитектуру. Основная модель сама решает, когда позвать GPT-Image-1.5/2 — это буквально генератор как тул.
- ByteDance.
Seedream 5.0 официально позиционируют как "Real-Time Web Search + Intelligent Logical Reasoning", запуск в Jimeng AI, Jianying, CapCut.
- Adobe.
Firefly AI Assistant описан самим Adobe как "creative agent" и оркестрирует Photoshop, Premiere, Lightroom, Illustrator, Express и Firefly из одного промта, используя 60+ инструментов пакета.
То есть ни одна BAGEL-стайл унифицированная модель как будто в прод не отгружена.
На мой вкус
Разрыв, который не закрывала унификация, агенты закрыли. Выигрыш достаётся там, где мультимодальность нужна по существу задачи (граундинг знаниями, композитный выход, референс-блендинг, многотуровое редактирование). Ботлнек сместился: раньше "модель не умеет", теперь "оркестратор всё решает, но он платный и закрытый". Интересно, что случится с этим балансом, когда открытые MLLM догонят GPT-5.5.
В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают.
Где мультимодальность реально нужна и агенты её вытягивают
▶️ Знание-ориентированная генерация.
Чистые T2I не знают счёта NBA-финала, курса акций на дату, как выглядит малоизвестное лого. Gen-Searcher через web- и image-search даёт Qwen-Image +16 пунктов на KnowGen и +15 на WISE. Mind-Brush вытягивает Qwen-Image с 0.02 до 0.31 на своём Mind-Bench.
▶️ Reasoning-heavy генерация.
Задачи, где ответ надо сначала посчитать, а потом отрендерить — математика, лабиринты, геометрия. Mind-Brush +27.3% на RISEBench. GenAgent поверх FLUX.1-dev — +23.6 на GenEval++ и +14 на WISE.
▶️ Композитный редактируемый выход.
Слайды, баннеры, инфографика. BannerAgency — 4-агентный пайплайн, отдающий готовый Figma/SVG вместо растра. Ни одна T2I этого не умеет и не будет.
▶️ Multi-reference блендинг и multi-turn.
Qwen-Image-Agent с фидбек-луп и памятью на IA-Bench вытягивает Qwen-Image-2.0 с IA-score 17.4 до 45.4, обгоняя Nano Banana Pro 42.6 и GPT-Image-1.5 35.7.
Что делает западный бигтех
Все они катят агентские фичи (tool use, реальный поиск, ризонинг, оркестрация приложений), а не BAGEL-стайл единую модель.
- Google.
Nano Banana Pro: grounding through Google Search as a tool плюс thinking-режим — модель генерирует до двух промежуточных картинок и уточняет композицию, прежде чем выдать финальную. До 14 референсных изображений в одном шоте.
- OpenAI.
Responses API документирует явную tool-архитектуру. Основная модель сама решает, когда позвать GPT-Image-1.5/2 — это буквально генератор как тул.
- ByteDance.
Seedream 5.0 официально позиционируют как "Real-Time Web Search + Intelligent Logical Reasoning", запуск в Jimeng AI, Jianying, CapCut.
- Adobe.
Firefly AI Assistant описан самим Adobe как "creative agent" и оркестрирует Photoshop, Premiere, Lightroom, Illustrator, Express и Firefly из одного промта, используя 60+ инструментов пакета.
То есть ни одна BAGEL-стайл унифицированная модель как будто в прод не отгружена.
На мой вкус
Разрыв, который не закрывала унификация, агенты закрыли. Выигрыш достаётся там, где мультимодальность нужна по существу задачи (граундинг знаниями, композитный выход, референс-блендинг, многотуровое редактирование). Ботлнек сместился: раньше "модель не умеет", теперь "оркестратор всё решает, но он платный и закрытый". Интересно, что случится с этим балансом, когда открытые MLLM догонят GPT-5.5.