TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Concise Research

3 Jul, 15:38

Открыть в Telegram Поделиться Пожаловаться

Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла унификация?

В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают.

Где мультимодальность реально нужна и агенты её вытягивают

▶️ Знание-ориентированная генерация.
Чистые T2I не знают счёта NBA-финала, курса акций на дату, как выглядит малоизвестное лого. Gen-Searcher через web- и image-search даёт Qwen-Image +16 пунктов на KnowGen и +15 на WISE. Mind-Brush вытягивает Qwen-Image с 0.02 до 0.31 на своём Mind-Bench.

▶️ Reasoning-heavy генерация.
Задачи, где ответ надо сначала посчитать, а потом отрендерить — математика, лабиринты, геометрия. Mind-Brush +27.3% на RISEBench. GenAgent поверх FLUX.1-dev — +23.6 на GenEval++ и +14 на WISE.

▶️ Композитный редактируемый выход.
Слайды, баннеры, инфографика. BannerAgency — 4-агентный пайплайн, отдающий готовый Figma/SVG вместо растра. Ни одна T2I этого не умеет и не будет.

▶️ Multi-reference блендинг и multi-turn.
Qwen-Image-Agent с фидбек-луп и памятью на IA-Bench вытягивает Qwen-Image-2.0 с IA-score 17.4 до 45.4, обгоняя Nano Banana Pro 42.6 и GPT-Image-1.5 35.7.

Что делает западный бигтех

Все они катят агентские фичи (tool use, реальный поиск, ризонинг, оркестрация приложений), а не BAGEL-стайл единую модель.

- Google.
Nano Banana Pro: grounding through Google Search as a tool плюс thinking-режим — модель генерирует до двух промежуточных картинок и уточняет композицию, прежде чем выдать финальную. До 14 референсных изображений в одном шоте.
- OpenAI.
Responses API документирует явную tool-архитектуру. Основная модель сама решает, когда позвать GPT-Image-1.5/2 — это буквально генератор как тул.
- ByteDance.
Seedream 5.0 официально позиционируют как "Real-Time Web Search + Intelligent Logical Reasoning", запуск в Jimeng AI, Jianying, CapCut.
- Adobe.
Firefly AI Assistant описан самим Adobe как "creative agent" и оркестрирует Photoshop, Premiere, Lightroom, Illustrator, Express и Firefly из одного промта, используя 60+ инструментов пакета.

То есть ни одна BAGEL-стайл унифицированная модель как будто в прод не отгружена.

На мой вкус

Разрыв, который не закрывала унификация, агенты закрыли. Выигрыш достаётся там, где мультимодальность нужна по существу задачи (граундинг знаниями, композитный выход, референс-блендинг, многотуровое редактирование). Ботлнек сместился: раньше "модель не умеет", теперь "оркестратор всё решает, но он платный и закрытый". Интересно, что случится с этим балансом, когда открытые MLLM догонят GPT-5.5.

717 0 6 1 1
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot