TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Concise Research

29 Jun, 12:32

Открыть в Telegram Поделиться Пожаловаться

Тексты для T2I, второй акт: переписывание промтов, агенты и Context Gap
[кода нет, новый бенч]

Ранее в Тексты для T2I претрена разбирали две работы про тренировочные кепшены — Structured Captions и Design Choices for Synthetic Captions. Если коротко, обе пришли к выводу, что для T2I-претрена выгодно использовать структурированные кепшены: длинные , с заданным порядком пунктов и единым форматом. Чем плотнее и регулярнее текст в обучении, тем лучше модель учит соответствие текст-картинка.

Побочный эффект - модель ждёт на входе огромную портянку, а пользователь приходит с "make a cool poster". Между распределением тренировочных текстов и распределением реальных юзер-запросов появляется разрыв. И это только первый род проблем. Второй в том что юзер часто опускает в промте контекст, без которого задачу в принципе нельзя решить.

Свежий тех-репорт от Qwen называет суммарный разрыв между предоставленным и необходимым контекстом и предлагает закрывать его не одним репромтером, а агентом. Почему так? Потому что простые репромтеры уже давно делаются и у них есть предел качества

Baseline

В DALL-E 3 учили собственный кепшенер на парах картинка-длинный детальный кепшен. Потом в CogView3 повторили схему на своём датасете. Схема никак не адресует разрыв между распределениями промтов, поэтому в DALL-E 3 API между юзером и моделью используют GPT-4, который ту же короткую фразу расширяет до длинного промта. Работало zero-shot, давало хорошие результаты для своего времени.

Обученный ризонящий rewriter (PromptEnhancer)

Вместе с тех репортом по генеративной модельке команда Hunyuan выкладывала отдельную папиру про PromptEnhancer (обе разбирали тут). Эта модель сначала рассуждает в свободной форме о том, чего в промте не хватает и где проблемы у конкретного T2I, потом выдаёт переписанный промт. Учат через RL: на 24 аспектах (биндинг атрибутов, отрицания, композиция, счёт и т.д.). Получается промтилка, заточенная под слабые места одного конкретного генератора. Минус в переносимости: при смене T2I надо переобучать промтилку и пересобирать реворд модель.

Полноценные агенты с тулами (GenSearcher, MindBrush, GEMS, SCOPE, T2I-Copilot)

Параллельно вышли несколько систем, которые навешивают на генератор агентский слой и расширяют действия за пределы переписки

• В GenSearcher делают упор на RAG: если промту нужен реальный референс (лицо знаменитости, лого, конкретный продукт), агент идёт в поиск и подсовывает топ-найденное в генератор
• В MindBrush добавляют ризонинг перед генерацией . Они же сделали MindBench в котором запрос требует промежуточного вывода
• SCOPE про планирование сложных сцен. Напоминает работу про расписание с увеличением сложности промтов и добавлением деталей по ходу генерации
• В T2I-Copilot пытаются сделать агентную систему (без дообучений) разделением ролей (интерпретатор, генератор, оценщик)

Каждая работа хороша в своём кусочке, но ни одна не покрывает целиком все действия: планирование / ризонинг / поиск / памать / фидбек. Команда Qwen называет их фрагментированными и говорит, что унификация назрела

Qwen-Image-Agent

Авторы формализуют генерацию как условный рендеринг: у нас есть контекст пользователя (промт + опционально доп картинки-кондишены), а нужен генеративный контекст, то есть именно то что нужно для генерации. Чтобы ее устранить агент строит траекторию и на каждом шаге выбирает одно из пяти описанных выше действий. К моменту вызова генератора у системы есть детальный промт + при необходимости визуальные референсы + чек-лист желаемых атрибутов.

В работе есть много технических деталей про то как именно устроить каждое действие. Важно, что они ничего не тренируют, всё работает зеро шот поверх GPT-5.5 для агентской обвязки и Qwen-Image-2.0 как генератора. К фреймворку отдельно сделали бенч IA-Bench.

IA-Bench

Фишка бенча — специально убраны запросы, которые модель может решить мемоизацией (например, исключают слишком известных персонажей), плюс есть замеры промежуточных состояний, по которым можно смотреть правильно ли модель рассуждает.

474 0 7 4
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot