TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Concise Research

10 Sep 2025, 15:34

Open in Telegram Share Report

Prev Next
Свежие релизы от Tensent

Многие знают компанию по их весьма неплохой видео модельке HunyuanVideo. На днях случилось два любопытных релиза.

1️⃣ Выложили новую T2I модельку HunyuanImage-2.1. Тех. репорт пока отсутствует, но основные моменты можно понять по описанию в репозиториях с кодом и моделькой.
2️⃣ Модель включает отдельный модуль PromptEnhancer про который авторы рассказывают отдельно.

Хочется разобраться что, собственно, было сделано.

1. HunyuanImage-2.1: An Efficient Diffusion Model for High-Resolution (2K) Text-to-Image Generation​
[код, веса]

Модель представляет собой DiT с двумя текстовыми энкодерами (VLM + ByT5), обученный с REPA на DINOv2 поверх собственного х32 VAE.

Последний пункт интересен тем что про VAE не слова, а вообще хороших х32 VAE кроме DC AE особо и не выходило. Технически, предложенный VAE отличается от DC AE хотя бы тем что имеет аттеншен в ботлнеке, ждем полного тех. репорта для больших подробностей.

После претрена модель дообучают в две стадии: SFT + RLHF (такую же схему мы уже давно используем в YandexART). После этого модель дистиллируют, по заявлению авторов, новым методом дистилляции на основе meanflow, но детали пока отсутствуют.

Использование глубокого автоэнкодера позволяет быстро и качественно генерировать картинки в 2К разрешении, а PromptEnhancer модуль (обсуждаем ниже) улучшает text-image alignment и визуальное качество.

Замеры делают с помощью некого Structured Semantic Alignment Evaluation, SSAE (расскажите если знаете что это) и side-by-side сравнений, в которых текущая OS SOTA в виде HiDream тактично игнорируется.

2. PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
[код, веса]

Еще со времен DALL-E 3 👴 известно, что релевантность T2I моделей повышается если:
- Модель обучить на дискриптивных промтах (потому что в них более четко сформулировано что нужно сделать)
- Выучить некоторую модель переписывания промтов, которая будет делать обычные промты из бенчей и от пользователей более дискриптивными.

Авторы предлагают PromptEnhancer — универсальный фреймворк для переписывания промптов, который улучшает любую T2I-модель без необходимости изменять её веса.

Идея и метод

Ключевая идея — полностью отделить задачу улучшения промпта от задачи генерации изображения. Framework состоит из двух основных компонентов:

1️⃣ CoT Rewriter: модель-переписчик (на базе Hunyuan-7B-Instruct), которая использует методику "цепочки рассуждений" (Chain-of-Thought, CoT). Она анализирует исходный промпт, выявляет потенциальные неоднозначности и обогащает его деталями, касающимися атрибутов, композиции и стилистики, имитируя процесс человеческого мышления.
2️⃣ AlignEvaluator: специализированная модель для оценки выравнивания (alignment) между изображением и текстом. В отличие от общих метрик, AlignEvaluator обучен давать детальную и гранулированную обратную связь на основе системной таксономии из 24 ключевых аспектов (KeyPoints), сгруппированных в 6 категорий (например, понимание отрицаний, подсчет объектов, пространственные отношения, рендеринг текста и т.д.).

Обучение и результаты

Учат в два этапа: дистиллят мощного учителя (Gemini-2.5-Pro), потом делают GRPO на парах где разметку получают из из VLM. По замерам авторов релевантность растёт по всем 24 аспектам на 5.1%, наибольший рост в понимании отношений схожести (+17.3%), контрфактических сценариях (+17.2%) и подсчете объектов (+15.0%).

В работе мне не хватило аблейшена утверждения о том что PromptEnhancer — универсальная система, не зависящая от T2I модели. Впрочем, веса и код открыты, можно проверить.

607 0 7 2 11
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot