Свежие релизы от Tensent
Многие знают компанию по их весьма неплохой видео модельке HunyuanVideo. На днях случилось два любопытных релиза.
1️⃣ Выложили новую T2I модельку HunyuanImage-2.1. Тех. репорт пока отсутствует, но основные моменты можно понять по описанию в репозиториях с кодом и моделькой.
2️⃣ Модель включает отдельный модуль PromptEnhancer про который авторы рассказывают отдельно.
Хочется разобраться что, собственно, было сделано.
1. HunyuanImage-2.1: An Efficient Diffusion Model for High-Resolution (2K) Text-to-Image Generation
[код, веса]
Модель представляет собой DiT с двумя текстовыми энкодерами (VLM + ByT5), обученный с REPA на DINOv2 поверх собственного х32 VAE.
Последний пункт интересен тем что про VAE не слова, а вообще хороших х32 VAE кроме DC AE особо и не выходило. Технически, предложенный VAE отличается от DC AE хотя бы тем что имеет аттеншен в ботлнеке, ждем полного тех. репорта для больших подробностей.
После претрена модель дообучают в две стадии: SFT + RLHF (такую же схему мы уже давно используем в YandexART). После этого модель дистиллируют, по заявлению авторов, новым методом дистилляции на основе meanflow, но детали пока отсутствуют.
Использование глубокого автоэнкодера позволяет быстро и качественно генерировать картинки в 2К разрешении, а PromptEnhancer модуль (обсуждаем ниже) улучшает text-image alignment и визуальное качество.
Замеры делают с помощью некого Structured Semantic Alignment Evaluation, SSAE (расскажите если знаете что это) и side-by-side сравнений, в которых текущая OS SOTA в виде HiDream тактично игнорируется.
2. PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
[код, веса]
Еще со времен DALL-E 3 👴 известно, что релевантность T2I моделей повышается если:
- Модель обучить на дискриптивных промтах (потому что в них более четко сформулировано что нужно сделать)
- Выучить некоторую модель переписывания промтов, которая будет делать обычные промты из бенчей и от пользователей более дискриптивными.
Авторы предлагают PromptEnhancer — универсальный фреймворк для переписывания промптов, который улучшает любую T2I-модель без необходимости изменять её веса.
Идея и метод
Ключевая идея — полностью отделить задачу улучшения промпта от задачи генерации изображения. Framework состоит из двух основных компонентов:
1️⃣ CoT Rewriter: модель-переписчик (на базе Hunyuan-7B-Instruct), которая использует методику "цепочки рассуждений" (Chain-of-Thought, CoT). Она анализирует исходный промпт, выявляет потенциальные неоднозначности и обогащает его деталями, касающимися атрибутов, композиции и стилистики, имитируя процесс человеческого мышления.
2️⃣ AlignEvaluator: специализированная модель для оценки выравнивания (alignment) между изображением и текстом. В отличие от общих метрик, AlignEvaluator обучен давать детальную и гранулированную обратную связь на основе системной таксономии из 24 ключевых аспектов (KeyPoints), сгруппированных в 6 категорий (например, понимание отрицаний, подсчет объектов, пространственные отношения, рендеринг текста и т.д.).
Обучение и результаты
Учат в два этапа: дистиллят мощного учителя (Gemini-2.5-Pro), потом делают GRPO на парах где разметку получают из из VLM. По замерам авторов релевантность растёт по всем 24 аспектам на 5.1%, наибольший рост в понимании отношений схожести (+17.3%), контрфактических сценариях (+17.2%) и подсчете объектов (+15.0%).
В работе мне не хватило аблейшена утверждения о том что PromptEnhancer — универсальная система, не зависящая от T2I модели. Впрочем, веса и код открыты, можно проверить.
Многие знают компанию по их весьма неплохой видео модельке HunyuanVideo. На днях случилось два любопытных релиза.
1️⃣ Выложили новую T2I модельку HunyuanImage-2.1. Тех. репорт пока отсутствует, но основные моменты можно понять по описанию в репозиториях с кодом и моделькой.
2️⃣ Модель включает отдельный модуль PromptEnhancer про который авторы рассказывают отдельно.
Хочется разобраться что, собственно, было сделано.
1. HunyuanImage-2.1: An Efficient Diffusion Model for High-Resolution (2K) Text-to-Image Generation
[код, веса]
Модель представляет собой DiT с двумя текстовыми энкодерами (VLM + ByT5), обученный с REPA на DINOv2 поверх собственного х32 VAE.
Последний пункт интересен тем что про VAE не слова, а вообще хороших х32 VAE кроме DC AE особо и не выходило. Технически, предложенный VAE отличается от DC AE хотя бы тем что имеет аттеншен в ботлнеке, ждем полного тех. репорта для больших подробностей.
После претрена модель дообучают в две стадии: SFT + RLHF (такую же схему мы уже давно используем в YandexART). После этого модель дистиллируют, по заявлению авторов, новым методом дистилляции на основе meanflow, но детали пока отсутствуют.
Использование глубокого автоэнкодера позволяет быстро и качественно генерировать картинки в 2К разрешении, а PromptEnhancer модуль (обсуждаем ниже) улучшает text-image alignment и визуальное качество.
Замеры делают с помощью некого Structured Semantic Alignment Evaluation, SSAE (расскажите если знаете что это) и side-by-side сравнений, в которых текущая OS SOTA в виде HiDream тактично игнорируется.
2. PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
[код, веса]
Еще со времен DALL-E 3 👴 известно, что релевантность T2I моделей повышается если:
- Модель обучить на дискриптивных промтах (потому что в них более четко сформулировано что нужно сделать)
- Выучить некоторую модель переписывания промтов, которая будет делать обычные промты из бенчей и от пользователей более дискриптивными.
Авторы предлагают PromptEnhancer — универсальный фреймворк для переписывания промптов, который улучшает любую T2I-модель без необходимости изменять её веса.
Идея и метод
Ключевая идея — полностью отделить задачу улучшения промпта от задачи генерации изображения. Framework состоит из двух основных компонентов:
1️⃣ CoT Rewriter: модель-переписчик (на базе Hunyuan-7B-Instruct), которая использует методику "цепочки рассуждений" (Chain-of-Thought, CoT). Она анализирует исходный промпт, выявляет потенциальные неоднозначности и обогащает его деталями, касающимися атрибутов, композиции и стилистики, имитируя процесс человеческого мышления.
2️⃣ AlignEvaluator: специализированная модель для оценки выравнивания (alignment) между изображением и текстом. В отличие от общих метрик, AlignEvaluator обучен давать детальную и гранулированную обратную связь на основе системной таксономии из 24 ключевых аспектов (KeyPoints), сгруппированных в 6 категорий (например, понимание отрицаний, подсчет объектов, пространственные отношения, рендеринг текста и т.д.).
Обучение и результаты
Учат в два этапа: дистиллят мощного учителя (Gemini-2.5-Pro), потом делают GRPO на парах где разметку получают из из VLM. По замерам авторов релевантность растёт по всем 24 аспектам на 5.1%, наибольший рост в понимании отношений схожести (+17.3%), контрфактических сценариях (+17.2%) и подсчете объектов (+15.0%).
В работе мне не хватило аблейшена утверждения о том что PromptEnhancer — универсальная система, не зависящая от T2I модели. Впрочем, веса и код открыты, можно проверить.