Тексты для T2I претрена
Тема актуальная потому что сильно влияет на качество. Статей по ней мало потому что аблейтить дорого. Казалось бы, не жили нормально, нечего и начинать. Но за последний месяц, как манна небесная, на нас снезошли аж две работы по теме, которые хочется обсудить.
Важно напомнить, что естественные кепшены (прикартиночные тексты из интернета) уже давно мало кто воспринимает всерьез из-за их низкого среднего качества. Иными словами, вопроса кепшенить ли картинки для обучения не стоит. Тем не менее, в том как именно это делать есть много нюансов.
1. Structured Captions Improve Prompt Adherence in Text-to-Image Models
Авторы этой работы исходят из предположения, что ключ к хорошим кепшенам — наличие в них строгой структуры:
- Всегда 4 предложения на картинку;
- Каждое предложение имеет свой фокус: объект, локация, эстетика, настройки камеры;
- Порядок предложений тоже задан и всегда одинаков.
Для верификации гипотезы дообучают PixArt на пофильтрованном сабсете LAION размера 19М, кепшены для которых делают двух видов: с заданным порядком как выше и без него. Последующие генерации верифицируют с помощью вопросом VQA модели о том находится ли некий объект на изображении. Из большего числа правильных ответов делают вывод, что структурированные кепшены полезны.
2. How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
Авторов этой работы больше интересует длина и разнообразие кепшенов. Важно, для своих экспериментов они кепшенят сабсет LAION-aesthetics, при этом в качестве бейзлайна для проверки некоторых гипотез используют оригинальные прикартиночные тексты (оч слабый бейзлайн).
Из странностей отмечу SDv1.1 в качестве стартового чекпоинта для дообучения моделей. Мне кажется, это вообще первый на моей памяти случай такого выбора.
Итак, что выяснили авторы: длинные и очень подробные кепшены не всегда хороши. Если использовать только их, может проседать разнообразие и эстетичность генераций. Частично это можно чинить уменьшением температуры семплирования либо увеличением вариативности кепшенов.
Есть и другие минорные и более очевидные наблюдения. Например, кепшены должны быть вариативны внутри каждой эпохи обучения. Также понятно, что через кепшены можно вносить в модель всякие байесы.
Тема актуальная потому что сильно влияет на качество. Статей по ней мало потому что аблейтить дорого. Казалось бы, не жили нормально, нечего и начинать. Но за последний месяц, как манна небесная, на нас снезошли аж две работы по теме, которые хочется обсудить.
Важно напомнить, что естественные кепшены (прикартиночные тексты из интернета) уже давно мало кто воспринимает всерьез из-за их низкого среднего качества. Иными словами, вопроса кепшенить ли картинки для обучения не стоит. Тем не менее, в том как именно это делать есть много нюансов.
1. Structured Captions Improve Prompt Adherence in Text-to-Image Models
Авторы этой работы исходят из предположения, что ключ к хорошим кепшенам — наличие в них строгой структуры:
- Всегда 4 предложения на картинку;
- Каждое предложение имеет свой фокус: объект, локация, эстетика, настройки камеры;
- Порядок предложений тоже задан и всегда одинаков.
Для верификации гипотезы дообучают PixArt на пофильтрованном сабсете LAION размера 19М, кепшены для которых делают двух видов: с заданным порядком как выше и без него. Последующие генерации верифицируют с помощью вопросом VQA модели о том находится ли некий объект на изображении. Из большего числа правильных ответов делают вывод, что структурированные кепшены полезны.
2. How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
Авторов этой работы больше интересует длина и разнообразие кепшенов. Важно, для своих экспериментов они кепшенят сабсет LAION-aesthetics, при этом в качестве бейзлайна для проверки некоторых гипотез используют оригинальные прикартиночные тексты (оч слабый бейзлайн).
Из странностей отмечу SDv1.1 в качестве стартового чекпоинта для дообучения моделей. Мне кажется, это вообще первый на моей памяти случай такого выбора.
Итак, что выяснили авторы: длинные и очень подробные кепшены не всегда хороши. Если использовать только их, может проседать разнообразие и эстетичность генераций. Частично это можно чинить уменьшением температуры семплирования либо увеличением вариативности кепшенов.
Есть и другие минорные и более очевидные наблюдения. Например, кепшены должны быть вариативны внутри каждой эпохи обучения. Также понятно, что через кепшены можно вносить в модель всякие байесы.