TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Concise Research

16 Jul 2025, 16:08

Открыть в Telegram Поделиться Пожаловаться

Тексты для T2I претрена

Тема актуальная потому что сильно влияет на качество. Статей по ней мало потому что аблейтить дорого. Казалось бы, не жили нормально, нечего и начинать. Но за последний месяц, как манна небесная, на нас снезошли аж две работы по теме, которые хочется обсудить.

Важно напомнить, что естественные кепшены (прикартиночные тексты из интернета) уже давно мало кто воспринимает всерьез из-за их низкого среднего качества. Иными словами, вопроса кепшенить ли картинки для обучения не стоит. Тем не менее, в том как именно это делать есть много нюансов.

1. Structured Captions Improve Prompt Adherence in Text-to-Image Models
Авторы этой работы исходят из предположения, что ключ к хорошим кепшенам — наличие в них строгой структуры:
- Всегда 4 предложения на картинку;
- Каждое предложение имеет свой фокус: объект, локация, эстетика, настройки камеры;
- Порядок предложений тоже задан и всегда одинаков.

Для верификации гипотезы дообучают PixArt на пофильтрованном сабсете LAION размера 19М, кепшены для которых делают двух видов: с заданным порядком как выше и без него. Последующие генерации верифицируют с помощью вопросом VQA модели о том находится ли некий объект на изображении. Из большего числа правильных ответов делают вывод, что структурированные кепшены полезны.

2. How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
Авторов этой работы больше интересует длина и разнообразие кепшенов. Важно, для своих экспериментов они кепшенят сабсет LAION-aesthetics, при этом в качестве бейзлайна для проверки некоторых гипотез используют оригинальные прикартиночные тексты (оч слабый бейзлайн).

Из странностей отмечу SDv1.1 в качестве стартового чекпоинта для дообучения моделей. Мне кажется, это вообще первый на моей памяти случай такого выбора.

Итак, что выяснили авторы: длинные и очень подробные кепшены не всегда хороши. Если использовать только их, может проседать разнообразие и эстетичность генераций. Частично это можно чинить уменьшением температуры семплирования либо увеличением вариативности кепшенов.

Есть и другие минорные и более очевидные наблюдения. Например, кепшены должны быть вариативны внутри каждой эпохи обучения. Также понятно, что через кепшены можно вносить в модель всякие байесы.

888 0 11 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot