YaART: Yet Another ART Rendering Technology
Много уже было работ про большие диффузонки. Это еще одна, отличающаяся от предыдущих применением RLHF в production-grade системах и подробными экспериментами по масштабированию не только моделей, но и данных, причем в не очень распространенной для академии каскадной постановке.
Авторы учат Imagen-подобный каскад с разбивкой на три стадии 2.3В-700М-700М на собственном пофильтрованном 330М датасете. В статье подробно описан пайплайн сбора данных для претрена, основанный на большом количестве фильтраций классификаторами качества текстов и картинок + их релевантности. Для последней Super Resolution модельки используют отдельный датасет на 180М картинок с упором на высокое техническое качество.
После претрена идут две стадии файтнюна:
- Supervised на небольшом наборе пар исключительного качества. Его основной целью является улучшение следованию текстов, хотя красивость картинок тоже повышается;
- Дальше идет RL alignment, задизайненый так чтобы еще больше улучшить эстетичность и уменьшить дефектность генераций без ущерба текстовой релевантности.
Основные эксперименты посвящены изучению влияния размеров модели, данных и количества компьюта на качество претрена. Получается, что большие модели учатся быстрее и эффективнее, а вот размер датасета при равномерном семплировании мало влияет на качество. Интересно, что если семплировать данные не равномерно, а брать только топ лучших, то можно найти sweet spot, в котором модель работает даже лучше обученной на полном датасете.
Отдельно показано, что можно обучить меньшую модель до качества основной за счет большего компьюта. Результаты претренов довольно неплохо переносятся на файнтюны, а значит непосредственно связаны с итоговым качеством.
Важная деталь работы - использование асессорских замеров для надежности результатов вообще везде. Авторы замеряются на DrawBench, а также релизят свою корзинку замеров YaBasket-300.
Корзинка доступна на сайте работы, а еще есть упрощенная/укороченная версия папиры на Хабре.
Много уже было работ про большие диффузонки. Это еще одна, отличающаяся от предыдущих применением RLHF в production-grade системах и подробными экспериментами по масштабированию не только моделей, но и данных, причем в не очень распространенной для академии каскадной постановке.
Авторы учат Imagen-подобный каскад с разбивкой на три стадии 2.3В-700М-700М на собственном пофильтрованном 330М датасете. В статье подробно описан пайплайн сбора данных для претрена, основанный на большом количестве фильтраций классификаторами качества текстов и картинок + их релевантности. Для последней Super Resolution модельки используют отдельный датасет на 180М картинок с упором на высокое техническое качество.
После претрена идут две стадии файтнюна:
- Supervised на небольшом наборе пар исключительного качества. Его основной целью является улучшение следованию текстов, хотя красивость картинок тоже повышается;
- Дальше идет RL alignment, задизайненый так чтобы еще больше улучшить эстетичность и уменьшить дефектность генераций без ущерба текстовой релевантности.
Основные эксперименты посвящены изучению влияния размеров модели, данных и количества компьюта на качество претрена. Получается, что большие модели учатся быстрее и эффективнее, а вот размер датасета при равномерном семплировании мало влияет на качество. Интересно, что если семплировать данные не равномерно, а брать только топ лучших, то можно найти sweet spot, в котором модель работает даже лучше обученной на полном датасете.
Отдельно показано, что можно обучить меньшую модель до качества основной за счет большего компьюта. Результаты претренов довольно неплохо переносятся на файнтюны, а значит непосредственно связаны с итоговым качеством.
Важная деталь работы - использование асессорских замеров для надежности результатов вообще везде. Авторы замеряются на DrawBench, а также релизят свою корзинку замеров YaBasket-300.
Корзинка доступна на сайте работы, а еще есть упрощенная/укороченная версия папиры на Хабре.