Репост из: AI - Arseny Ivanov
Multimodality_lecture_AIKC.pdf
⬆️ Провел небольшую лекцию о мультимодальных языковых моделях
С ребятами в AI Knowledge Club сейчас проводим курс, где я выступил с лекцией о развитии мультимодальных моделей, задачах и бенчмарках. Попробую рассказать и вам =)
❓ Когда мы подаем в языковую модель большие объёмы текста, она не просто запоминает слова, но и учится извлекать из них смысл, комбинировать разрозненные фрагменты и решать разнообразные NLP-задачи. Однако чтобы создать действительно универсального ассистента, нам нужно научить модель «видеть», «слышать» и понимать не только текст. Как мы можем научить LLM воспринимать другие типы данных?
👀 Отвечая на этот вопрос, в идеале мы бы хотели построить одну большую foundation модель. В докладе рассмотрены три основных концепта: LLM with Tools - оркестратор с function calling. End2end MLLM - это обучение трансформера напрямую на разных данных. Текст и изображения сначала кодируются соответствующими энкодерами, затем их эмбеддинги смешиваются и подаются в модель, которую учат сразу на обоих модальностях. Cross-Modality Learning with Pretrained Models - адаптация латентного пространства изображений к латентному пространству текстовых представлений. Можно сказать мы учим модель понимать разные типы данных.
✏️ Прежде всего, говоря про визуальную модальность, стоит подчеркнуть развитие картиночных encoder-моделей. Чаще всего используют 2 большие группы: (1) foundation backbone архитектуры ViT-семейства (ConvNeXt, Swin и т.д.), и (2) мультимодальные энкодеры (CLIP, DINOv2, EVA-02, ImageBind) — их берут, когда нужны универсальные признаки из коробки. В докладе вы можете найти объяснение устройства ViT - классического patch-трансформера, адаптации архитектуры под картинки, например Pre-LN и его обучения. А также Swin Transformer - адаптация ViT под fine-grained изображения за счет иерархического окна внимания. В том числе есть еще и ConvNeXt – CNN реализованная под ViT и дообученная masked-autoencoder-ом, даёт SOTA при меньшем FLOPs. Второй это self-supervised методы основанные на контрастивном обучении, которые отлично подходят для vision-text-retrieval задач. В презентации найдете описание базового CLIP, а также про InfoNCE и Triplet лоссы. Среди прочего есть и улучшение CLIP, это SigLIP — идея которого упростить распределённое обучение на очень больших батчах, сохранив при этом качество эмбеддингов. Делается это за счет замены Softmax функции на Sigmoid. Также стоит упомянуть и: DINOv2 – ViT обученный в SSL стиле; EVA-02 – открытый masked image + language-aligned ViT; ImageBind (vision encoder) – единое пространство для шести модальностей. Честно говоря различных улучшений со своими идеями vision-encoder-ов очень много, поэтому проще всего посмотреть топ на задачке image classification на imagenet.
💡 С точки зрения фьюза модальностей, можно выделить 3 основных подхода: Early, Intermediate и Late fusion (подробнее смотри презу). Среди таких следует отметить следующие работы, идеи которых часто переиспользуются:
1) Perceiver (Google DeepMind, 2021). Архитектура основанна на трансформере и использует асимметричный механизм внимания, который может итеративно доставать из входа релевантные данные и агрегировать их внутри себя. Может скейлиться на очень большие размеры входа. Основная идея следующая — давайте заведем маленький набор латентных переменных, которые будут через attention обращаться ко входу (потенциально большому) и таким образом окажутся боттлнеком, который должен отсеять важные части входа. Внутри модели повторяются два основных блока: 1) cross-attention, где Q приходит из низкоразмерной латентной части, а K/V из входа, и 2) обычный self-attention трансформера, который переводит эти latent’ы. Стандартное внимание все также остаётся квадратичным, но оно здесь от низкоразмерного latent’а, что дешевле.
С ребятами в AI Knowledge Club сейчас проводим курс, где я выступил с лекцией о развитии мультимодальных моделей, задачах и бенчмарках. Попробую рассказать и вам =)
❓ Когда мы подаем в языковую модель большие объёмы текста, она не просто запоминает слова, но и учится извлекать из них смысл, комбинировать разрозненные фрагменты и решать разнообразные NLP-задачи. Однако чтобы создать действительно универсального ассистента, нам нужно научить модель «видеть», «слышать» и понимать не только текст. Как мы можем научить LLM воспринимать другие типы данных?
👀 Отвечая на этот вопрос, в идеале мы бы хотели построить одну большую foundation модель. В докладе рассмотрены три основных концепта: LLM with Tools - оркестратор с function calling. End2end MLLM - это обучение трансформера напрямую на разных данных. Текст и изображения сначала кодируются соответствующими энкодерами, затем их эмбеддинги смешиваются и подаются в модель, которую учат сразу на обоих модальностях. Cross-Modality Learning with Pretrained Models - адаптация латентного пространства изображений к латентному пространству текстовых представлений. Можно сказать мы учим модель понимать разные типы данных.
✏️ Прежде всего, говоря про визуальную модальность, стоит подчеркнуть развитие картиночных encoder-моделей. Чаще всего используют 2 большие группы: (1) foundation backbone архитектуры ViT-семейства (ConvNeXt, Swin и т.д.), и (2) мультимодальные энкодеры (CLIP, DINOv2, EVA-02, ImageBind) — их берут, когда нужны универсальные признаки из коробки. В докладе вы можете найти объяснение устройства ViT - классического patch-трансформера, адаптации архитектуры под картинки, например Pre-LN и его обучения. А также Swin Transformer - адаптация ViT под fine-grained изображения за счет иерархического окна внимания. В том числе есть еще и ConvNeXt – CNN реализованная под ViT и дообученная masked-autoencoder-ом, даёт SOTA при меньшем FLOPs. Второй это self-supervised методы основанные на контрастивном обучении, которые отлично подходят для vision-text-retrieval задач. В презентации найдете описание базового CLIP, а также про InfoNCE и Triplet лоссы. Среди прочего есть и улучшение CLIP, это SigLIP — идея которого упростить распределённое обучение на очень больших батчах, сохранив при этом качество эмбеддингов. Делается это за счет замены Softmax функции на Sigmoid. Также стоит упомянуть и: DINOv2 – ViT обученный в SSL стиле; EVA-02 – открытый masked image + language-aligned ViT; ImageBind (vision encoder) – единое пространство для шести модальностей. Честно говоря различных улучшений со своими идеями vision-encoder-ов очень много, поэтому проще всего посмотреть топ на задачке image classification на imagenet.
💡 С точки зрения фьюза модальностей, можно выделить 3 основных подхода: Early, Intermediate и Late fusion (подробнее смотри презу). Среди таких следует отметить следующие работы, идеи которых часто переиспользуются:
1) Perceiver (Google DeepMind, 2021). Архитектура основанна на трансформере и использует асимметричный механизм внимания, который может итеративно доставать из входа релевантные данные и агрегировать их внутри себя. Может скейлиться на очень большие размеры входа. Основная идея следующая — давайте заведем маленький набор латентных переменных, которые будут через attention обращаться ко входу (потенциально большому) и таким образом окажутся боттлнеком, который должен отсеять важные части входа. Внутри модели повторяются два основных блока: 1) cross-attention, где Q приходит из низкоразмерной латентной части, а K/V из входа, и 2) обычный self-attention трансформера, который переводит эти latent’ы. Стандартное внимание все также остаётся квадратичным, но оно здесь от низкоразмерного latent’а, что дешевле.