TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
NLP Wanderer

19 May 2025, 14:22

Открыть в Telegram Поделиться Пожаловаться

Репост из: AI - Arseny Ivanov
Multimodality_lecture_AIKC.pdf
7.4Мб
⬆️ Провел небольшую лекцию о мультимодальных языковых моделях

С ребятами в AI Knowledge Club сейчас проводим курс, где я выступил с лекцией о развитии мультимодальных моделей, задачах и бенчмарках. Попробую рассказать и вам =)

❓ Когда мы подаем в языковую модель большие объёмы текста, она не просто запоминает слова, но и учится извлекать из них смысл, комбинировать разрозненные фрагменты и решать разнообразные NLP-задачи. Однако чтобы создать действительно универсального ассистента, нам нужно научить модель «видеть», «слышать» и понимать не только текст. Как мы можем научить LLM воспринимать другие типы данных?

👀 Отвечая на этот вопрос, в идеале мы бы хотели построить одну большую foundation модель. В докладе рассмотрены три основных концепта: LLM with Tools - оркестратор с function calling. End2end MLLM - это обучение трансформера напрямую на разных данных. Текст и изображения сначала кодируются соответствующими энкодерами, затем их эмбеддинги смешиваются и подаются в модель, которую учат сразу на обоих модальностях. Cross-Modality Learning with Pretrained Models - адаптация латентного пространства изображений к латентному пространству текстовых представлений. Можно сказать мы учим модель понимать разные типы данных.

✏️ Прежде всего, говоря про визуальную модальность, стоит подчеркнуть развитие картиночных encoder-моделей. Чаще всего используют 2 большие группы: (1) foundation backbone архитектуры ViT-семейства (ConvNeXt, Swin и т.д.), и (2) мультимодальные энкодеры (CLIP, DINOv2, EVA-02, ImageBind) — их берут, когда нужны универсальные признаки из коробки. В докладе вы можете найти объяснение устройства ViT - классического patch-трансформера, адаптации архитектуры под картинки, например Pre-LN и его обучения. А также Swin Transformer - адаптация ViT под fine-grained изображения за счет иерархического окна внимания. В том числе есть еще и ConvNeXt – CNN реализованная под ViT и дообученная masked-autoencoder-ом, даёт SOTA при меньшем FLOPs. Второй это self-supervised методы основанные на контрастивном обучении, которые отлично подходят для vision-text-retrieval задач. В презентации найдете описание базового CLIP, а также про InfoNCE и Triplet лоссы. Среди прочего есть и улучшение CLIP, это SigLIP — идея которого упростить распределённое обучение на очень больших батчах, сохранив при этом качество эмбеддингов. Делается это за счет замены Softmax функции на Sigmoid. Также стоит упомянуть и: DINOv2 – ViT обученный в SSL стиле; EVA-02 – открытый masked image + language-aligned ViT; ImageBind (vision encoder) – единое пространство для шести модальностей. Честно говоря различных улучшений со своими идеями vision-encoder-ов очень много, поэтому проще всего посмотреть топ на задачке image classification на imagenet.

💡 С точки зрения фьюза модальностей, можно выделить 3 основных подхода: Early, Intermediate и Late fusion (подробнее смотри презу). Среди таких следует отметить следующие работы, идеи которых часто переиспользуются:

1) Perceiver (Google DeepMind, 2021). Архитектура основанна на трансформере и использует асимметричный механизм внимания, который может итеративно доставать из входа релевантные данные и агрегировать их внутри себя. Может скейлиться на очень большие размеры входа. Основная идея следующая — давайте заведем маленький набор латентных переменных, которые будут через attention обращаться ко входу (потенциально большому) и таким образом окажутся боттлнеком, который должен отсеять важные части входа. Внутри модели повторяются два основных блока: 1) cross-attention, где Q приходит из низкоразмерной латентной части, а K/V из входа, и 2) обычный self-attention трансформера, который переводит эти latent’ы. Стандартное внимание все также остаётся квадратичным, но оно здесь от низкоразмерного latent’а, что дешевле.

869 0 37 4
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot