🚀Моё близкое знакомство с моделью SAM
🔍Как дошёл до этого:
— В процессе подготовки к финалу, который состоится уже завтра, DLS решил потренироваться в сегментации. Начал с YOLO - куча сверточных слоёв дали неплохой результат на валидации, но хотелось посмотреть и другие модели
— Переключился на SAM и я его могу описать как «графический трансформер» - энкодеры, декодеры, механизмы внимания, работа с эмбеддингами изображений. Есть у него особенность, он работает только с подсказками (изначально так обучался) и есть возможность zero-shot. Zero-shot продемонстрирован на фотке, я предполагаю, что из-за архитектуры трансформера, после обучения у него сложились представления об объектах и модель очень хорошо может их выделять. Довольно мощно
⚙️ Что делать если нет подсказок?
— Можно создать ансамбль из YOLO, детектить объекты и передавать рамки в SAM, получая итоговые маски.
Но на финале DLS (7 задач за 6 часов) такие ансамбли — роскошь :)
— Ещё есть идейка CLIP + SAM: текстовые промпты («объект справа внизу, квадратный, мелкий») CLIP поможет объединить ембеддинги текста с ембеддингами изображений и, так как SAM знает устройство объектов, то можем получить соответствующую маску
На пути R&D: 1186
@RnDLabs | #cv@rndlabs
🔍Как дошёл до этого:
— В процессе подготовки к финалу, который состоится уже завтра, DLS решил потренироваться в сегментации. Начал с YOLO - куча сверточных слоёв дали неплохой результат на валидации, но хотелось посмотреть и другие модели
— Переключился на SAM и я его могу описать как «графический трансформер» - энкодеры, декодеры, механизмы внимания, работа с эмбеддингами изображений. Есть у него особенность, он работает только с подсказками (изначально так обучался) и есть возможность zero-shot. Zero-shot продемонстрирован на фотке, я предполагаю, что из-за архитектуры трансформера, после обучения у него сложились представления об объектах и модель очень хорошо может их выделять. Довольно мощно
⚙️ Что делать если нет подсказок?
— Можно создать ансамбль из YOLO, детектить объекты и передавать рамки в SAM, получая итоговые маски.
Но на финале DLS (7 задач за 6 часов) такие ансамбли — роскошь :)
— Ещё есть идейка CLIP + SAM: текстовые промпты («объект справа внизу, квадратный, мелкий») CLIP поможет объединить ембеддинги текста с ембеддингами изображений и, так как SAM знает устройство объектов, то можем получить соответствующую маску
На пути R&D: 1186
@RnDLabs | #cv@rndlabs