Видео недоступно для предпросмотра
Смотреть в Telegram
Всем привет!
Выложили нашу работу “Does VLA Even Know the Basics?” в Daily Papers на Hugging Face 🤗
В статье мы задаёмся простым, но пока почти не изученным вопросом: есть ли в VLA-моделях commonsense знания о мире? 📚
⚡️Мы предлагаем Act2Answer: бенчмарк, где VLA модель отвечает на вопросы не текстом, а действием - кладёт куб на правильный вариант. Проверили 7 VLA и 9 VLM моделей на 12 категориях.
💡Интересные инсайты из работы:
→ VLA хорошо понимают примитивные концепты по типу Цвета и Формы
→ На более сложных категориях (Эмоции, Животные, Симметрия, Время, Счет, История) у VLA сильный дроп в сравнении с VLM
→ Знания есть в весах VLA моделей, однако они не транслируются в действия
→ Котрейнинг на VL данных хорошо помогает сохранять знания
→ SFT/RL файтюнинг на downstream роботикс задачах дергадирует знания
Поддержите нас апвоутом пожалуйста ❤️
Выложили нашу работу “Does VLA Even Know the Basics?” в Daily Papers на Hugging Face 🤗
В статье мы задаёмся простым, но пока почти не изученным вопросом: есть ли в VLA-моделях commonsense знания о мире? 📚
⚡️Мы предлагаем Act2Answer: бенчмарк, где VLA модель отвечает на вопросы не текстом, а действием - кладёт куб на правильный вариант. Проверили 7 VLA и 9 VLM моделей на 12 категориях.
💡Интересные инсайты из работы:
→ VLA хорошо понимают примитивные концепты по типу Цвета и Формы
→ На более сложных категориях (Эмоции, Животные, Симметрия, Время, Счет, История) у VLA сильный дроп в сравнении с VLM
→ Знания есть в весах VLA моделей, однако они не транслируются в действия
→ Котрейнинг на VL данных хорошо помогает сохранять знания
→ SFT/RL файтюнинг на downstream роботикс задачах дергадирует знания
Поддержите нас апвоутом пожалуйста ❤️