Embodied AI Reading Club


Гео и язык канала: Россия, Русский
Категория: Технологии


Канал книжного клуба команды Embodied agents Лаборатории Cognitive AI Systems AIRI

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


🔥Всем привет!

📆Завтра (05.06) в 17:00 Егор Черепанов, Алексей Староверов и Татьяна Земскова разберут архитектуру и методы обучения и инференса модели

RLDX-1

от корейского стартапа RLWRLD и обсудят, почему эту работу уже можно считать заметным вызовым современным VLA-моделям.

⚫️Авторы предлагают VLA-архитектуру для мобильной манипуляции, которая объединяет память на разных уровнях, тактильные сигналы, синтетические данные для редких сценариев и оптимизации инференса для работы в реальном времени.

⚫️Отдельно будет уделено внимание архитектуре MSAT, где разные модальности обрабатываются отдельными потоками и затем связываются через совместное self-attention.

⚫️Также будет разобрано, как эти инженерные и модельные решения переводятся в практический результат: RLDX-1 работает на частоте до 22 Гц на RTX 5090, а в экспериментах на реальном роботе и в симуляции заметно превосходит сильные базовые модели, включая π0.5 и NVIDIA GR00T N1.6. В частности, в задачах для гуманоидного робота ALLEX модель достигает 86.8% успеха против примерно 40% у конкурентов.

⚫️На семинаре обсудим, насколько эти результаты делают RLDX-1 серьёзным конкурентом для Pi0.7 и других SOTA VLA, а также посмотрим, что особенно важно для сообщества: у работы уже доступны код и веса.

Ссылки:
1. Технический репорт
2. Код и веса моделиr

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Репост из: Институт AIRI
🚀 Открываем приём заявок на Лето с AIRI 2026!

Юбилейная Летняя школа по искусственному интеллекту пройдёт в Первом университетском лицее имени Н.И. Лобачевского при МГУ в городе Усть-Лабинск, Краснодарский край. Даты проведения — с 21 июля по 4 августа.

На школе вы сможете лично пообщаться с известными учёными в области ИИ и найти единомышленников, зарядиться вдохновением и получить новые знания для будущих исследований. В программе — лекции, семинары, постерная сессия, работа над проектами и, конечно, внеучебные активности.

Подать заявку на участие можно по ссылке до 24 мая включительно.

Обучение, питание и проживание обеспечивают организаторы — на вас только транспортные расходы.

Подавайте заявки и делитесь постом с друзьями и коллегами!


Всем привет!🔥

📆 Завтра (03.04) в 17:00 Татьяна Земскова разберет статью

DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge

представленную на NeurIPS 2025, в которой предлагается модель на основе VLA для решения задачи манипуляции, использующая прогнозирование знаний о мире (динамические области пространства, глубину и семантическую сегментацию).

Авторы используют связку «восприятие → прогнозирование → действие», используя блочный механизм внимания для разделения типов знаний, что позволяет роботу формировать абстрактные представления о среде перед планированием движений.

Эксперименты демонстрируют высокое качество решения задачи манипуляции: 76.7% SR на реальном роботе и 4.44 средней длины выполнения на бенчмарке CALVIN ABC-D, подтверждая эффективность подхода как в симуляции, так и в реальных условиях.

Ссылки:
1. DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
2. Код к статье

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


🔥 Выложили запись клуба с разбором победного решения BEHAVIOR Challenge🔥

VK | YouTube


Всем привет!🔥

📆 Сегодня (27.02) в 17:00 Артём Латышев расскажет про:

Объединение моделей мира и Vision-Language-Action моделей

⚫️Модели мира позволяют агенту предсказывать будущие состояния среды и последствия своих действий, что делает возможным генерацию дополнительного обучающего опыта без взаимодействия с реальным миром, предварительную оценку рисков и повышение устойчивости к ситуациям вне обучающего распределения. Универсальный характер задачи построения модели мира также способствует переносу знаний между различными задачами.

⚫️При интеграции с Vision-Language-Action моделями модели мира используют богатые мультимодальные представления, сформированные в крупных Vision-Language и видеомоделях, которые уже содержат обобщённые знания об объектах, физических процессах и их взаимодействиях. Это позволяет повысить качество предсказаний и эффективность обучения.

⚫️Существуют два основных подхода к объединению модели мира и стратегии: в рамках единой архитектуры, совмещающей предсказание и принятие решений, и в виде модульного фреймворка, где модель мира и стратегия реализованы как отдельные компоненты.

⚫️В докладе будут рассмотрены оба подхода на примере COSMOS-Policy как интегрированной модели и GigaBrain-0.5M* как модульной архитектуры, а также обсуждены их ключевые особенности и различия.

Статьи:
1. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
2. GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 В эту пятницу (06.02) в 17:00 Илья Ларченко и Глеб Зарин, победители BEHAVIOR Challenge, разберут своё решение🔥

Задачей в BEHAVIOR Challenge было обучить робота выполнять 50 повседневных задач (от 1 до 15 минут) в реалистичной симуляции используя датасет из 1200 часов ручного управления роботом.

Илья и Глеб рассакажут про:
⚫️Безлайн на основе PI0.5
⚫️Изменения в архитектуре модели (System 2, correlation awareness, mixed trainable attention)
⚫️Оптимизацию обучения
⚫️Ускорение и улучшения во время инференса

Они также покажут примеры успешного выполнения задач, разберут основные паттерны ошибок, продемонстрируют примеры эмерджентного поведения модели при обучении на множестве задач одновременно.

Ссылки:
1. Код решения
2. Статья с детальным описанием решения
3. Пост с примерами
4. Видео разбор решения

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 Сегодня (30.01) в 17:00 Татьяна Земскова и Алексей Староверов проведут:

Разбор решений BEHAVIOR-1K Challenge

Vision-language-action (VLA) модели показали перспективные результаты в решении базовых задач планирования действий: манипуляции и навигации. Но отдельных робототехнических навыков недостаточно для решения высокоуровневых бытовых задач, требующих последовательного выполнения отдельных подзадач для достижения цели. На этой встрече мы поговорим о соревновании BEHAVIOR-1K Challenge (NeurIPS 2025) — одном из ключевых соревнований в области Embodied AI. BEHAVIOR-1K — это бенчмарк из 1000 бытовых задач в реалистичной симуляции, где агенту нужно планировать длинные цепочки действий, ориентироваться в среде и физически взаимодействовать с миром.

Мы рассмотрим сам бенчмарк и соревнование BEHAVIOR-1K Challenge, а также обсудим две работы, которые были представлены к дедлайну соревнования, но будем обсуждать их последние post-challenge версии, где авторам удалось улучшить метрики.

⚫️Сначала коротко рассмотрим решение победителей челленджа, фокусирующееся на адаптации vision-language-action модели под задачи BEHAVIOR-1K и дающее существенный прирост качества за счёт архитектурных и inference-трюков.

⚫️Вторая работа — альтернативный подход от команды Openpi Comet, также показавший высокий результат. Авторы этого подхода сделали упор на исследование влияния различных входных модальностей и метода обучения модели с использованием новых данных демонстраций из симулятора.

Статьи:
1. BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation
2. Сайт BEHAVIOR
3. Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge
4. Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 Сегодня (23.01) в 17:00 Дмитрий Поярков расскажет про:

Основные подходы для комбинации оффлайн и онлайн обучения в RL

Объединение оффлайн и онлайн обучения нейросетевых моделей позволяют объединить сильные стороны двух подходов.

⚫️Оффлайн-обучение эффективно использует накопленные данные, но склонно к переобучению и потому теряет надёжность при смене условий.

⚫️Онлайн-обучение, действуя в режиме непрерывного взаимодействия со средой, вырабатывает более устойчивые стратегии, однако требует существенно больших ресурсов и времени.

Совмещение этих режимов даёт шанс ускорить обучение и повысить надёжность стратегий, однако является нетривиальной задачей. На встрече поговорим об основных проблемах в реализации данной идеи и ключевых методах борьбы с ними.

Статьи:
1. Training Language Models to Follow Instructions with Human Feedback
2. WARP: On the Benefits of Weight Averaged Rewarded Policies
3. PIRLNav: Pretraining with Imitation and RL Finetuning for ObjectNav
4. AWAC: Accelerating Online Reinforcement Learning with Offline Datasets
5. Playing Atari Games with Deep Reinforcement Learning and Human Checkpoint Replay

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club

917 1 14 4 11

Всем привет!🔥

📆 В эту пятницу (26.12) в 17:00 Егор Черепанов расскажет про новые статьи по VLA с памятью:

⚫️MemoryVLA — VLA-модель для настольной манипуляции, которая явно запоминает прошлые шаги, потому что многие задачи манипуляции немарковские и «по одному кадру» не решаются. Модель хранит историю в специальной памяти из двух частей: низкоуровневые визуальные детали и высокоуровневое смысловое резюме, извлекает из неё нужный контекст, объединяет его с текущим наблюдением и на основе этого с помощью диффузионного эксперта предсказывает последовательность действий. За счёт этого MemoryVLA заметно лучше справляется с long-horizon и задачами с временными зависимостями и стабильно превосходит CogACT и pi0 в симуляции и на реальных роботах

⚫️EchoVLA — VLA-модель для long-horizon мобильной манипуляции, которая добавляет явную память и тем самым выходит за пределы марковских стратегий. Она использует две памяти: scene memory (персистентная 3D карта сцены) для пространственного контекста и episodic memory (короткая история мультимодальных состояний) для прогресса задачи; обе извлекаются через coarse-to-fine attention и обуславливают diffusion policy для базы и манипулятора. На предложенном авторами новом бенчмарке MoMani модель стабильно превосходит сильные бейзлайны на long-horizon задачах, показывая, что явная пространственная и эпизодическая память существенно улучшает координацию и успех в mobile manipulation

Статьи:
1. MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
2. EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 Завтра (19.12) в 17:00 Никита Качаев расскажет о двух новых статьях physical intelligence:

⚫️Про метод RECAP [1] для дообучения VLA-моделей при помощи RL на демонстрациях, on-policy траекториях с разряженным сигналом и коррекциях от человека. Разберём извлечение улучшенной стратегии через advantage-conditioning и почему такой метод позволяет заметно повысить качество VLA на long-horizon задачах

⚫️Про перенос навыков от людей на роботов Human-to-Robot [2]. Разберем, можно ли научить робота новым задачам, почти не собирая данных на самом роботе, а используя эгоцентрические видео, записанное человеком. Обсудим, почему такой перенос начинает работать только после достаточного разнообразного претрейна

Статьи:
1. pi06: a VLA That Learns From Experience
2. Emergence of Human to Robot Transfer in Vision-Language-Action Models

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 Завтра (05.12) в 17:00 Даниил Зелезецкий расскажет про

Подходы к повышению визуальной обобщаемости в задаче обучения с подкреплением

Обучаясь на тренировочных средах, вместе с выработкой релевантных навыков агент может запоминать нерелевантную информацию о среде, неожиданное изменение которой спровоцирует падение перфоманса агента. На встрече мы обсудим задачу визуальной обобщаемости, когда нерелевантной информацией может являться фон сцены, освещение, цвета и формы предметов, внешний вид агента и внезапное появление сторонних объектов

Статьи:
1. Reinforcement Learning with Augmented Data
2. Decoupling Value and Policy for Generalization in Reinforcement Learning
3. Learning Invariant Representations for Reinforcement Learning Without Reconstruction

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 Завтра (14.10) в 17:00 Анатолий Онищенко выступит с докладом

Память для LLM агентов или агенты для LLM памяти?

Стандартные подходы к памяти LLM агента не справляются с непрерывным потоком информации. Задача фильтрации и структурирования этих данных сложна и может решаться как заранее заданными правилами, так и силами отдельного LLM-агента.
Мы рассмотрим как различные подходы реализуют память для LLM агентов:

⚫️Karma предлагает модульную систему памяти для воплощённого агента. Долгосрочная память хранит 3D-карту окружения, а краткосрочная — динамически отслеживает изменения в состоянии объектов.
⚫️MemGPT решает проблему ограниченного контекста с помощью иерархической памяти, вдохновлённой ОС. LLM сама управляет своим контекстом, выгружая и подгружая данные из внешнего хранилища.
⚫️A-Mem предлагает подход, где за организацию памяти отвечает отдельный LLM-агент. Он превращает пассивное хранилище в динамическую сеть знаний, самостоятельно создавая связи между новой и существующей информацией.
⚫️G-Memory фокусируется на памяти для систем из нескольких агентов. Авторы вводят иерархическую графовую структуру, которая отслеживает как общие выводы, так и конкретные взаимодействия между агентами, позволяя всей команде учиться на совместном опыте.

Статьи:
1. KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems
2. MemGPT: Towards LLMs as Operating Systems
3. A-Mem: Agentic Memory for LLM Agents
4. G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club

568 0 14 3 11

Всем привет!🔥

📆 В эту пятницу (03.10) в 17:00 Дарья Гиталова выступит с докладом

Между словами и слоями: как LLM принимают решения и обрабатывают информацию

Большие языковые модели сталкиваются с неопределённостью и «галлюцинациями». Мы разберём два подхода к пониманию того, как LLM принимают решения и когда им можно доверять.

Авторы первого подхода демонстрируют, что уверенные, но неверные ответы модели можно предсказывать по динамике полезной информации на всех слоях модели. Вместо анализа только финального слоя предлагается оценивать Layer-wise Usable Information (LI), что позволяет предсказывать ошибки и оценивать надёжность модели без дополнительного обучения.

Второй подход изучает поведение моделей при принятии решений под эпистемической неопределённостью. На основе экспериментов с экономическими лотереями, мы посмотрим, как лексические маркеры вроде «возможно» или «почти точно» влияют на интерпретацию, и почему классическая Prospect Theory работает для LLM далеко не всегда.

Статьи:
1. Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Unanswerable Questions and Ambiguous Prompts
2. Prospect Theory Fails for LLMs: Revealing Instability of Decision-Making under Epistemic Uncertainty

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆 В эту пятницу (05.09) в 17:00 Алиса Петрова выступит с темой

Доверять, понимать, направлять: как механистические инструменты делают LLM надёжнее

Сегодня всё чаще возникает вопрос: можем ли мы не только измерять неопределённость ответов LLM, но и понимать, какие именно внутренние признаки отвечают за рассуждения — и как эти признаки можно использовать для более безопасного и точного управления моделью?

Для обсуждения возьмём три работы:
⚫️Shapley Uncertainty in Natural Language Generation — авторы предлагают использовать значения Шепли для оценки неопределённости текста: насколько конкретное слово или фраза вносит вклад в уверенность модели и когда лучше задать уточняющий вопрос.
⚫️CorrSteer: Steering Improves Task Performance and Safety in LLMs through Correlation-based Sparse Autoencoder Feature Selection — показывают, что можно выбирать полезные латентные признаки через sparse autoencoders и использовать их для управления выводом модели, повышая качество и безопасность.
⚫️I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse Autoencoders — работа о том, как выявлять «признаки рассуждений» внутри LLM, визуализировать их и проверять, насколько они соответствуют человеческой логике.

Обсудим, как такие методы могут помочь строить более надёжные системы, где LLM не только генерирует ответ, но и объясняет, на чём именно он основан.

Статьи:
1. Shapley Uncertainty in Natural Language Generation
2. CorrSteer: Steering Improves Task Performance and Safety in LLMs through Correlation-based Sparse Autoencoder Feature Selection
3. I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse Autoencoders

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club

834 1 12 2 10

Всем привет!🔥

📆 В эту пятницу (29.08) в 17:00 Егор Черепанов расскажет про то

Как на самом деле тестировать память у RL-агентов

Сегодня в исследованиях RL почти каждая новая модель включает какой-то механизм памяти,  но насколько хорошо мы умеем проверять, действительно ли агент её использует?

Для обсуждения мы возьмём три свежих работы:
⚫️POBAX предлагает систематический набор задач, где частичная наблюдаемость делает память ключевым фактором. Эти задачи подобраны так, чтобы простое «увеличение модели» не помогало, и действительно требовалось хранить историю
⚫️Synthetic POMDPs идут ещё дальше: авторы формализуют понятие Memory Demand Structure и показывают, как синтетически конструировать среды с заранее известной «нагрузкой на память». Это позволяет строить тесты для конкретных гипотез
⚫️POPGym Arcade фокусируется на практической стороне: пиксельные среды с MDP/POMDP-близнецами, GPU-ускорение и уникальные инструменты для визуализации, какие именно наблюдения агент запомнил и как они влияют на будущее поведение

Обсудим, как такие инструменты можно использовать для выбора архитектуры, настройки агентов и выявления слабых мест памяти

Статьи:
1. Benchmarking Partial Observability in Reinforcement Learning with a Suite of Memory-Improvable Domains
2. Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling
3. POPGym Arcade: Parallel Pixelated POMDPs

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆Сегодня (8 августа) в 17:00 Даниил Казачков расскажет про то

Как ускорить мультимодальные модели без потери качества (эффективное сокращение визуальных токенов)

Современные мультимодальные модели способны хорошо обрабатывать тексты, изображения и видео. Но за эту универсальность приходится платить: за счет большего числа токенов от фото-видео данных, растет необходимость в больших вычислительных ресурсах, падает скорость инференса. Можно ли уменьшить количество визуальных токенов, не жертвуя точностью?

В докладе разберём ключевые подходы к сжатию визуальной информации в LLM-пайплайне: от удаления малозначимых токенов до их кластеризации и отбора максимально разнообразного подмножества. Обсудим, как решается задача отбора токенов без обучения и почему классические метрики важности не работают в эгоцентричных видео. Покажем, как архитектуры вроде PACT, EgoPrune, DivPrune и HiPrune делают визуально-языковые модели быстрее и легче, сохраняя при этом высокую точность на десятках датасетов

Статьи:
1. DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
2. PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models
3. EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
4. HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆В эту пятницу (4 июля) в 17:00 Алиса Петрова расскажет про

Как научить LLM задавать уточняющие вопросы и работать с неоднозначными инструкциями?

Современные LLM всё чаще используются в диалоговых агентах и инструментах автоматизации, но их работа часто страдает из-за неясных или двусмысленных запросов. Как научить модели распознавать неопределённость и просить уточнения? Какие типы неоднозначностей мешают им чаще всего? И как самоисправление помогает в использовании инструментов?

В докладе разберём ключевые подходы к генерации уточняющих вопросов — от предсказания будущих реплик в диалоге до классификации типов неоднозначностей. Обсудим, почему LLM часто молчат вместо того, чтобы переспросить, как моделировать контекст для лучшего уточнения и какие методы self-correction улучшают работу с инструментами

Статьи:
1. Learning to Ask: When LLM Agents Meet Unclear Instruction
2. Modeling Future Conversation Turns to Teach LLMs to Ask Clarifying Questions
3. Clarifying Ambiguities: on the Role of Ambiguity Types in Prompting Methods for Clarification Generation
4. AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆В эту пятницу (6 июня) в 17:00 Дарья Гиталова расскажет про

Подходы к измерению и контролю неопределённости в planning- и reasoning-сценариях с LLM

Большие языковые модели всё чаще используются для планирования и генерации формальных знаний — от логических доказательств до инструкций для роботов. Однако их вывод сопровождается различными формами неопределённости, которые важно уметь выявлять и контролировать

В докладе рассматриваются современные методы выявления и калибровки неопределённости LLM — от вероятностных контекстно-свободных грамматик (PCFG) до attention-based маргинализации цепочек рассуждений. Обсудим, как грамматические структуры помогают предсказывать провалы в логических задачах, почему роботы «теряются» при расплывчатых референциях в пользовательских инструкциях и как количество примеров влияет на эпистемическую неопределённость в сложных задачах

Статьи:
1. REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
2. Grammars of Formal Uncertainty: When to Trust LLMs in Automated Reasoning Tasks
3. Uncertainty Unveiled: Can Exposure to More In-context Examples Mitigate Uncertainty for Large Language Models?
4. Language Model Uncertainty Quantification with Attention Chain

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆Сегодня (23 мая) в 16:00
Егор Черепанов
расскажет про

DBGFQN: компактный трансформер с двунаправленной памятью для POMDP

В частично наблюдаемых средах агенту доступна лишь ограниченная информация о состоянии мира, поэтому для принятия решений он должен опираться на память о прошлом. Классические RNN — лёгкие, но плохо запоминают долгосрочные зависимости; трансформеры справляются с этим лучше, однако становятся громоздкими: до 80 % параметров приходится на feed-forward блоки. Недавняя работа DBGFQN [1] показывает, что эти блоки можно вовсе убрать и заменить всего одним слоем двунаправленного GRU после self-attention. Это снижает число параметров на 25 %, ускоряет обучение и существенно повышает качество — вплоть до +80 п.п. успеха в сложных задачах с частичной наблюдаемостью

На встрече обсудим:
⚫️Почему FFN-блок не обязателен и где он даже вредит
⚫️Как двунаправленная GRU дополняет контекст на текущем шаге;
⚫️Практические выводы для роботов и edge-RL: меньше вес — дольше батарея

Статьи:
1. Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Всем привет!🔥

📆Сегодня (18 апреля) в 16:00
Данил Григорьев
расскажет про

VLA: коррекция ошибок и усиление через обучение с подкреплением

В последнее время активно развиваются Vision-Language-Action модели (VLA) для роботизированной манипуляции. Основные задачи: обработка ошибок, адаптация к новым сценариям и оптимизация производительности. Работы [1-4] предлагают новые подходы к решению этих проблем. SC-VLA [1] использует двухсистемную архитектуру с механизмом самокоррекции. RoboDexVLM [2] расширяет возможности VLA для ловкой манипуляции с долгосрочным планированием. LIV [3] объединяет обучение представлениям и функций вознаграждения из видео без действий. RPD [4] применяет дистилляцию стратегий с RL для преобразования обобщенных VLA в высокопроизводительные экспертные модели. Эти методы показывают, как сочетание коррекции ошибок и обучения с подкреплением улучшает возможности VLA моделей

Статьи:
1. A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation
2. RoboDexVLM: Visual Language Model-Enabled Task Planning and Motion Control for Dexterous Robot Manipulation
3. LIV: Language-Image Representations and Rewards for Robotic Control
4. Refined Policy Distillation: From VLA Generalists to RL Experts

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club

569 0 19 1 10
Показано 20 последних публикаций.