BaseLine


Channel's geo and language: Russia, Russian
Category: Technologies


Канал Алексей Ковалёва – PhD, тимлид команды Embodied agents в AIRI, доцент ЦКМ МФТИ. Занимаюсь Embodied AI 🤖, LLM Planning, RL
Моё хобби – читать научпоп лекции по ИИ
Здесь делюсь событиями, мыслями, новостями

Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Forward from: Center for Cognitive Modeling
🎓 — Семинар 4. Следование языковым инструкциям в воплощённой среде: планирование с LLM и явные модели мира | Анатолий Онищенко

На семинаре аспирант нашего Центра рассмотрит задачу следования языковой инструкции в домашних и офисных средах, где робот должен по инструкции определить цель и выполнить действия для её достижения. Сделает обзор подходов к высокоуровневому планированию на основе больших языковых моделей.

Отдельное внимание будет уделено надёжности планирования, то есть способам проверки действий, предложенных языковой моделью, а также явным моделям мира, которые можно использовать при планировании и интерпретировать.

В завершение обсудим проблемы оценки таких систем и существующих бенчмарков, а также наш подход к их решению.

👉🏻 Дата: 01.10.26, четверг в 17:00
📹 Трансляция: YouTube или ВКонтакте

Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!


Forward from: Институт AIRI
Объединяем исследователей для обучения ИИ долгосрочному планированию

Владислав Куренков, руководитель научной группы «Адаптивные агенты» Института AIRI, запустил открытое сообщество людей, работающих над системами планирования ИИ, чтобы вместе решить одну из самых неподатливых для искусственного интеллекта игр — NetHack.

У каждого участника будет свой способ получить программу, свои инструменты и своя стратегия, а общая инфраструктура позволит видеть результаты друг друга, сравнивать их между собой и продолжать разрабатывать решения друг друга.

Владислав рассказал, почему NetHack весьма полезна для обучения ИИ:
«Одна партия в NetHack — это десятки тысяч ходов. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. Когда мы запускаем наших ботов играть, то вторая по частоте причина их "смерти" — голод, потому что они не позаботились о еде за несколько тысяч ходов до финального момента. На таких же ошибках спотыкаются ИИ-агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинную дистанцию держать планку не могут. И NetHack в этом плане становится весьма полезной для обучения ИИ».


📎Подробнее про сообщество, игру и «интеллект» агента — в интервью «Ъ-Науке».


Forward from: Embodied AI Reading Club
🔥Всем привет!

📆В эту пятницу (25.09) в 17:00 Никита Качаев разберёт статью

RoboTTT: Context Scaling for Robot Policies

⚫️Авторы исследуют, как масштабировать контекст стратегий благодаря эффективной мета памяти. RoboTTT использует Test Time Train слои, способные эффективно сжимать информацию о прошлых наблюдениях и действиях за счет обновления весов через градиентные шаги онлайн во время выполнения задачи

⚫️На ридинг клубе  разберем, как исследователям из Nvidia удалось заскейлить эффективный контекст GROOT-N1.7 до 8к а также обсудим предложенные авторами идеи Sequence Action Forcing и DAgger Distillation

Статья:
1. RoboTTT: Context Scaling for Robot Policies
   
🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Вредные (но не только) советы от Chris Paxton, которые хорошо раскрывают всю сложность робототехнических экспериментов


Forward from: Center for Cognitive Modeling
🎓 — Семинар 1. Использование человеческих эгоцентричных данных для обучения VLA и WAM моделей | Даниил Зелезецкий

Архитектуры Vision-Language-Action (VLA) в последние годы показали высокую результативность в задачах роботизированной манипуляции, однако их дальнейшее масштабирование во многом ограничивается доступностью обучающих данных.

В отличие от языковых и визуальных моделей, для которых существуют массивные наборы данных, сбор роботизированных траекторий требует использования реального оборудования, телеоперации и значительных временных затрат. В связи с этим человеческие эгоцентричные видео рассматриваются как значительно более масштабируемый источник данных о взаимодействии с физическим миром.

При этом непосредственное использование человеческих данных для обучения робота осложняется различиями в кинематике, морфологии и пространстве действий человека и робота.

Современные подходы решают эту проблему либо за счёт преобразования человеческих движений и построения унифицированного представления действий, либо используя эгоцентричные видео для обучения более общих представлений о динамике окружающего мира, которые затем могут быть перенесены между различными embodiment.


На данном семинаре аспирантом нашего Центра будут рассмотрены современные подходы к использованию человеческих эгоцентричных данных при обучении VLA и World Action Models (WAM).

Отдельное внимание будет уделено двум направлениям: масштабированию VLA за счёт совместного использования человеческих и роботизированных траекторий и обучению WAM, в которых человеческие видео используются для формирования представления о динамике среды и последствиях действий.

Будут рассмотрены преимущества такого подхода, способы переноса знаний между человеком и роботом, а также роль предсказания будущих состояний и латентной динамики в построении более универсальных роботизированных политик.

👉🏻 Дата: 10.09.26, четверг в 17:00
📹 Трансляция: YouTube или ВКонтакте

Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!

#семинары #rl


🔔 В конце рабочего дня не лишним будет очередной раз вспомнить мой любимый анекдот, соответствующий моменту

Поздравлять учителя с первым сентября — всё равно что поздравлять лошадь с началом посевных

С праздником нас, дорогие Учителя и Преподаватели! 😁


Forward from: Институт AIRI
«Лето с AIRI 2026» не заканчивается! Делимся лекциями и семинарами ⏯

Мы записали всё, о чём на протяжении двух недель говорили исследователи и эксперты на летней школе. Собрали целый багаж знаний — 76 видео! — из разных областей ИИ и делимся им с вами, чтобы все могли послушать и узнать для себя что-то новое и интересное.

📎Сохраняйте ссылки на плейлисты: VK Видео, YouTube — и пересылайте их тем, кому тоже может быть полезно)


Forward from: Embodied AI Reading Club
🔥Всем привет!

📆Завтра (28.08) в 18:00 Егор Черепанов разберёт статью

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

Авторы предлагают адаптировать робота к новым условиям с помощью обычных эгоцентрических видео человека — без дополнительных робототехнических демонстраций и разметки действий

⚫️WAM-TTT добавляет в video expert небольшие fast weights, которые через test-time training превращают человеческое видео в параметрическую память. На этапе meta-training модель учится связывать эту память с поведением робота

⚫️Во время deployment основная WAM и action expert остаются замороженными: обновляются только fast weights, причём достаточно одного градиентного шага

Обсудим, чем такая память отличается от обычного контекста и насколько хорошо она позволяет переносить показанное человеком поведение

Статья:
1. WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time
   
🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Forward from: Институт AIRI
Работы исследователей AIRI на RLC 2026

В Канаде, Монреаль, завершилась третья международная конференция по обучению с подкреплением.

Денис Тарасов представил на ней работу "Yes, Q-learning Helps Offline In-Context RL". Среди авторов от института — Владислав Куренков, Александр Никулин, Альбина Клепач, Андрей Полубаров, Никита Любайкин и Александр Деревягин из группы «Адаптивные агенты».

Статья получила Outstanding Paper Award в категории Emerging Topics in RL 🚀

В ней исследователи показали, что Q-learning может заметно улучшить offline in-context RL — обучение модели решать новые задачи по контексту, используя только заранее собранные данные и без дополнительного взаимодействия со средой.

Также на конференции представлена статья Александра Панова, директора лаборатории когнитивных систем искусственного интеллекта, Алексея Ковалёва и Егора Черепанова из группы «Воплощённые агенты» — "Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning".

Работа показывает, что для RL с памятью недостаточно просто долго хранить информацию: агент должен уметь селективно обновлять и забывать устаревшие сведения. Авторы вводят диагностические POMDP-бенчмарки для continual memory rewriting и показывают, что классические рекуррентные модели часто устойчивее трансформеров и сложных RL архитектур с памятью.

#AIRIнаКонфе


Video is unavailable for watching
Show in Telegram
Привет с World Robot Conference! 🤖

Выбираясь из зловещей долины...


RLWRLD запустил интересный сайт All Hands Up ! с подборкой ловких рук 🖐

На нём можно посмотреть URDF, спецификацию, подвигать ползунками каждый джойнт и почитать про опыт работы с такими руками 🔥


Наглядно про рост количества статей с велком ремакс ICML 2026


Всем привет!

Сейчас в Южной Корее проходит одна из топовых конференций по ИИ – ICML 2026. На ней мы представляем одну работу на мейн треке и две на воркшопах.

🚀 KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning
🗓️ Main track, Jul 7, 2:00 – 3:45, HALL A #4409

🚀 (Oral!) Don’t Blind Your VLA: Aligning Visual Representations for OOD Generalization
🗓️ SCALE Workshop – Jul 10, Ballroom 201 

🚀 VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models
🗓️ DEMO Workshop – Jul 11, Ballroom 203

Если вы на конференции, приходите пообщаться и обсудить работы 🤗


Video is unavailable for watching
Show in Telegram
Всем привет! 

Выложили нашу работу “Does VLA Even Know the Basics?” в Daily Papers на Hugging Face 🤗

В статье мы задаёмся простым, но пока почти не изученным вопросом: есть ли в VLA-моделях commonsense знания о мире? 📚

⚡️Мы предлагаем Act2Answer: бенчмарк, где VLA модель отвечает на вопросы не текстом, а действием - кладёт куб на правильный вариант. Проверили 7 VLA и 9 VLM моделей на 12 категориях.

💡Интересные инсайты из работы:

→ VLA хорошо понимают примитивные концепты по типу Цвета и Формы

→ На более сложных категориях (Эмоции, Животные, Симметрия, Время, Счет, История) у VLA сильный дроп в сравнении с VLM

→ Знания есть в весах VLA моделей, однако они не транслируются в действия

→ Котрейнинг на VL данных хорошо помогает сохранять знания

→ SFT/RL файтюнинг на downstream роботикс задачах дергадирует знания

Поддержите нас апвоутом пожалуйста ❤️


Forward from: Институт AIRI
О ключевом элементе в развитии современных роботов — памяти⤵️

Егор Черепанов, младший научный сотрудник группы «Воплощённые агенты» лаборатории когнитивных систем искусственного интеллекта Института AIRI, рассказывает в интервью «Ъ-Науке»:

⚫️что исследователи обычно имеют в виду, говоря о памяти робота
⚫️зачем она нужна современным роботам и какие проблемы могут возникать, если они «не помнят»
⚫️почему адаптация оказывается сложной задачей для роботов
⚫️как работать с памятью и где она хранится

📎Читайте материал по ссылке.


Forward from: Embodied AI Reading Club
🔥Всем привет!

📆Завтра (05.06) в 17:00 Егор Черепанов, Алексей Староверов и Татьяна Земскова разберут архитектуру и методы обучения и инференса модели

RLDX-1

от корейского стартапа RLWRLD и обсудят, почему эту работу уже можно считать заметным вызовым современным VLA-моделям.

⚫️Авторы предлагают VLA-архитектуру для мобильной манипуляции, которая объединяет память на разных уровнях, тактильные сигналы, синтетические данные для редких сценариев и оптимизации инференса для работы в реальном времени.

⚫️Отдельно будет уделено внимание архитектуре MSAT, где разные модальности обрабатываются отдельными потоками и затем связываются через совместное self-attention.

⚫️Также будет разобрано, как эти инженерные и модельные решения переводятся в практический результат: RLDX-1 работает на частоте до 22 Гц на RTX 5090, а в экспериментах на реальном роботе и в симуляции заметно превосходит сильные базовые модели, включая π0.5 и NVIDIA GR00T N1.6. В частности, в задачах для гуманоидного робота ALLEX модель достигает 86.8% успеха против примерно 40% у конкурентов.

⚫️На семинаре обсудим, насколько эти результаты делают RLDX-1 серьёзным конкурентом для Pi0.7 и других SOTA VLA, а также посмотрим, что особенно важно для сообщества: у работы уже доступны код и веса.

Ссылки:
1. Технический репорт
2. Код и веса моделиr

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Forward from: Институт AIRI
Завершилась конференция AAMAS 2026

Международная конференция по автономным агентам и многоагентным системам в этом году проходила с 25 по 29 мая в городе Пафос, Кипр. На ней исследователи лаборатории когнитивных систем искусственного интеллекта AIRI Александр Панов, Алексей Скрынник, Алексей Ковалёв, Егор Черепанов, Мария Нестерова и Антон Андрейчук представили 3 работы⤵️

📎Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
📎Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning
📎MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning

Делимся фотографиями с Кипра📷

#AIRIнаКонфе


Друзья!

Мы с командой @amazing_research просим помочь с проведением пользовательского исследования для статьи

Задача — оценить реалистичность автоматически сгенерированных текстовых контекстов для персонализированной рекомендации фильмов

Прохождение задания занимает около 5 минут и не требует специальных знаний

Telegram-бот: @RecSysUserStudyBot

Заранее спасибо всем, кто пройдет!

Важно пройти его до 5го июня, чтобы мы успели обработать результаты 🤗


Forward from: Center for Cognitive Modeling
🪼 — До конца подачи заявок в магистратуру ЦКМ осталось 2 дня — делимся историями наших студентов!

Первый гость интервью: Максим Бредихин, выпускник бакалавриата МГТУ им. Н. Э. Баумана, студент магистратуры ЦКМ. В Центре он занимается full-body control — это методы, которые позволяют мобильным манипуляторам и антропоморфным роботам расширять свои возможности за счет движения всего тела, а не только отдельных частей.

Как узнал о ЦКМ?
На ROS Meetup. Там я пообщался со студентами и сотрудниками Центра, они рассказали про проекты внутри ЦКМ и про магистерскую программу. Решил поступать именно сюда, так как многие темы были близки с моей научной и профессиональной деятельностью.


Почему именно магистратура ЦКМ?
Меня привлёк разнообразный набор дисциплин: можно глубоко погрузиться в предметную область, разобраться в современных SOTA-методах и в дальнейшем начать писать научные статьи. Также для меня важно, что преподаватели — это действующие исследователи, публикующие A* статьи, которые делятся своим опытом и всегда открыты к сотрудничеству и нетворкингу. Отдельно привлекает техническая возможность работать с реальными роботами и оборудованием, чтобы проверять свои гипотезы не только в симуляции, но и на железе.


Следующая история может быть ваша! Подавайте заявку на собеседование в магистратуру ЦКМ до 1 июня. Подробнее.

Поддержим Максима реакциями🪼


Forward from: Center for Cognitive Modeling
🎓 — Семинар 16. Обобщаемость VLA моделей, выравнивание текстово-визуальных представлений в VLA моделях | Никита Качаев

На семинаре разберёмся, почему VLA-модели после дообучения начинают «забывать», терять фокус и тексто-языковое понимание при обучении на малых робототехнических датасетах, и как метод выравнивания визуальных представлений помогает это исправить. А также на примере результатов на бенчмарке VL-Think посмотрим, насколько хорошо VLA модели усваивают знания из повседневной жизни.

📎Github
👉🏻 Дата: 21.05.26, четверг в 17:00
📹 Трансляция: Youtube или ВК

Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!

#семинары #VLA

20 last posts shown.