Репост из: Институт AIRI
Работы исследователей AIRI на RLC 2026
В Канаде, Монреаль, завершилась третья международная конференция по обучению с подкреплением.
Денис Тарасов представил на ней работу "Yes, Q-learning Helps Offline In-Context RL". Среди авторов от института — Владислав Куренков, Александр Никулин, Альбина Клепач, Андрей Полубаров, Никита Любайкин и Александр Деревягин из группы «Адаптивные агенты».
Статья получила Outstanding Paper Award в категории Emerging Topics in RL 🚀
В ней исследователи показали, что Q-learning может заметно улучшить offline in-context RL — обучение модели решать новые задачи по контексту, используя только заранее собранные данные и без дополнительного взаимодействия со средой.
Также на конференции представлена статья Александра Панова, директора лаборатории когнитивных систем искусственного интеллекта, Алексея Ковалёва и Егора Черепанова из группы «Воплощённые агенты» — "Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning".
Работа показывает, что для RL с памятью недостаточно просто долго хранить информацию: агент должен уметь селективно обновлять и забывать устаревшие сведения. Авторы вводят диагностические POMDP-бенчмарки для continual memory rewriting и показывают, что классические рекуррентные модели часто устойчивее трансформеров и сложных RL архитектур с памятью.
#AIRIнаКонфе
В Канаде, Монреаль, завершилась третья международная конференция по обучению с подкреплением.
Денис Тарасов представил на ней работу "Yes, Q-learning Helps Offline In-Context RL". Среди авторов от института — Владислав Куренков, Александр Никулин, Альбина Клепач, Андрей Полубаров, Никита Любайкин и Александр Деревягин из группы «Адаптивные агенты».
Статья получила Outstanding Paper Award в категории Emerging Topics in RL 🚀
В ней исследователи показали, что Q-learning может заметно улучшить offline in-context RL — обучение модели решать новые задачи по контексту, используя только заранее собранные данные и без дополнительного взаимодействия со средой.
Также на конференции представлена статья Александра Панова, директора лаборатории когнитивных систем искусственного интеллекта, Алексея Ковалёва и Егора Черепанова из группы «Воплощённые агенты» — "Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning".
Работа показывает, что для RL с памятью недостаточно просто долго хранить информацию: агент должен уметь селективно обновлять и забывать устаревшие сведения. Авторы вводят диагностические POMDP-бенчмарки для continual memory rewriting и показывают, что классические рекуррентные модели часто устойчивее трансформеров и сложных RL архитектур с памятью.
#AIRIнаКонфе