TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
rizzearch

16 Jul 2025, 18:42

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Horizon Reduction Makes RL Scalable

берклийцы сделали бенчмарк OGBench для goal-conditioned RL, где не смогли решить сложные таски → надо что-то изменить, но что? сначала попробовали просто обучаться на бОльшем датасете и в принципе масштабироваться, как делали это в других областях, что решало проблему
We also note that our 1B-sized datasets contain about 1M trajectories and 10M atomic behaviors in manipulation environments, which is similar or even larger than one of the largest robotics datasets to date


но не помогло, сколько экспериментов ни проводи → авторы вспоминают, что эти таски сложны из-за бОльшего горизонта достижения цели, на котором сложнее фиттить value функцию из-за смещенности таргета (по построению) и актора в том числе, ибо стейты сложнее матчить с оптимальными действиями

и здесь авторы стакают много рабочих идей, чтобы заработало:
- добавляют иерархичность в модели (state → subgoal → action), потому что она позволяет размыть удлиненный горизонт решения таски на 2 уровня: на каждом из уровне горизонт получается короче
- политики (high- & low-level как здесь в роботике) обучаются в behavior-cloning стиле на флоу матчинге
- на базе n-step sarsa, но с high-level policy получается SHARSA + есть еще вариант Double SHARSA, где семплируют несколько аутпутов не только у верхне-, но еще и у нижнеуровневой модели
- а Q-функции еще и допом обучаются через кросс энтропию (бинарную, а не другую)

в принципе статью можно считать полезной по экспериментальной базе, где (по их заверениям) эти идеи в комбинации улучшают результат, однако вопросы вызывает пункт в аппендиксе, где авторы пробовали прикрутить трансформер к short-horizon методам → как так получилось, что введение размерности времени в архитектуру не меняет ее перформанс относительно задачи с длинным горизонтом

👀 paper, code

696 0 2 6 5
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot