TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
404 Driver Not Found

20 Aug, 14:20

Открыть в Telegram Поделиться Пожаловаться

Learning Rollout from Sampling: An R1-Style Tokenized Traffic Simulation Model

Сегодняшняя статья о том, как адаптировать RL-алгоритм GRPO к задачам автономного транспорта. Авторы проанализировали распределение энтропии для разных сцен и по результатам сформулировали следующее:

1. У сложных сцен (Waymo Hard) более высокая энтропия токенов, поэтому имеет смысл увеличить exploration.

2. В простых сценах (Waymo Easy), наоборот, излишнее семплирование вносит ненужный шум.

Лучше использовать адаптивное семплирование. Авторы предлагают вариант, где параметр K в TopK зависит от энтропии: K_t = k_min + (k_max — k_min) / (1 + e^(-H_t))

Авторы утверждают, что при таком разделении по сложности после RL уменьшается энтропия и улучшаются метрики в hard-кейсах. От себя добавлю, что не хватает ablation, какое распределение энтропии получается после обычного RL.

Отдельного внимания заслуживают выбор параметров и способ обучения:

🔴 При group-нормализации нет деления на STD, только вычитают среднее — из-за небольшого количества траекторий дисперсия может быть шумной.
🔴 Делают KL-дивергенцию на претрейн-политику (ref-политика).
🔴 В качестве ревордов используют произведение ADE_like_reward и Collision_reward.
🔴 Замораживают энкодер агентов и карты за исключением последнего слоя

Таким образом, авторы предлагают подход для эффективного баланса между exploration и exploitation. Предложенный сетап RL выглядит интересно, и некоторые идеи вполне могут работать на практике.

Разбор подготовил ❣️ Павел Лукьянов
404 driver not found

417 0 11 20
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot