TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

28 Oct 2025, 14:25

Открыть в Telegram Поделиться Пожаловаться

❗️Google DeepMind: ИИ создал RL-алгоритм, превзошедший разработанные людьми

В Nature вышла работа команды Дэвида Сильвера (создателя AlphaGo), в которой они разработали подход, где мета-сеть учится генерировать правила обновления для RL-агентов. Также можно ознакомиться с другой работой по метаградиентному RL и его онлайн-версией с мета-обученной функцией

Вместо того, чтобы жёстко прописывать формулы, как в классических методах, система:

- Собирает опыт от популяции агентов в сотнях разных сред
- Обучает мета-сеть, которая производит правила обновления параметров агентов
- Оптимизирует мета-параметры так, чтобы максимизировать долгосрочные награды.

Система сама решает, что предсказывать.

Полученный алгоритм назвали DiscoRL (Discovered Reinforcement Learning). Его протестировали на нескольких бенчмарках:

Atari (57 игр): DiscoRL показал SOTA результаты, превзойдя Rainbow DQN, PPO и другие классические методы по медианной награде.

Обобщение на новые задачи: Без дополнительного обучения алгоритм достиг сильных результатов на ProcGen, показал конкурентные результаты на DMLab, NetHack, Crafter и Sokoban.

Масштабирование: Увеличение разнообразия обучающих сред (с 57 до 103) улучшило обобщение. Система не переобучается на узкий набор задач.

Интересная находка - Обнаруженные предсказания ведут себя не как классические value-функции. Они "активируются" (резко растут) перед значимыми событиями — большими наградами или изменениями политики. Это emergent behavior, который не был заложен изначально.

Что это даёт?

Для исследований:
Меньше времени на ручное проектирование алгоритмов, больше фокуса на разнообразии данных и архитектуре мета-сети.

Для практики: Потенциально более адаптивные алгоритмы для робототехники, игр, оптимизации. Если правила обучения подстраиваются под распределение задач, это может ускорить применение RL в новых доменах.

Это шаг к рекурсивному самоулучшению — системы, которые учатся учиться. Аналогия с биологией: как эволюция создала способность к обучению у животных, так здесь алгоритм "эволюционирует" через опыт популяции агентов.

Ограничения:
1. Обучение требует сотен млн шагов по средам с популяцией агентов.
2. Пока подход протестирован на off-policy RL с replay buffer. Как он работает в on-policy настройках или в continuous control задачах — открытый вопрос.
3. Все эксперименты в симуляторах (Atari, ProcGen и т.д.). Перенос на физических роботов или реальные системы пока не продемонстрирован.
4. Хотя авторы анализируют поведение предсказаний, понять, почему конкретное правило обновления работает, сложнее, чем с явными формулами классических методов.

2.4k 1 50 4 23
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot