Google выложили в открытый доступ работу, где ИИ создал RL-алгоритм, превзошедший разработанные людьми
Это работа команды Дэвида Сильвера (создателя AlphaGo), в которой они разработали подход, где мета-сеть учится генерировать правила обновления для RL-агентов.
Тут мы об этом писали еще в октябре.
Вот GitHub.
Также можно ознакомиться с другой работой по метаградиентному RL и его онлайн-версией с мета-обученной функцией
Это работа команды Дэвида Сильвера (создателя AlphaGo), в которой они разработали подход, где мета-сеть учится генерировать правила обновления для RL-агентов.
Тут мы об этом писали еще в октябре.
Вот GitHub.
Также можно ознакомиться с другой работой по метаградиентному RL и его онлайн-версией с мета-обученной функцией