Одно из главных событий 2017 года это создание алгоритма AlphaGo Zero (именно создание, а не победа над белковым игроком). Комбинация технологий и знаний, использованные DeepMind для создания AlphaGo и AlphaGo Zero, завораживает. Seth Weidman в своем посте на Hackernoon смог очень простым языком описать, как работают эти два алгоритма, и какие решения позволили сделать их непобедимыми для человека. Среди прочего, оказывается, что для этой задачи DeepMind не использовал Reinforcement Learning😱.
https://hackernoon.com/the-3-tricks-that-made-alphago-zero-work-f3d47b6686ef
https://hackernoon.com/the-3-tricks-that-made-alphago-zero-work-f3d47b6686ef