TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
rafanalytics

24 May, 22:35

Open in Telegram Share Report

Самый жизненный раздел из ML 😱

Вы наверняка видели видосы, где ИИ обучают играть в разные игры: к примеру тут Open AI ещё до появления ChatGPT выпускал довольно хайповый видос про обучения ботов игре в прятки. Подобные идеи относятся к теме Reinforcment Learning (или RL), которую я, почему-то, в университете так и не изучал, хотя вроде брал разные курсы на тему ML 🤔

Но так уж вышло, что недавно преподавание заставило меня разобраться в этой теме подробнее, и больше всего мне понравилось, как идеи из ML можно переносить в целом на процессы в повседневной жизни. Вот две интересных для меня идеи:

1) Мы постоянно прогнозируем свой «профит» и часто завышаем его 🤫

В RL игрок не знает заранее, какой "профит" принесёт то или иное действие. Всё что у него есть — накопленный опыт, на основе которого он учится предсказывать "выгодность" каждого следующего шага. Для этого в RL вводят конкретную Q-функцию, которая оценивает суммарную ожидаемую награду за конкретное действие в конкретной ситуации.

Вот только есть один неприятный момент — так называемый "overestimation bias": это когда игрок склонен завышать свои ожидаемые награды, особенно когда данных ещё мало. Мы делаем то же самое: думаем, что новая работа окажется идеальной, а переезд сразу изменит жизнь к лучшему. Иногда так и выходит, но чаще реальная награда оказывается скромнее ожидаемой, да?))

2) Сначала исследование, а потом эксплуатация 🧑‍🎓

В RL есть два режима.
Во время обучения игрок специально исследует разные действия, даже если некоторые выглядят неоптимально — это так называемый "exploration". Только так можно найти по-настоящему лучшую стратегию. На инференсе же агент переключается в "exploitation": берёт лучшую из найденных стратегий и действует максимально эффективно.

Это хорошая метафора для жизненных этапов: пока есть "ресурс на ошибки" — можно быть в режиме exploration и пробовать разные сферы, роли, проекты (так скажем быть открытым к возможностям). Когда понял, что работает — переключаешься в exploitation.

Так что вывод простой:
Чтобы избежать overestimation bias — можно чуть занизить свои ожидания, а ещё убедиться, что собрал достаточно вводных данных перед тем, как переходить в режим exploitation. И это не всегда про машинное обучение))


Ставь ❤️ если нравятся посты такого формата, где идеи из DS перекладываются на рутину (таким образом я смогу скорректировать наиболее подходящие для блога форматы)
Multi-Agent Hide and Seek
We’ve observed agents discovering progressively more complex tool use while playing a simple game of hide-and-seek. Through training in our new simulated hide-and-seek environment, agents build a series of six distinct strategies and counterstrategies, some of which we did not know our environment s...

3.3k 0 20 9 80
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot