TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
rafanalytics

24 May, 22:35

Открыть в Telegram Поделиться Пожаловаться

Самый жизненный раздел из ML 😱

Вы наверняка видели видосы, где ИИ обучают играть в разные игры: к примеру тут Open AI ещё до появления ChatGPT выпускал довольно хайповый видос про обучения ботов игре в прятки. Подобные идеи относятся к теме Reinforcment Learning (или RL), которую я, почему-то, в университете так и не изучал, хотя вроде брал разные курсы на тему ML 🤔

Но так уж вышло, что недавно преподавание заставило меня разобраться в этой теме подробнее, и больше всего мне понравилось, как идеи из ML можно переносить в целом на процессы в повседневной жизни. Вот две интересных для меня идеи:

1) Мы постоянно прогнозируем свой «профит» и часто завышаем его 🤫

В RL игрок не знает заранее, какой "профит" принесёт то или иное действие. Всё что у него есть — накопленный опыт, на основе которого он учится предсказывать "выгодность" каждого следующего шага. Для этого в RL вводят конкретную Q-функцию, которая оценивает суммарную ожидаемую награду за конкретное действие в конкретной ситуации.

Вот только есть один неприятный момент — так называемый "overestimation bias": это когда игрок склонен завышать свои ожидаемые награды, особенно когда данных ещё мало. Мы делаем то же самое: думаем, что новая работа окажется идеальной, а переезд сразу изменит жизнь к лучшему. Иногда так и выходит, но чаще реальная награда оказывается скромнее ожидаемой, да?))

2) Сначала исследование, а потом эксплуатация 🧑‍🎓

В RL есть два режима.
Во время обучения игрок специально исследует разные действия, даже если некоторые выглядят неоптимально — это так называемый "exploration". Только так можно найти по-настоящему лучшую стратегию. На инференсе же агент переключается в "exploitation": берёт лучшую из найденных стратегий и действует максимально эффективно.

Это хорошая метафора для жизненных этапов: пока есть "ресурс на ошибки" — можно быть в режиме exploration и пробовать разные сферы, роли, проекты (так скажем быть открытым к возможностям). Когда понял, что работает — переключаешься в exploitation.

Так что вывод простой:
Чтобы избежать overestimation bias — можно чуть занизить свои ожидания, а ещё убедиться, что собрал достаточно вводных данных перед тем, как переходить в режим exploitation. И это не всегда про машинное обучение))


Ставь ❤️ если нравятся посты такого формата, где идеи из DS перекладываются на рутину (таким образом я смогу скорректировать наиболее подходящие для блога форматы)
Multi-Agent Hide and Seek
We’ve observed agents discovering progressively more complex tool use while playing a simple game of hide-and-seek. Through training in our new simulated hide-and-seek environment, agents build a series of six distinct strategies and counterstrategies, some of which we did not know our environment s...

3.3k 0 20 9 80
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot