Монти Холл, A/B-тесты, вредность подглядывания и wishful thinking
Парадоксы вероятности полезны не потому, что это красивые фокусы для скучающих математиков. Fпотому, что очень точно показывают, где ломается человеческая интуиция. А потом в том же месте бывает ломается и прикладная аналитика.
Разные вариации парадокса Монти Холла любят спрашивать на аналитических собеседованиях и сейчас мы попробуем понять зачем это нужно.
Парадокс Монти Холла устроен просто. Есть три двери: за одной приз, за двумя пусто. Вы выбираете дверь. Потом ведущий, который знает, где приз, открывает одну из двух оставшихся — обязательно пустую — и предлагает вам поменять выбор. И вам нужно решить, стоит менять дверь, или нет?
Интуиция подсказывает, что теперь шансы 50 на 50, и никакой разницы нет. Но это не так: изначально ваша дверь была правильной с вероятностью 1/3, а две другие вместе — с вероятностью 2/3. Ведущий не случайно убирает пустую дверь, поэтому эти 2/3 не исчезают, а переезжают в оставшуюся закрытую дверь. Менять выбор выгодно.
Ключевой урок тут не про двери, а про процедуру. Вероятность зависит не только от того, что мы увидели, но и от того, как именно это произошло. Значение имеет не просто открытая дверь, а то, что ее открыл информированный ведущий по строгому правилу. В Монти Холле люди игнорируют стратегию ведущего. В A/B-тестах — собственную стратегию остановки.
Команда запускает эксперимент и начинает заглядывать в метрики каждые несколько часов. Утром p-value 0.12, днём 0.08, вечером 0.04 — отлично, вариант B победил, можно останавливаться. На человеческом языке это называется «быстро приняли решение». На статистическом — дали случаю достаточно попыток, чтобы он выдал красивую цифру.
Смотреть на метрики само по себе не проблема. Это можно делать хоть каждые пять минут. Проблема начинается там, где решение принимают по незапланированному промежуточному результату. Уровень значимости 0.05 работает только внутри заранее прописанной процедуры: какая главная метрика, какой горизонт теста, какой объём выборки, какое правило остановки. Если правил нет, эксперимент быстро превращается в слот-машину: дёргаем ручку, пока не выпадет нужная комбинация.
Именно так обычно выглядит wishful thinking в аналитике. Не как подлог и не как откровенная глупость. Гораздо чаще это звучит вполне респектабельно: “давайте посмотрим ещё день”, “почти значимо”, “нужно чуть больше данных”.
Поэтому Монти Холл и плохой A/B-тест — одна и та же история. Люди ошибаются не потому, что не умеют считать, а потому что игнорируют механизм получения информации. И это, пожалуй, самая дорогая форма wishful thinking в аналитике: когда человек уверен, что принимает решение основанное на данных, хотя на самом деле опирается на следы собственного нетерпения.
Парадоксы вероятности полезны не потому, что это красивые фокусы для скучающих математиков. Fпотому, что очень точно показывают, где ломается человеческая интуиция. А потом в том же месте бывает ломается и прикладная аналитика.
Разные вариации парадокса Монти Холла любят спрашивать на аналитических собеседованиях и сейчас мы попробуем понять зачем это нужно.
Парадокс Монти Холла устроен просто. Есть три двери: за одной приз, за двумя пусто. Вы выбираете дверь. Потом ведущий, который знает, где приз, открывает одну из двух оставшихся — обязательно пустую — и предлагает вам поменять выбор. И вам нужно решить, стоит менять дверь, или нет?
Интуиция подсказывает, что теперь шансы 50 на 50, и никакой разницы нет. Но это не так: изначально ваша дверь была правильной с вероятностью 1/3, а две другие вместе — с вероятностью 2/3. Ведущий не случайно убирает пустую дверь, поэтому эти 2/3 не исчезают, а переезжают в оставшуюся закрытую дверь. Менять выбор выгодно.
Ключевой урок тут не про двери, а про процедуру. Вероятность зависит не только от того, что мы увидели, но и от того, как именно это произошло. Значение имеет не просто открытая дверь, а то, что ее открыл информированный ведущий по строгому правилу. В Монти Холле люди игнорируют стратегию ведущего. В A/B-тестах — собственную стратегию остановки.
Команда запускает эксперимент и начинает заглядывать в метрики каждые несколько часов. Утром p-value 0.12, днём 0.08, вечером 0.04 — отлично, вариант B победил, можно останавливаться. На человеческом языке это называется «быстро приняли решение». На статистическом — дали случаю достаточно попыток, чтобы он выдал красивую цифру.
Смотреть на метрики само по себе не проблема. Это можно делать хоть каждые пять минут. Проблема начинается там, где решение принимают по незапланированному промежуточному результату. Уровень значимости 0.05 работает только внутри заранее прописанной процедуры: какая главная метрика, какой горизонт теста, какой объём выборки, какое правило остановки. Если правил нет, эксперимент быстро превращается в слот-машину: дёргаем ручку, пока не выпадет нужная комбинация.
Именно так обычно выглядит wishful thinking в аналитике. Не как подлог и не как откровенная глупость. Гораздо чаще это звучит вполне респектабельно: “давайте посмотрим ещё день”, “почти значимо”, “нужно чуть больше данных”.
Поэтому Монти Холл и плохой A/B-тест — одна и та же история. Люди ошибаются не потому, что не умеют считать, а потому что игнорируют механизм получения информации. И это, пожалуй, самая дорогая форма wishful thinking в аналитике: когда человек уверен, что принимает решение основанное на данных, хотя на самом деле опирается на следы собственного нетерпения.