A/B без A/B (ч.2)В
прошлом посте я рассказал про разные способы проводить А/В тесты без А/В тестов, но остался подвешенным вопрос — а когда эти методы нужны вообще? А/В тесты лучше всех, так давайте всегда использовать — а вот нет 😶
Топ причин, почему мы не сможем провести A/B тест:▶️
Этика/законыВ мире денег и такое встречается)) Говоря технически, мы не всегда можем выделить рандомный контроль/тест для которых мы: отключим кэшбэки, ухудшим цену, насуём багов, или сделаем сотрудников поддержки грубиянами.
Классический пример: нельзя заставить людей курить, чтобы доказать вред курения (поэтому социальные исследователи изощряются с другими методами Causal Inference)
▶️
Неделимый тритмент — нельзя раскатить на частьТритмент (treatment) — это наше воздействие. И часто мы не можем воздействовать на Ваню и скрыть воздействие от Серёжи. Это часто бывает с ТВ-рекламой, ребрендингами, новыми законами, новыми комиссиями — в общем чем-то глобальным. И мы не можем это глобальное разбить на куски для честного А/В теста 🔪
▶️
Крупная единица и мало наблюденийВы раскатили вашу фичу на 5 городов-миллионников. Ваша единица наблюдения — это не 5млн человек, это просто 5 (городов). Тут стат-критерии посмеются только 😳
У нас в Тиньке я как-то погружался в аналитику банкоматов. Там с единицами наблюдения и А/В тестами все тоже очень несладко
Для гео-методов хорошо могут сработать Synthetic control, Matched market testing (когда находим «близнецов» по городам), а если изоляция по гео невозможна, можно попробовать разбивать по времени — это метод Switchback
▶️
Интерференция и сетевые эффектыПредставьте, вот вы раскатили фичу и клиенты из тестовой группы «заражают» клиентов из контрольной.
— Один рассказал своим друзьям о новой промоакции, а они были в контрольной группе
— Два кореша переписываются, но у одного из них вместо нового эмодзи отправляется
⍰— Представьте, что водители Uber из теста и контроля дерутся за один пул клиентов. Из-за фичи одна из групп может отжирать клиентов у другой и оценить эффект может быть сложнее.
Неважно: сетевые эффекты, баг, двухсторонние рынки — интерференция генерится по ряду причин, и это может мешать честному А/В
▶️
Слишком дорого делать контрольНа самом деле частная причина на практике! Часто на ухудшающие тесты надо перелопатить всю айтишную архитектуры, чтобы отключить клиенту какие-то фичи. Или при разработке новой сложной фичи предусмотреть, чтобы она не работала у части людей — может стоить очень дорого в человеко-часах разработки.
И тогда надо просто трезво оценить профит от полученных знаний и риски. И если цена разработки выше, то забить и применить другие методы Causal Inference
Мир А/В тестов полон неожиданностей! Третьей части не будет, лонгриды жесть. Я подумаю, что еще накопать в А/В, а с вас наш аналитик-поваренок за пост! 🧑🍳🧑🍳🧑🍳