А/В тесты и ревью
Наступает пора лентих ревью - все подводят итоги полугодия. И как правило, команда bottom-up суммирует приросты метрики во всех своих успешных А/В - таким образом получает суммарных эффект своих внедрений. Спешу вам расстроить: этот эффект сильно завышен. На это есть 3 причины:
- Вероятность ошибок alpha "суммируются" в серии экспериментов: часть экспов из серии не несет эффекта
- Периодически эксперимента "перезатируют" друг друга
- Эффекты новизны со временем вымываются
Честно оценить эффект от серии экспериментов можно через глобальный контроль: оставляем 5% юзеров, на которых не катим вообще никакие изменения полгода. Сравниваем метрики со всеми изменениями vs без них (глобальный контроль). Но у этого подхода есть пара минусов:
- Полгода на 5% пользователей мы не получаем прироста метрик = прямая потеря денег
- Подход комбинаторно взрывается, когда нужно оценить суммарный эффект экспериментов всей компании, нескольких департаментов и отдельных команд. На каждый такой срез глобальных (и не очень) контролей не напасешься
Поэтому придумали более дешевые способы оценивать эффективность серии экспериментов: сегодня речь про один из них:)
Ребята из AirBnB вывели формулу для корректировки суммарного эффекта (оставлю ее в комментариях), а разобрали этот вывод довольно хорошо в этой статье.
Формула корректирует вклад от "пограничных" экспов, где p-value близка к 5% (условно 4.7%). А таких на практике немало: где-то менеджер подглядывал в эксп до окончания и остановил в удобный момент. В других случаях выбрали удобную прокрашенную метрику/срез. В общем, если посчитать скорректированный эффект от серии экспов, то он может оказаться и в 2-3 раза меньше, чем просто сумма эффектов отдельных А/В
Если вы руководитель высокого уровня или относитесь к команде АВ, то призываю внимательно посмотреть на этот метод - и честно оценивать итоги полугодия 🏆
Наступает пора лентих ревью - все подводят итоги полугодия. И как правило, команда bottom-up суммирует приросты метрики во всех своих успешных А/В - таким образом получает суммарных эффект своих внедрений. Спешу вам расстроить: этот эффект сильно завышен. На это есть 3 причины:
- Вероятность ошибок alpha "суммируются" в серии экспериментов: часть экспов из серии не несет эффекта
- Периодически эксперимента "перезатируют" друг друга
- Эффекты новизны со временем вымываются
Честно оценить эффект от серии экспериментов можно через глобальный контроль: оставляем 5% юзеров, на которых не катим вообще никакие изменения полгода. Сравниваем метрики со всеми изменениями vs без них (глобальный контроль). Но у этого подхода есть пара минусов:
- Полгода на 5% пользователей мы не получаем прироста метрик = прямая потеря денег
- Подход комбинаторно взрывается, когда нужно оценить суммарный эффект экспериментов всей компании, нескольких департаментов и отдельных команд. На каждый такой срез глобальных (и не очень) контролей не напасешься
Поэтому придумали более дешевые способы оценивать эффективность серии экспериментов: сегодня речь про один из них:)
Ребята из AirBnB вывели формулу для корректировки суммарного эффекта (оставлю ее в комментариях), а разобрали этот вывод довольно хорошо в этой статье.
Формула корректирует вклад от "пограничных" экспов, где p-value близка к 5% (условно 4.7%). А таких на практике немало: где-то менеджер подглядывал в эксп до окончания и остановил в удобный момент. В других случаях выбрали удобную прокрашенную метрику/срез. В общем, если посчитать скорректированный эффект от серии экспов, то он может оказаться и в 2-3 раза меньше, чем просто сумма эффектов отдельных А/В
Если вы руководитель высокого уровня или относитесь к команде АВ, то призываю внимательно посмотреть на этот метод - и честно оценивать итоги полугодия 🏆