Отрасль: Маркетинговое агенство
Кто прислал на разбор: Продуктовый маркетолог
Сам кейс:
Мы проводим АБ тест 2ух рекламных компаний (РК) в Яндекс Директ по привлечению новых пользователей: они кликают на рекламу и попадают на лендинг. В день ~1000 новых уникальных пользователей
Гипотеза: если поменяем лендинг, добавив динамическую кнопку, то CR в регистрацию вырастет на x%
Вопросы:
1. Нужны ли нам дополнительные прокси или guardrail метрики? На сайте все кнопки ведут на одну и ту же форму регистрации, других действий для пользователя нет. Соответственно и метрик, которые можем уронить, нет?
-- В целом, CR в регистрацию - уже хорошо! Можно еще добавить более глубокие CR. Например, в покупку после регистрации, чтобы точно максимизировать прибыль от рекламной компании, а не только новичков. Ведь компании важны деньги, а не просто количество пользователей. Если бы РК отличались стоимостью, то стоило бы учесть еще и CPA (cost per action) или CPM (cost per mille) в зависимости от мехники РК 💸
2. Стоит ли менять дефолтные alpha=5% и power=80%? Нужно ли проводить А/А тест?
-- Эти парметры для большинства случаев - ОК. Но для стартапов их можно ослабить (alpha=10%) для быстрых итераций. А для мега-корпораций ужесточить (alpha = 0.1%, например), чтобы еще больше не усложнять продукт и не катить в прод потенциально опасные фичи. А/А тест лучше хотя бы единожды провести, чтобы проверить правильность сплитования пользователей и расчета метрик + стат тестов
3. Если мы провели зеленый эскперимент на РК, которая таргетируются на один сегмент аудитории, то мы же не можем экстраполировать на другие сегменты (другие гео, тип устройства, возраст итд)?
-- В целом, А/В на неслучайных выборках (на отдельных сегментах, например) никак не экстраполируются. Скидка 10% на метро для студентов вряд ли так же хорошо сработает на it-шниках. В маркетинге полезно проводить большие тесты на случайной выборке из всех пользователей, и пост-анализом А/В находить сегменты, где РК работает лучше. И уже последующие РК делать "умнее"
4. По формуле необходимо 8948 пользователей в каждой группе. Посчитал, что мы наберем их за 18 дней. Для лучшего отслеживания недельной сезонности стоит ли округлить до 21 дня? Эксперимент нужно остановить через 21 день или когда наберем 8948 пользователей?
-- Период А/В всегда должен быть кратен 1 неделе (1w, 2w, 3w, ...), чтобы убрать эффеткы от разного поведению людей в будни и выходные. Когда А/В тест задизайнен и запущен, то мы не меняем в нем ничего. Вот вообще ничего! Период (21 день), целевые метрики и прочее - соблюдаем максимально жестко. Иначе появится эффект подглядывания, А/В полиция придет к вам
5. Коллеги из другого отдела считают результаты А/В через https://yandex.ru/adv/statvalue . Насколько верно пользоваться этим калькулятором? не лучше ли считать через z-test/хи-квадрат в python?
-- Этим калькулятором не пользовался, и нигде не нашел, что у него под капотом. Но вангую, что Z-test. Основная ошибка при применении стат критериев - это даже не выбор критерия, а проблемы с данными на входе) Например, в вашем кейсе нужно подавать на вход не количество кликов/регистраций, а количество уникальных пользователей с кликом/регистрацией. Если человек 3 раза кликнул на рекламу и зарегистрировался, то это для целей маркетинга так же хорошо, как и регистрация с первого раза
Вопросы отличные, А/В полиция одобряет 👮
#разбор@abpolice
Кто прислал на разбор: Продуктовый маркетолог
Сам кейс:
Мы проводим АБ тест 2ух рекламных компаний (РК) в Яндекс Директ по привлечению новых пользователей: они кликают на рекламу и попадают на лендинг. В день ~1000 новых уникальных пользователей
Гипотеза: если поменяем лендинг, добавив динамическую кнопку, то CR в регистрацию вырастет на x%
Вопросы:
1. Нужны ли нам дополнительные прокси или guardrail метрики? На сайте все кнопки ведут на одну и ту же форму регистрации, других действий для пользователя нет. Соответственно и метрик, которые можем уронить, нет?
-- В целом, CR в регистрацию - уже хорошо! Можно еще добавить более глубокие CR. Например, в покупку после регистрации, чтобы точно максимизировать прибыль от рекламной компании, а не только новичков. Ведь компании важны деньги, а не просто количество пользователей. Если бы РК отличались стоимостью, то стоило бы учесть еще и CPA (cost per action) или CPM (cost per mille) в зависимости от мехники РК 💸
2. Стоит ли менять дефолтные alpha=5% и power=80%? Нужно ли проводить А/А тест?
-- Эти парметры для большинства случаев - ОК. Но для стартапов их можно ослабить (alpha=10%) для быстрых итераций. А для мега-корпораций ужесточить (alpha = 0.1%, например), чтобы еще больше не усложнять продукт и не катить в прод потенциально опасные фичи. А/А тест лучше хотя бы единожды провести, чтобы проверить правильность сплитования пользователей и расчета метрик + стат тестов
3. Если мы провели зеленый эскперимент на РК, которая таргетируются на один сегмент аудитории, то мы же не можем экстраполировать на другие сегменты (другие гео, тип устройства, возраст итд)?
-- В целом, А/В на неслучайных выборках (на отдельных сегментах, например) никак не экстраполируются. Скидка 10% на метро для студентов вряд ли так же хорошо сработает на it-шниках. В маркетинге полезно проводить большие тесты на случайной выборке из всех пользователей, и пост-анализом А/В находить сегменты, где РК работает лучше. И уже последующие РК делать "умнее"
4. По формуле необходимо 8948 пользователей в каждой группе. Посчитал, что мы наберем их за 18 дней. Для лучшего отслеживания недельной сезонности стоит ли округлить до 21 дня? Эксперимент нужно остановить через 21 день или когда наберем 8948 пользователей?
-- Период А/В всегда должен быть кратен 1 неделе (1w, 2w, 3w, ...), чтобы убрать эффеткы от разного поведению людей в будни и выходные. Когда А/В тест задизайнен и запущен, то мы не меняем в нем ничего. Вот вообще ничего! Период (21 день), целевые метрики и прочее - соблюдаем максимально жестко. Иначе появится эффект подглядывания, А/В полиция придет к вам
5. Коллеги из другого отдела считают результаты А/В через https://yandex.ru/adv/statvalue . Насколько верно пользоваться этим калькулятором? не лучше ли считать через z-test/хи-квадрат в python?
-- Этим калькулятором не пользовался, и нигде не нашел, что у него под капотом. Но вангую, что Z-test. Основная ошибка при применении стат критериев - это даже не выбор критерия, а проблемы с данными на входе) Например, в вашем кейсе нужно подавать на вход не количество кликов/регистраций, а количество уникальных пользователей с кликом/регистрацией. Если человек 3 раза кликнул на рекламу и зарегистрировался, то это для целей маркетинга так же хорошо, как и регистрация с первого раза
Вопросы отличные, А/В полиция одобряет 👮
#разбор@abpolice