отвечает только на вопрос, насколько наблюдаемая разница необычна для мира без эффекта.
Практический вывод: p-value решает, отвергаем ли мы гипотезу, но ничего не говорит о размере эффекта. Что именно вы получили - показывает доверительный интервал из Уровня 2.
Выбор критерия.
Определяет, по какой формуле считается разброс разности средних. Решается природой метрики: доли, средние, отношения сумм и ранги считаются по-разному, поэтому критерий нужно подбирать под метрику и проверять её условия.
Цена ошибки здесь выше всего: неверный критерий занижает разброс, и тест начинает находить эффекты, которых нет. Команда раскатывает изменение, а метрика в проде не растёт.
Критерий выбирается первым - все дальнейшие расчёты делаются под конкретную статистику.
Ошибки I и II рода.
Задают требуемый размер выборки и цену риска. Ошибка I рода - вероятность принять шум за эффект и внедрить бесполезное. Ошибка II рода - вероятность не заметить настоящий эффект и упустить рабочее решение.
Понимание обеих даёт возможность осознанно управлять рисками вместо порогов по умолчанию. Если внедрение дешёвое, а упущенная выручка дорогая, держаться за стандартные 5% нерационально.
Мощность и объём выборки.
Уровень значимости, мощность, размер эффекта и дисперсия вместе определяют размер выборки.
Работает в обе стороны. От важного бизнесу прироста - к количеству наблюдений и срокам теста. От доступного трафика - к минимальному эффекту, который вы вообще способны отличить от шума.
Эти три уровня закрывают большую часть повседневной работы, поэтому их можно считать «базой».
Все эти концепции я разобрал в интерактивном формате на сайте. Заходите, если хотите освежить знания.
Если пост соберёт много реакций❤️🔥, сделаю продолжение про остальные концепции и их применение в бизнесе.
Практический вывод: p-value решает, отвергаем ли мы гипотезу, но ничего не говорит о размере эффекта. Что именно вы получили - показывает доверительный интервал из Уровня 2.
Выбор критерия.
Определяет, по какой формуле считается разброс разности средних. Решается природой метрики: доли, средние, отношения сумм и ранги считаются по-разному, поэтому критерий нужно подбирать под метрику и проверять её условия.
Цена ошибки здесь выше всего: неверный критерий занижает разброс, и тест начинает находить эффекты, которых нет. Команда раскатывает изменение, а метрика в проде не растёт.
Критерий выбирается первым - все дальнейшие расчёты делаются под конкретную статистику.
Ошибки I и II рода.
Задают требуемый размер выборки и цену риска. Ошибка I рода - вероятность принять шум за эффект и внедрить бесполезное. Ошибка II рода - вероятность не заметить настоящий эффект и упустить рабочее решение.
Понимание обеих даёт возможность осознанно управлять рисками вместо порогов по умолчанию. Если внедрение дешёвое, а упущенная выручка дорогая, держаться за стандартные 5% нерационально.
Мощность и объём выборки.
Уровень значимости, мощность, размер эффекта и дисперсия вместе определяют размер выборки.
Работает в обе стороны. От важного бизнесу прироста - к количеству наблюдений и срокам теста. От доступного трафика - к минимальному эффекту, который вы вообще способны отличить от шума.
Эти три уровня закрывают большую часть повседневной работы, поэтому их можно считать «базой».
Все эти концепции я разобрал в интерактивном формате на сайте. Заходите, если хотите освежить знания.
Если пост соберёт много реакций❤️🔥, сделаю продолжение про остальные концепции и их применение в бизнесе.