Зелёные мармеладки вызывают акне. Теперь статзначимо💡
В продолжение темы p-value и его мисинтерпретаций, разберём комикс с xkcd. На нём изобразили учёных, исследующих утверждение, что употребление jelly beans (кстати, реально вкусная штука) вызывает акне. После того как им не удалось найти значимую (p < 0.05) корреляцию между поеданием конфет и акне в целом, они начали по отдельности исследовать 20 разных цветов jelly beans. Конечно же, не учитывая, что нужна коррекция на множественные сравнения. В итоге они нашли одну цветовую группу, которая получила p-value < 0.05. И, конечно же (ну это баааза), опубликовались в журнале с этим статзначимым результатом😀
На самом же деле, если провести 20 независимых тестов с уровнем значимости alpha = 0.05 при условии, что в каждом верна нулевая гипотеза, вероятность получить хотя бы один ложноположительный результат составляет 1 - (1 - 0.05)^20 ~ 64.2%, а ожидаемое число ложноположительных результатов — 1 = 0.05 × 20.
Что делать?
Контролировать FWER — family-wise error rate, она же групповая вероятность ошибки первого рода. То есть вероятность совершить хотя бы одну.
В Википедии расписано много способов в разных случаях прикинуть, каким должен быть новый уровень значимости для каждой из гипотез. Самый часто упоминаемый — конечно, поправка Бонферрони, которая предлагает просто делить исходное alpha на количество гипотез. Но чем больше гипотез, тем сильнее этот способ роняет мощность — вероятность не допустить ошибку второго рода, то есть справедливо отклонить нулевую гипотезу.
В прикладных областях проблема множественного сравнения стоит гораздо острее, чем у тех, кто тестирует 3-5 цветов кнопки или вариантов поисковой выдачи. Практика проводить много сравнений без поправки в надежде найти что-то значимое, применяемая сознательно или нет, иногда называется p-hacking. И да, комикс как раз о нём🤓
Не забудь отправить другу, у которого скоро собес🤵
И ставь ❤️ — если было полезно, 🤓 — если всё знал и так
#найм_и_собесы #хардов_пост
@analytess 👩
В продолжение темы p-value и его мисинтерпретаций, разберём комикс с xkcd. На нём изобразили учёных, исследующих утверждение, что употребление jelly beans (кстати, реально вкусная штука) вызывает акне. После того как им не удалось найти значимую (p < 0.05) корреляцию между поеданием конфет и акне в целом, они начали по отдельности исследовать 20 разных цветов jelly beans. Конечно же, не учитывая, что нужна коррекция на множественные сравнения. В итоге они нашли одну цветовую группу, которая получила p-value < 0.05. И, конечно же (ну это баааза), опубликовались в журнале с этим статзначимым результатом😀
На самом же деле, если провести 20 независимых тестов с уровнем значимости alpha = 0.05 при условии, что в каждом верна нулевая гипотеза, вероятность получить хотя бы один ложноположительный результат составляет 1 - (1 - 0.05)^20 ~ 64.2%, а ожидаемое число ложноположительных результатов — 1 = 0.05 × 20.
Что делать?
Контролировать FWER — family-wise error rate, она же групповая вероятность ошибки первого рода. То есть вероятность совершить хотя бы одну.
В Википедии расписано много способов в разных случаях прикинуть, каким должен быть новый уровень значимости для каждой из гипотез. Самый часто упоминаемый — конечно, поправка Бонферрони, которая предлагает просто делить исходное alpha на количество гипотез. Но чем больше гипотез, тем сильнее этот способ роняет мощность — вероятность не допустить ошибку второго рода, то есть справедливо отклонить нулевую гипотезу.
В прикладных областях проблема множественного сравнения стоит гораздо острее, чем у тех, кто тестирует 3-5 цветов кнопки или вариантов поисковой выдачи. Практика проводить много сравнений без поправки в надежде найти что-то значимое, применяемая сознательно или нет, иногда называется p-hacking. И да, комикс как раз о нём🤓
Не забудь отправить другу, у которого скоро собес🤵
И ставь ❤️ — если было полезно, 🤓 — если всё знал и так
#найм_и_собесы #хардов_пост
@analytess 👩