Как статистика применяется в бизнесе?
Недавно получил вопрос от менти: «Я прошла курс, прочитала книгу Сары Бослаф, поняла все принципы и методы. Однако я всё ещё не могу понять, как это всё применять на практике».
Я попробовал разделить все концепции на 3 уровня в зависимости от того, на какой вопрос бизнеса они помогают ответить.
™️Уровень 1. Описать то, что уже произошло
Вопрос бизнеса: как у нас дела и на что смотреть?
Виды распределений.
Любая метрика имеет своё распределение - тысячи наблюдений со своей формой. От этой формы зависит, какой статистический метод сработает корректно.
Меры центральной тенденции.
Среднее, медиана, мода - способ свернуть тысячи наблюдений в одно число, характеризующее метрику. Примеры: средний чек, медианное время обработки заявки, типичное количество покупок на клиента.
Среднее чувствительно к выбросам: на любых метриках с тяжёлым правым хвостом (выручка на клиента, длительность процессов, суммы сделок) оно сдвигается к ним и перестаёт описывать типичное поведение. Поэтому в этом случае часто используют медиану.
Меры разброса.
Дисперсия и стандартное отклонение отвечают на вопрос, насколько данные разбросаны вокруг центра. Практический смысл - предсказуемость.
Два процесса с одинаковым средним, но разным разбросом - это две разные бизнес-ситуации. Средний срок доставки в 5 дней ± полдня и 5 дней ± 4 дня по-разному влияют на точность выводов и прогнозов.
Поэтому снижение дисперсии часто ценнее, чем рост среднего. Бизнес держится на предсказуемости.
Квантили.
Способ описать распределение целиком. Именно на квантилях строятся уровни сервиса - конкретный порог вида «95% запросов обрабатываются быстрее чем за N».
Разница между медианой и 90-м процентилем - это ровно та часть клиентов, у которых опыт заметно хуже. Средним эту группу никогда не увидеть.
™️ Уровень 2. Понять, насколько мы в этом уверены
Вопрос бизнеса: этой цифре можно верить?
Любая посчитанная величина - оценка по выборке. Пересчитайте по другим данным того же процесса - результат будет иным, хотя процесс не менялся. Этот разброс важно уметь измерять.
Точечная оценка и её свойства.
Оценка - функция от выборки, то есть сама случайная величина. От неё требуются несмещённость (в среднем по повторным выборкам даёт истинное значение) и состоятельность (сходится к нему с ростом объёма).
Закон больших чисел обеспечивает состоятельность: среднее по выборке сходится к математическому ожиданию. Это ответ на вопрос, почему увеличение объёма данных вообще что-то даёт.
Центральная предельная теорема описывает форму разброса. Распределение оценки стремится к нормальному независимо от того, как распределена исходная величина.
Отсюда следствие: нормальность нужна для оценки, а данные исходно могут быть распределены как угодно. Условия нарушаются при малом объёме и слишком тяжёлых хвостах.
Стандартная ошибка - стандартное отклонение оценки. Для среднего убывает как корень из объёма выборки: чтобы сузить разброс вдвое, данных нужно вчетверо больше.
Доверительный интервал помогает превратить разброс оценки в конкретный диапазон - границы, в которых лежит истинное значение с заданной вероятностью.
Пример: Конверсия выросла с 4.1% до 4.4%: если интервалы перекрываются, роста нет, есть колебание.
™️ Уровень 3. Проверка гипотез: принять решение при неопределённости
Вопрос бизнеса: мы что-то сделали - стало ли лучше?
Уровень 2 давал единичное число с погрешностью. Здесь нужно принять решение: применять изменение или нет.
Нулевая гипотеза.
Переводит мнение «мне кажется, стало лучше» в проверяемое утверждение. Мы принимаем сторону скептика: различий нет, наблюдаемая разница - случайность выборки.
Бремя доказательства лежит на наличии эффекта. Поэтому нельзя доказать, что тест не навредил, - можно только не найти вреда. Разница принципиальная: «мы не увидели падения» и «падения не было» - разные утверждения, и второе бизнесу обещать нельзя.
p-value.
Вероятность увидеть такое же или большее отклонение, если эффекта на самом деле нет.
Это не вероятность того, что гипотеза верна, и не вероятность ошибиться.
p-value
Недавно получил вопрос от менти: «Я прошла курс, прочитала книгу Сары Бослаф, поняла все принципы и методы. Однако я всё ещё не могу понять, как это всё применять на практике».
Я попробовал разделить все концепции на 3 уровня в зависимости от того, на какой вопрос бизнеса они помогают ответить.
™️Уровень 1. Описать то, что уже произошло
Вопрос бизнеса: как у нас дела и на что смотреть?
Виды распределений.
Любая метрика имеет своё распределение - тысячи наблюдений со своей формой. От этой формы зависит, какой статистический метод сработает корректно.
Меры центральной тенденции.
Среднее, медиана, мода - способ свернуть тысячи наблюдений в одно число, характеризующее метрику. Примеры: средний чек, медианное время обработки заявки, типичное количество покупок на клиента.
Среднее чувствительно к выбросам: на любых метриках с тяжёлым правым хвостом (выручка на клиента, длительность процессов, суммы сделок) оно сдвигается к ним и перестаёт описывать типичное поведение. Поэтому в этом случае часто используют медиану.
Меры разброса.
Дисперсия и стандартное отклонение отвечают на вопрос, насколько данные разбросаны вокруг центра. Практический смысл - предсказуемость.
Два процесса с одинаковым средним, но разным разбросом - это две разные бизнес-ситуации. Средний срок доставки в 5 дней ± полдня и 5 дней ± 4 дня по-разному влияют на точность выводов и прогнозов.
Поэтому снижение дисперсии часто ценнее, чем рост среднего. Бизнес держится на предсказуемости.
Квантили.
Способ описать распределение целиком. Именно на квантилях строятся уровни сервиса - конкретный порог вида «95% запросов обрабатываются быстрее чем за N».
Разница между медианой и 90-м процентилем - это ровно та часть клиентов, у которых опыт заметно хуже. Средним эту группу никогда не увидеть.
™️ Уровень 2. Понять, насколько мы в этом уверены
Вопрос бизнеса: этой цифре можно верить?
Любая посчитанная величина - оценка по выборке. Пересчитайте по другим данным того же процесса - результат будет иным, хотя процесс не менялся. Этот разброс важно уметь измерять.
Точечная оценка и её свойства.
Оценка - функция от выборки, то есть сама случайная величина. От неё требуются несмещённость (в среднем по повторным выборкам даёт истинное значение) и состоятельность (сходится к нему с ростом объёма).
Закон больших чисел обеспечивает состоятельность: среднее по выборке сходится к математическому ожиданию. Это ответ на вопрос, почему увеличение объёма данных вообще что-то даёт.
Центральная предельная теорема описывает форму разброса. Распределение оценки стремится к нормальному независимо от того, как распределена исходная величина.
Отсюда следствие: нормальность нужна для оценки, а данные исходно могут быть распределены как угодно. Условия нарушаются при малом объёме и слишком тяжёлых хвостах.
Стандартная ошибка - стандартное отклонение оценки. Для среднего убывает как корень из объёма выборки: чтобы сузить разброс вдвое, данных нужно вчетверо больше.
Доверительный интервал помогает превратить разброс оценки в конкретный диапазон - границы, в которых лежит истинное значение с заданной вероятностью.
Пример: Конверсия выросла с 4.1% до 4.4%: если интервалы перекрываются, роста нет, есть колебание.
™️ Уровень 3. Проверка гипотез: принять решение при неопределённости
Вопрос бизнеса: мы что-то сделали - стало ли лучше?
Уровень 2 давал единичное число с погрешностью. Здесь нужно принять решение: применять изменение или нет.
Нулевая гипотеза.
Переводит мнение «мне кажется, стало лучше» в проверяемое утверждение. Мы принимаем сторону скептика: различий нет, наблюдаемая разница - случайность выборки.
Бремя доказательства лежит на наличии эффекта. Поэтому нельзя доказать, что тест не навредил, - можно только не найти вреда. Разница принципиальная: «мы не увидели падения» и «падения не было» - разные утверждения, и второе бизнесу обещать нельзя.
p-value.
Вероятность увидеть такое же или большее отклонение, если эффекта на самом деле нет.
Это не вероятность того, что гипотеза верна, и не вероятность ошибиться.
p-value