Статистика в бизнесе. Часть 2
Первый пост собрал на удивление много реакций, поэтому, как и обещал, выкладываю второй.
В этот раз - про то, как определять, что влияет на метрику и как моделировать ее динамику в будущем.
🔮 Уровень 4. Что влияет на метрику и что будет дальше
Вопрос бизнеса: что влияет на метрику, и как она будет вести себя в будущем?
Можно заметить, что вопрос выше состоит из 2х частей.
Разберем каждую из них отдельно.
Что влияет на метрику
Довольно часто мы хотим понимать, как изменение одного фактора на 1 единицу влияет на изменение метрики в среднем.
Это необходимо, чтобы заложить эту цифру в юнит-экономику или фин. модель.
Например, мы хотим понимать сколько денег приносит нам каждый дополнительный визит пользователя, чтобы спрогнозировать будущие доходы компании.
На этот вопрос позволяет ответить линейная регрессия.
Формула регрессии: y = β₀ + β₁x + ошибка, где
β₁ - , на сколько в среднем меняется выручка (y), когда трафик прирастает на одного посетителя (x).
β₀ - значение выручки при x = 0.
На практике у метрики редко бывает один фактор.
Выручка зависит от трафика, цены, сезонности, канала привлечения и тд. Чтобы учесть и эти факторы используют множественную регрессию.
Регрессия считает, что каждая единица x даёт одинаковый прирост y.В
бизнесе так бывает редко. Удвоенный маркетинговый бюджет почти никогда не даёт удвоенную выручку, эффект насыщается, и прямая линия перестаёт описывать реальность.
В таком случае требуется уметь моделировать нелинейные зависимости.
Что будет дальше
Когда мы знаем, что влияет на метрику, мы можем смоделировать ее дальнейшее поведение, чтобы оценить потенциал запуска маркетинговой кампании или фичи.
Это та же самая регрессия, в которой вместо фактора подставляется время.
Но просто продлить прямую по времени вперед не получится, и вот почему.
Декомпозиция
То, что мы видим на графике, - это несколько движений сразу.
Поэтому ряд сначала раскладывают на тренд, сезонность и остаток.
Тренд показывает, куда метрика движется на самом деле.
Сезонность - повторяющиеся циклы: поведение метрики в будни отличается от выходных, а декабрь не похож на июль.
Остаток - шум, который моделировать не нужно.
Пока эти части не разделены, сезонный подъем легко принять за результат своей работы.
Автокорреляция
Разделили, но остается вторая особенность.
В обычной регрессии наблюдения независимы, а в ряду сегодняшняя выручка похожа на вчерашнюю.
Из-за этого обычная регрессия занижает ошибку и дает слишком уверенный прогноз.
Но это же свойство работает и на нас: если сегодня зависит от вчера, то по прошлому ряда можно предсказывать будущее. На этом и построены модели.
Стационарность
Последнее требование. Модели ждут, что среднее и дисперсия ряда не меняются во времени.
Растущая выручка этому не удовлетворяет, поэтому ряд дифференцируют - переходят от самих значений к их приростам.
Модели
Ниже перечень, основных моделей используемых для прогнозирования временных рядов.
Скользящее среднее и экспоненциальное сглаживание работает с декомпозицией: хранит уровень, тренд и сезонность как отдельные компоненты и обновляет их с каждым новым наблюдением, придавая больший вес свежим данным.
ARIMA работает с автокорреляцией: описывает ряд через его собственное прошлое - авторегрессию (зависимость от предыдущих значений) и скользящее среднее (зависимость от предыдущих ошибок).
SARIMA - ее сезонное расширение, которое учитывает сезонность явно.
SARIMAX - добавляет к ряду внешние факторы: промо, праздники, изменение цены.
На последней круг замыкается. В прогноз возвращаются те самые факторы, с которых мы начали в первой части поста.
Ставьте 🔥, если хотите разбор ещё каких-то концепций из статистики через призму бизнеса - соберу часть 3.
Первый пост собрал на удивление много реакций, поэтому, как и обещал, выкладываю второй.
В этот раз - про то, как определять, что влияет на метрику и как моделировать ее динамику в будущем.
🔮 Уровень 4. Что влияет на метрику и что будет дальше
Вопрос бизнеса: что влияет на метрику, и как она будет вести себя в будущем?
Можно заметить, что вопрос выше состоит из 2х частей.
Разберем каждую из них отдельно.
Что влияет на метрику
Довольно часто мы хотим понимать, как изменение одного фактора на 1 единицу влияет на изменение метрики в среднем.
Это необходимо, чтобы заложить эту цифру в юнит-экономику или фин. модель.
Например, мы хотим понимать сколько денег приносит нам каждый дополнительный визит пользователя, чтобы спрогнозировать будущие доходы компании.
На этот вопрос позволяет ответить линейная регрессия.
Формула регрессии: y = β₀ + β₁x + ошибка, где
β₁ - , на сколько в среднем меняется выручка (y), когда трафик прирастает на одного посетителя (x).
β₀ - значение выручки при x = 0.
На практике у метрики редко бывает один фактор.
Выручка зависит от трафика, цены, сезонности, канала привлечения и тд. Чтобы учесть и эти факторы используют множественную регрессию.
Регрессия считает, что каждая единица x даёт одинаковый прирост y.В
бизнесе так бывает редко. Удвоенный маркетинговый бюджет почти никогда не даёт удвоенную выручку, эффект насыщается, и прямая линия перестаёт описывать реальность.
В таком случае требуется уметь моделировать нелинейные зависимости.
Что будет дальше
Когда мы знаем, что влияет на метрику, мы можем смоделировать ее дальнейшее поведение, чтобы оценить потенциал запуска маркетинговой кампании или фичи.
Это та же самая регрессия, в которой вместо фактора подставляется время.
Но просто продлить прямую по времени вперед не получится, и вот почему.
Декомпозиция
То, что мы видим на графике, - это несколько движений сразу.
Поэтому ряд сначала раскладывают на тренд, сезонность и остаток.
Тренд показывает, куда метрика движется на самом деле.
Сезонность - повторяющиеся циклы: поведение метрики в будни отличается от выходных, а декабрь не похож на июль.
Остаток - шум, который моделировать не нужно.
Пока эти части не разделены, сезонный подъем легко принять за результат своей работы.
Автокорреляция
Разделили, но остается вторая особенность.
В обычной регрессии наблюдения независимы, а в ряду сегодняшняя выручка похожа на вчерашнюю.
Из-за этого обычная регрессия занижает ошибку и дает слишком уверенный прогноз.
Но это же свойство работает и на нас: если сегодня зависит от вчера, то по прошлому ряда можно предсказывать будущее. На этом и построены модели.
Стационарность
Последнее требование. Модели ждут, что среднее и дисперсия ряда не меняются во времени.
Растущая выручка этому не удовлетворяет, поэтому ряд дифференцируют - переходят от самих значений к их приростам.
Модели
Ниже перечень, основных моделей используемых для прогнозирования временных рядов.
Скользящее среднее и экспоненциальное сглаживание работает с декомпозицией: хранит уровень, тренд и сезонность как отдельные компоненты и обновляет их с каждым новым наблюдением, придавая больший вес свежим данным.
ARIMA работает с автокорреляцией: описывает ряд через его собственное прошлое - авторегрессию (зависимость от предыдущих значений) и скользящее среднее (зависимость от предыдущих ошибок).
SARIMA - ее сезонное расширение, которое учитывает сезонность явно.
SARIMAX - добавляет к ряду внешние факторы: промо, праздники, изменение цены.
На последней круг замыкается. В прогноз возвращаются те самые факторы, с которых мы начали в первой части поста.
Ставьте 🔥, если хотите разбор ещё каких-то концепций из статистики через призму бизнеса - соберу часть 3.