Кусочек пиццы | Аналитика данных


Гео и язык канала: Россия, Русский
Категория: не указана


Про карьеру, аналитику, ии и все, что с ними связано
Для связи: @ikovalevv

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
не указана
Статистика
Фильтр публикаций


Кейс с собеседования: батчинг заказов

Этот кейс встретился на тех. интервью в в суперапп из Катара, занимающийся доставкой еды, продуктов, товаров и тд.

Условие простое: Операционная команда хочет начать батчить заказы агрессивнее - назначать курьеру до трёх ближайших заказов за один выезд, чтобы снизить стоимость доставки.

Нужно дать определить ключевые метрики, сформулировать гипотезы и предложить способ оценки эффекта.

Одним словом: задизайнить а/б тест.

Давайте решать кейс по порядку.

1. Метрики

Чтобы разобраться с метриками давайте подумаем о механизме работы фичи.

Формально у нас работает трехсторонний маркетплейс: клиент - поставщик - компания.

Однако данная фича оказывает мало влияния на поставщиков, т.к. доставка осуществляется за счет сервиса, поэтому исключим их из уравнения и рассмотрим только клиентов и компанию.

Итак, про компанию.

У любого заказа есть постоянная часть расходов: подача курьера, поездка до клиента и ожидание на точке.

Допустим, у нас есть 3 заказа. Мы можем повезти их как в одной поездке, так и в нескольких.

В случае группировки всех заказов в одну поездку - расходы на курьера будут ниже, т.к. постоянная часть расходов (ставка за выезд, например) будет распределяться по 3м заказам вместо одного.

Это важно учитывать, поэтому смотрим на метрику Delivery Cost per Order, а рядом держим batch rate (количество заказов в динамике в одной поездке).

Теперь, про клиента.

Маршрут на три точки длиннее одного.

Заказ едет дольше, еда приезжает остывшей, растёт доля просрочек, клиент отменяет чаще и в следующий раз заказывает не у вас.

Смотрим на распределение времени доставки (Click-To-Eat).
Как минимум нам будут интересны среднее/ медиана и 95й перцентиль, чтобы оценить, разброс критических значений распределения.

Можно добавить еще метрик, но мы пока ограничимся.

2. Что по поводу гипотез?

Сформулируем нулевую (H0) и альтернативную (H1) гипотезы.

H0: батчинг не снижает стоимость доставки
H1: батчинг снижает стоимость на MDE%

MDE в данном случае берем по истории похожих экспов (100% они уже были) или пытаемся высчитать из юнит-экономики. Я бы целился в 2%.
Это мы и будем тестить.

3. Теперь guardrail

За барьерную метрику я бы предложил взять Средний рейтинг клиента на заказ (Average Order Rating), долю отмен (Cancelation Rate), и долю опозданий (DelayRate).

Если одна из метрик выскакивает за 2 стандартных отклонения -> стопаем эксперимент.

4. Как оценить эффект?

Третий вопрос самый интересный.

Ранее я писал про сетевой эффект и это тот самый кейс.

Курьеры у теста и контроля общие. Батчинг меняет логику диспетчеризации, и курьер, увёзший три заказа, недоступен контролю до конца маршрута.

Поэтому в нашем кейсе недостаточно делать поклиентский тест. Необходимо оценивать эффект через switchback, где единица рандомизации - пара "зона × тайм-слот".

Тайм-слот это отрезок, внутри которого в зоне работает один режим. Например час: с 12 до 13 в центре батчинг включён, с 13 до 14 выключен, порядок случайный.

Тайм-слот должен покрывать время доставки туда-обратно, чтобы весь эффект собирался в рамках одного тайм-слота, а не нескольких. Поэтому будем брать 3 часа за один тайм-слот.

Единица анализа - тоже слот, а не заказ.

Метрику агрегируют до слота и сравнивают слоты между собой. Размер выборки в данном случае - количество переключений между слотами.

По итогу у нас получился полноценный дизайн а/б теста с метриками, гипотезами и подходом к оценке, что собственно и требовалось в этом кейсе.

Ставьте 🙏, если хотите узнать и про другие этапы собеса в эту компанию.

Ставьте🔥, если хотите больше разборов кейсов.

Ну и заходите на сайт data-slice.ru, если хотите освежить знания в статистике или метриках.






Статистика в бизнесе. Часть 2

Первый пост собрал на удивление много реакций, поэтому, как и обещал, выкладываю второй.

В этот раз - про то, как определять, что влияет на метрику и как моделировать ее динамику в будущем.

🔮 Уровень 4. Что влияет на метрику и что будет дальше

Вопрос бизнеса: что влияет на метрику, и как она будет вести себя в будущем?

Можно заметить, что вопрос выше состоит из 2х частей.
Разберем каждую из них отдельно.

Что влияет на метрику

Довольно часто мы хотим понимать, как изменение одного фактора на 1 единицу влияет на изменение метрики в среднем.

Это необходимо, чтобы заложить эту цифру в юнит-экономику или фин. модель.

Например, мы хотим понимать сколько денег приносит нам каждый дополнительный визит пользователя, чтобы спрогнозировать будущие доходы компании.

На этот вопрос позволяет ответить линейная регрессия.

Формула регрессии: y = β₀ + β₁x + ошибка, где

β₁ - , на сколько в среднем меняется выручка (y), когда трафик прирастает на одного посетителя (x).

β₀ - значение выручки при x = 0.

На практике у метрики редко бывает один фактор.
Выручка зависит от трафика, цены, сезонности, канала привлечения и тд. Чтобы учесть и эти факторы используют множественную регрессию.

Регрессия считает, что каждая единица x даёт одинаковый прирост y.В
бизнесе так бывает редко. Удвоенный маркетинговый бюджет почти никогда не даёт удвоенную выручку, эффект насыщается, и прямая линия перестаёт описывать реальность.

В таком случае требуется уметь моделировать нелинейные зависимости.

Что будет дальше

Когда мы знаем, что влияет на метрику, мы можем смоделировать ее дальнейшее поведение, чтобы оценить потенциал запуска маркетинговой кампании или фичи.

Это та же самая регрессия, в которой вместо фактора подставляется время.

Но просто продлить прямую по времени вперед не получится, и вот почему.

Декомпозиция

То, что мы видим на графике, - это несколько движений сразу.
Поэтому ряд сначала раскладывают на тренд, сезонность и остаток.

Тренд показывает, куда метрика движется на самом деле.

Сезонность - повторяющиеся циклы: поведение метрики в будни отличается от выходных, а декабрь не похож на июль.

Остаток - шум, который моделировать не нужно.

Пока эти части не разделены, сезонный подъем легко принять за результат своей работы.

Автокорреляция

Разделили, но остается вторая особенность.

В обычной регрессии наблюдения независимы, а в ряду сегодняшняя выручка похожа на вчерашнюю.

Из-за этого обычная регрессия занижает ошибку и дает слишком уверенный прогноз.

Но это же свойство работает и на нас: если сегодня зависит от вчера, то по прошлому ряда можно предсказывать будущее. На этом и построены модели.

Стационарность

Последнее требование. Модели ждут, что среднее и дисперсия ряда не меняются во времени.

Растущая выручка этому не удовлетворяет, поэтому ряд дифференцируют - переходят от самих значений к их приростам.

Модели

Ниже перечень, основных моделей используемых для прогнозирования временных рядов.

Скользящее среднее и экспоненциальное сглаживание работает с декомпозицией: хранит уровень, тренд и сезонность как отдельные компоненты и обновляет их с каждым новым наблюдением, придавая больший вес свежим данным.

ARIMA работает с автокорреляцией: описывает ряд через его собственное прошлое - авторегрессию (зависимость от предыдущих значений) и скользящее среднее (зависимость от предыдущих ошибок).

SARIMA - ее сезонное расширение, которое учитывает сезонность явно.

SARIMAX - добавляет к ряду внешние факторы: промо, праздники, изменение цены.

На последней круг замыкается. В прогноз возвращаются те самые факторы, с которых мы начали в первой части поста.

Ставьте 🔥, если хотите разбор ещё каких-то концепций из статистики через призму бизнеса - соберу часть 3.


Как LLM убеждает нас верить в ошибочные гипотезы

Замечали ли вы, что ИИ часто вам поддакивает?
Истории, когда ИИ открыто врет, а при уточнении отвечает "точно я был не прав" уже превратились в мем. Но у этого «подхалимства» есть обратная, куда более опасная сторона.

Свежее исследование MIT подсветило фундаментальную проблему: ИИ спроектирован так, чтобы поддакивать нам (AI Sycophancy), загоняя даже опытных специалистов в «спираль заблуждений» (delusional spiraling).

Давайте разберем, как устроен этот механизм и почему обычный здравый смысл тут не всегда спасает. 👇

Что такое AI Sycophancy и как оно работает
Подхалимство моделей - прямой результат их обучения. Нейросети получают «награду», когда их ответ нравится человеку. В итоге ИИ выучил простое правило: чтобы пользователь остался доволен, нужно согласиться с его мнением, а не указывать на логические дыры

Как это выглядит на практике:

🔸В бизнесе и маркетинге:
Вы придумываете сомнительную фичу или стратегию и спрашиваете: «Идея ведь зайдет аудитории?». Бот тут же распишет 10 причин, почему это гениально.

🔸В текстах и текстах для презентаций:
Вы приводите слабый аргумент, а бот хвалит вашу «глубокую мыслительную работу».

🔸В разработке и дата-анализе:
Вы выдвигаете неверную гипотезу о баге или просадке метрик, а ИИ поддакивает: «Да, ваша логика безупречна, проблема именно в этом».

Бот подхватывает ваше предположение, красивыми и умными словами оборачивает его и отдаёт вам назад. Вы получаете ложную уверенность там, где стояло перепроверить факты.

Самые неприятные выводы из статьи MIT ⚠️

Ученые смоделировали поведение «идеального байесовского пользователя» - человека с безупречной логикой, который объективно пересчитывает вероятности при получении новых данных.

Выяснилось, что даже такой абсолютно рациональный агент скатывается в спираль заблуждений под воздействием подхалимского бота.

И здесь есть три важных вывода:

™️ Отсутствие галлюцинаций не спасает.

Даже если привязать ИИ к правдивой базе знаний и запретить ему выдумывать факты (через RAG), он все равно загонит вас в ошибку. Бот не врет напрямую, он просто делает cherry-picking - выдает только те реальные факты, которые подкрепляют ваше заблуждение, и умалчивает об опровержениях.

™️ Знание о подхалимстве не защищает.

В MIT проверили: если пользователь заранее знает, что ИИ - подхалим, это лишь снижает скорость погружения в ошибку, но не останавливает процесс. Постепенно напор «подтверждений» от бота все равно ломает скепсис.

™️ Спираль замыкается незаметно.

Вы приходите с незрелой мыслью, ИИ её хвалит, вы верите в неё сильнее, задаете еще более предвзятый уточняющий вопрос - и через 5 минут диалога вы железно уверены в полной ерунде.


Как с этим работать (правила ИИ-гигиены)


™️ Программируйте ИИ на жесткую критику.

Забудьте наводящие вопросы.
Промптите от обратного:
«Я пришел с такой идеей/гипотезой: [X]. Выступи в роли жесткого эксперта и критика. Разнеси мою логику. Найди минимум 3 слабых места и причины, почему это не сработает».


™️ Требуйте опровергающие аргументы.

Заставляйте бота искать альтернативные точки зрения:
«Какие факты, метрики или контраргументы противоречат моей позиции?»


™️ Сначала думаем сами - потом открываем чат.

Не начинайте решение задачи с пустого промпта. Сначала набросайте структуру или логику на бумаге. И только имея свой каркас, идите к ИИ за оформлением, поиском синтаксиса или формулировками.

™️ Практикуйте «аналоговый режим».

Периодически решайте задачи, пишите тексты и анализируйте проблемы вообще без нейросетей.

Постоянная срезка углов через ИИ создает когнитивный долг - мозг постепенно разучивается критически мыслить и самостоятельно строить сложные причинно-следственные связи.

Как часто вы ловили ИИ на том, что он радостно поддакивал очевидным ошибкам? Делитесь в комментариях! 👇

🔗 Ссылка на исследование MIT (февраль 2026): Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians


отвечает только на вопрос, насколько наблюдаемая разница необычна для мира без эффекта.

Практический вывод: p-value решает, отвергаем ли мы гипотезу, но ничего не говорит о размере эффекта. Что именно вы получили - показывает доверительный интервал из Уровня 2.

Выбор критерия.

Определяет, по какой формуле считается разброс разности средних. Решается природой метрики: доли, средние, отношения сумм и ранги считаются по-разному, поэтому критерий нужно подбирать под метрику и проверять её условия.

Цена ошибки здесь выше всего: неверный критерий занижает разброс, и тест начинает находить эффекты, которых нет. Команда раскатывает изменение, а метрика в проде не растёт.

Критерий выбирается первым - все дальнейшие расчёты делаются под конкретную статистику.

Ошибки I и II рода.

Задают требуемый размер выборки и цену риска. Ошибка I рода - вероятность принять шум за эффект и внедрить бесполезное. Ошибка II рода - вероятность не заметить настоящий эффект и упустить рабочее решение.

Понимание обеих даёт возможность осознанно управлять рисками вместо порогов по умолчанию. Если внедрение дешёвое, а упущенная выручка дорогая, держаться за стандартные 5% нерационально.

Мощность и объём выборки.

Уровень значимости, мощность, размер эффекта и дисперсия вместе определяют размер выборки.

Работает в обе стороны. От важного бизнесу прироста - к количеству наблюдений и срокам теста. От доступного трафика - к минимальному эффекту, который вы вообще способны отличить от шума.

Эти три уровня закрывают большую часть повседневной работы, поэтому их можно считать «базой».

Все эти концепции я разобрал в интерактивном формате на сайте. Заходите, если хотите освежить знания.

Если пост соберёт много реакций❤️‍🔥, сделаю продолжение про остальные концепции и их применение в бизнесе.


Как статистика применяется в бизнесе?

Недавно получил вопрос от менти: «Я прошла курс, прочитала книгу Сары Бослаф, поняла все принципы и методы. Однако я всё ещё не могу понять, как это всё применять на практике».

Я попробовал разделить все концепции на 3 уровня в зависимости от того, на какой вопрос бизнеса они помогают ответить.

™️Уровень 1. Описать то, что уже произошло

Вопрос бизнеса: как у нас дела и на что смотреть?

Виды распределений.

Любая метрика имеет своё распределение - тысячи наблюдений со своей формой. От этой формы зависит, какой статистический метод сработает корректно.

Меры центральной тенденции.

Среднее, медиана, мода - способ свернуть тысячи наблюдений в одно число, характеризующее метрику. Примеры: средний чек, медианное время обработки заявки, типичное количество покупок на клиента.

Среднее чувствительно к выбросам: на любых метриках с тяжёлым правым хвостом (выручка на клиента, длительность процессов, суммы сделок) оно сдвигается к ним и перестаёт описывать типичное поведение. Поэтому в этом случае часто используют медиану.

Меры разброса.

Дисперсия и стандартное отклонение отвечают на вопрос, насколько данные разбросаны вокруг центра. Практический смысл - предсказуемость.

Два процесса с одинаковым средним, но разным разбросом - это две разные бизнес-ситуации. Средний срок доставки в 5 дней ± полдня и 5 дней ± 4 дня по-разному влияют на точность выводов и прогнозов.

Поэтому снижение дисперсии часто ценнее, чем рост среднего. Бизнес держится на предсказуемости.

Квантили.

Способ описать распределение целиком. Именно на квантилях строятся уровни сервиса - конкретный порог вида «95% запросов обрабатываются быстрее чем за N».

Разница между медианой и 90-м процентилем - это ровно та часть клиентов, у которых опыт заметно хуже. Средним эту группу никогда не увидеть.

™️ Уровень 2. Понять, насколько мы в этом уверены

Вопрос бизнеса: этой цифре можно верить?

Любая посчитанная величина - оценка по выборке. Пересчитайте по другим данным того же процесса - результат будет иным, хотя процесс не менялся. Этот разброс важно уметь измерять.

Точечная оценка и её свойства.

Оценка - функция от выборки, то есть сама случайная величина. От неё требуются несмещённость (в среднем по повторным выборкам даёт истинное значение) и состоятельность (сходится к нему с ростом объёма).

Закон больших чисел обеспечивает состоятельность: среднее по выборке сходится к математическому ожиданию. Это ответ на вопрос, почему увеличение объёма данных вообще что-то даёт.

Центральная предельная теорема описывает форму разброса. Распределение оценки стремится к нормальному независимо от того, как распределена исходная величина.

Отсюда следствие: нормальность нужна для оценки, а данные исходно могут быть распределены как угодно. Условия нарушаются при малом объёме и слишком тяжёлых хвостах.

Стандартная ошибка - стандартное отклонение оценки. Для среднего убывает как корень из объёма выборки: чтобы сузить разброс вдвое, данных нужно вчетверо больше.

Доверительный интервал помогает превратить разброс оценки в конкретный диапазон - границы, в которых лежит истинное значение с заданной вероятностью.

Пример: Конверсия выросла с 4.1% до 4.4%: если интервалы перекрываются, роста нет, есть колебание.

™️ Уровень 3. Проверка гипотез: принять решение при неопределённости

Вопрос бизнеса: мы что-то сделали - стало ли лучше?

Уровень 2 давал единичное число с погрешностью. Здесь нужно принять решение: применять изменение или нет.

Нулевая гипотеза.

Переводит мнение «мне кажется, стало лучше» в проверяемое утверждение. Мы принимаем сторону скептика: различий нет, наблюдаемая разница - случайность выборки.

Бремя доказательства лежит на наличии эффекта. Поэтому нельзя доказать, что тест не навредил, - можно только не найти вреда. Разница принципиальная: «мы не увидели падения» и «падения не было» - разные утверждения, и второе бизнесу обещать нельзя.

p-value.

Вероятность увидеть такое же или большее отклонение, если эффекта на самом деле нет.

Это не вероятность того, что гипотеза верна, и не вероятность ошибиться.

p-value


Кейс с собеседования: дизайн AB-теста для новых тарифов

Этот кейс давали на собеседовании в дейтинг-приложение, но условие универсальное для любого подписочного сервиса.

Контекст кейса:
Представьте, что вы аналитик в дейтинговом приложении.
У вас в продукте есть 3 тарифа, которые отличаются функционалом и количеством доступных действий в месяц + триал период на 1 неделю.

К вам приходит продакт и говорит: хочу поднять цену на все тарифы 10%, давай оценим эффект.


Как вы будете это делать?



Этап 1: Задать правильные вопросы.⁉️

Несложно заметить, что контекста мало, а задача абстрактная. Чтобы это исправить - необходимо задать корректные наводящие вопросы.

Вопрос 1: На какую метрику смотрим?📈

Продакт перекидывает вопрос вам и предлагает предложить метрику самому.

Очевидный кандидат - ARPU (выручка на пользователя из теста), но у нее есть недостаток - она менее чувствительна, чем конверсия.

Если конверсия из триала в оплату была 20%, а после роста цены просела до 18% (минус 10% относительно), ARPU по формуле почти не сдвинется: 0.20 × P (цена подписки) против 0.18 × 1.10P = 0.198P.

Разница - около 1%. Глядя только на ARPU, вы бы решили, что почти ничего не произошло. (Особенно, если учитывать высокое стандартное отклонение ARPU)

А по факту потеряли десятую часть платящих.

Поэтому primary метрика - CR из триала в платную подписку.

ARPU, ARPPU и retention после первой оплаты идут в secondary-метрики: рост цены может держать выручку на месте, но резать базу, а в дейтинге база платящих - это ещё и часть продукта (больше платящих - больше активных профилей - лучше матчинг для всех).

Вопрос 2: На какой сегмент воздействуем?👥

Тут продакт дает нам инсайт: только на новичков.

Действующие подписчики при повышении цены увидели бы её только при продлении и некоторые среагировали бы оттоком, чего нам не хочется допустить.

Это упрощает нам дизайн.

Раз воздействие только на новых, рандомизация становится простой: по user_id в момент первого показа пейвола, без пересечений с базой "пользователей-старичков".

Вопрос 3: Какой путь у пользователя до пейвола?

Продакт отвечает:
Установка -> онбординг -> немного бесплатного взаимодействия (просмотр анкет, ограниченное число лайков) -> упирается в лимит -> экран с тремя тарифами и предложением недели триала.

В экране с тарифами и рандомизируем.

На этом этапе основные вопросы заканчиваются и можно переходить к дизайну.

Дизайн теста🧪

Из трёх ответов дизайн собирается сам:

-> гипотеза - повышение цены не снижает CR из триала в оплату сильнее, чем на X%;
-> метрика - CR триал-оплата;
-> unit рандомизации - user_id на входе в пейвол;
-> сплит 50/50: контроль видит старые цены, тест - новые
-> сегмент - только новые пользователи; guardrails - ARPU, ARPPU, retention;
-> срок - минимум полный цикл триала плюс время на накопление конверсий.

Дальше несем дизайн продакту и получаем обратную связь.

Тест слишком длинный, что делать?⏱

Продакт возвращается с этим вопросом почти всегда.

Первая мысль - использовать CUPED, снижаем дисперсию за счёт предэкспериментального значения метрики.

Но у новичков нет предпериода: они только что поставили приложение, снижать дисперсию не на чем.

Так ведь?

На самом деле - не совсем.

Ковариата должна быть измерена до воздействия, но "до воздействия" не значит "до установки приложения".

Между установкой и показом пейвола пользователь уже наследил: сколько действий сделал за бесплатный период, как вёл себя в онбординге, с какого канала пришёл, какое у него устройство.

Это и есть ковариаты, которые нам необходимы в CUPAC - предсказываем метрику моделью, обученной на этих признаках, и используем предсказание вместо честного предпериода для снижения дисперсии.

Валидно это ровно потому, что до пейвола вы ничего не меняли: функционал одинаков для всех, разной становится только цена на самом экране.

Собеседование на дизайн эксперимента редко проверяет знание формул. Оно проверяет, структурно ли вы мыслите, умеете ли вы задавать необходимые вопросы, и различаете ли вы детали

Ставьте 🔥, если пост вам зашел

490 0 15 1 28

Наткнулся на интересное выступление Константина Крестникова (CTO GigaChain) на Data Fest.

Он рассказал про этапы развития агентов, Harness и loop-циклы.

Если вы когда-либо хотели узнать про что-то из перечисленного, го смотреть:
https://www.youtube.com/watch?v=aBcW01Qbuws


Что такое сетевой эффект?

Классический A/B стоит на простом допущении: контроль и тест не влияют друг на друга.

Поведение юзера из группы B определяется только тем, что ему показали, и никак не отражается на юзерах из группы A. Это называется SUTVA, Stable Unit Treatment Value Assumption.

Именно поэтому эффект фичи можно посчитать как обычную разницу средних между группами.

Проблема в том, что иногда это допущение не выполняется.

Представим тест реферальной программы. Или группового заказа. Или чата. Или ленты, где люди видят активность друг друга.

Юзер из группы в тестовой группе рассказывает о фиче другу, который находится в контрольной группе и контроль тоже подвергается воздействию.

Теперь контроль загрязнён тем самым эффектом, который хотелось измерить только в тесте.

Группы перетекают друг в друга, и разница между ними схлопывается.

Это и есть сетевой эффект (он же network interference).

Что при этом происходит на практике.

1. Эффект недооценивается.

Если тест протекает в контроль, контроль подрастает вместе с тестом, и разница между группами оказывается меньше реальной, что сказывается на значении инкремента метрики.

2. Эффект переоценивается.

Обратная история: фича создаёт ценность только при высокой плотности участников.

Хороший пример - платный буст для продавцов на маркетплейсе.

Буст поднимает карточку продавца выше в выдаче. Но общее число покупателей и заказов от этого не растёт: спрос фиксированный, буст лишь перераспределяет его.

Если буст в тесте только у пяти процентов продавцов, эти счастливчики забирают заказы у всех остальных и показывают отличный прирост продаж.

Метрика радует, фича катится на всех.

И тут выясняется, что когда буст есть у каждого, вверх не поднимается никто - все вернулись на свои места, спрос делится примерно как раньше, а прирост, который был в тесте, испарился.

В тесте измерялось преимущество над теми, у кого буста нет, а после раскатки таких просто не осталось.

Как с этим работать.

Для начала стоит честно ответить на вопрос, есть ли вообще в продукте канал, по которому юзеры влияют друг на друга?

Примеры каналов: приглашения, общий контент, общий инвентарь, общая очередь, конкуренция за один ресурс.

Если каналов нет, можно выдохнуть и использовать классический A/B.

Если нет - читаем дальше.

Дальше имеет смысл поменять единицу рандомизации.

Вместо отдельных юзеров в группы A и B распределяются целые кластеры - группы людей, которые связаны между собой.

Тогда друзья, коллеги, соседи по городу попадают в одну и ту же группу, и влияние перетоков между ними снижается.

Вариантов, что считать кластером, несколько.

Гео-эксперименты.

Рандомизируются города или регионы целиком: весь один город в тесте, весь другой в контроле.

Перетекание между географиями минимально.

Сложность в том, что резко падает число независимых единиц (было сто тысяч юзеров, стало сорок городов), доверительные интервалы разъезжаются, и нужен либо длинный тест, либо аккуратный подбор похожих пар городов с матчингом.

Кластеризация по графу.

Строится граф связей и режется на слабосвязанные сообщества (community detection), которые уже рандомизируются.

Внутри группы связей много, между группами мало, значит, и утечка мала.

Это дороже и требует данных о связях, но для социальных фич подход самый честный.

Switchback

Также часто гоняют switchback: один и тот же пользователь переключается между A и B по временным окнам и затем оценивается эффект между этими окнами.

Главная мысль вот в чём.

Сетевой эффект не экзотика для соцсетей.

Он живёт везде, где действие одного юзера меняет опыт другого: реферальные программы, лояльность с приглашением друга, групповые заказы, любые двусторонние рынки, даже банальная нагрузка на инфраструктуру.

Так что прежде чем доверять результату теста, стоит задать себе один вопрос: может ли юзер из одной группы повлиять на юзера из другой?

Если да, тест что-то измеряет, но не то, что кажется.


Реальность 2026 года: ИИ не уменьшает нагрузку, а увеличивает количество дел, которыми мне приходится заниматься одновременно.

Компаниям нравится эта математика. Один человек с ИИ-агентами теперь делает то, что раньше делали двое или трое.

Зарплаты меньше - производительность та же, а то больше.

Чистая победа для бизнеса (особенно если не считать затраты на токены)

В то же время, если смотреть на это глазами исполнителя, открывается совсем другая картина - кратный рост когнитивной нагрузки.

Все видят рост производительности с использованием агентов, пытаются придумать «тот-самый промпт» или оптимизируют контекст, но почему-то никто не учитывает, сколько контекста может обрабатывать сам человек.

Например, сейчас обычный день для меня - это 5+ параллельных потоков.

Один агент проводит исследования, второй копается в данных, третий готовит что-то для заказчиков, четвертый делает пет-проект, а вы переключаетесь между ними, принимая решения по каждому из них.

Несколько лет назад мы работали над чем-то одним за раз и мозг соответствовал этому темпу работы.

Теперь мы принимаем решения и переключаем контекст в несколько раз чаще, чем обычно.

Лично по себе я заметил, что постоянное переключение между задачами высысасывает из меня больше всего энергии.


Это и есть реальный механизм, лежащий в основе надвигающейся волны эмоционального выгорания.

Теперь свою «батарейку» можно разрядить и без долгих часов на работе и бесконечных встреч. 🪫

К тому же, культура труда поощряет отключаться от сигналов собственного тела и «перфомить-перфомить-перфомить».

Поэтому мы не замечаем усталости, пока не получим клинический диагноз или упадем без сил.

Вывода не будет, так как я не знаю, что с этим делать.

Но если вы сталкивались с чем-то подобным и нашли для себя решение - напишите в комментах. Будет интересно обменяться опытом

480 2 2 11 13

Anthropic выпустила новую библиотеку подсказок для Claude Code прямо в документации

Пока что там 52 подсказки, сгруппированные по типам с объяснениями, почему и как это работает.

Забираем здесь.


Потестировал новую модель Claude Fable на выходных для своего пет-проекта.

Для тех, кто в танке: Anthropic вернули Fable в открытый доступ. До 7 июля модель можно покрутить бесплатно (по крайне мере в рамках подписки Pro).

Я решил, не терять время и потестировать ее на своем сайте.

Что сделал:
1) Сделал ревью UI/ UX на сайте, используя Claude Design и taste-skill и внес некоторые правки
2) Сделал ревью контента и интерактивных графиков, чтобы сделать уроки понятнее
3) Добавил английскую версию сайта
4) Добавил Яндекс. Метрику (Теперь я могу следить за вами😈)

Что заметил:
1) Магии не случилось и Fable не прокачал мой сайт на 100500%. Ни в части контента, ни в части дизайна.

Общего промта в формате: "Вот тебе ссылки на статьи на Хабр и Medium. Сделай ревью контента на основании этих статей" не достаточно.

Промпта "Вот тебе ссылки на сайты-рефернс. Сделай аудит UI/UX и сформируй план доработок" тоже не достаточно.

Все также надо вручную выверять каждый урок и каждый объект и писать отдельные комменты с правками.

2) Он быстро жрал токены - лимиты закончились раньше, чем успел внедрить все изменения.

Поэтому в модуле по иерархии метрик все еще есть проблемы с растягиванием контента по ширине.

3) Это не про Fable в частности, но хочется похвастаться - моя идея со вторым мозгом (писал об этом здесь) помогла и в работе с сайтом.

Агент, работающий над сайтом учитывал не только контекст проекта, но и контекст постов, моей аудитории и пр. материалов по тг-каналу, что дало некоторый синергитический эффект в виде адаптации ton-of-voice на сайте. При этом сам я его это сделать не просил - агент сам нашел и отметил какие-то связи и подсветил идеи.

Резюме:
Я не сказал бы, что модель Fable - это next-gen прорыв, который решает все задачи по щелчку пальцев и понимает с полуслова.

Возможно это я такой криворукий и не умею нормально с ним работать, но возможно и нет🙁

Пока я считаю, что любая ии-шка это все-таки не кнопка "Сделать красиво", а очень мощный инструмент, который раскрывает свою силу только в умелых руках. (Собственно поэтому и практикуюсь)

А какой у вас опыт с Fable?
Поделитесь комментариями


Как потрогать статистику руками?

Когда я учил статистику, у меня была одна проблема: формулы я запоминал, а картинку в голове собрать не мог.

Вот есть, например, формула дисперсии.

Я мог посчитать её на бумаге, мог написать на собесе. Но что она представляет на самом деле я понять не могу. Как говорят - "не чувствовал на пальцах"

Или центральная предельная теорема. Сформулировать ее можно просто заучив, но осознать, почему она играет ключевую роль в проверке гипотез, гораздо сложнее.

Почему так?

Статистика - это про случайность и распределения. А у распределения нет одного значения. Это процесс: ты тянешь выборку, потом ещё одну, потом ещё, и смотришь, как ведёт себя результат. Формула фиксирует одно состояние. Интуиция рождается, когда состояний много и видно, что между ними происходит.

К чему я веду?

Я собрал сайт, где статистику можно потрогать руками - data-slice.ru.

Это не лекции и не учебник.

Каждый разбор интерактивный: ты сам двигаешь ползунки и смотришь, как меняется картинка.

Растягиваешь разброс данных и видишь, как растёт стандартное отклонение.

Гоняешь сто выборок и ловишь те самые промахи доверительного интервала. Меняешь размер выборки и смотришь, как интервал сужается.

Сейчас там больше 50 разборов по двум направлениям: статистика (от мер разброса и распределений до A/B тестов, бутстрапа и регрессии) и метрики (иерархии, North Star, операционные метрики продукта).

Все абсолютно бесплатно - без регистрации и смс😏

Честно про статус 🛠

Это мой вайбкодерский пет-проект.

Я делаю его один, и он не закончен.
Но как говорят - Ship it fast, get feedback fast.
Поэтому я и выпускаю его сейчас)

Часть тем ещё сырая, поэтому я точно что-то буду переписывать или менять местами, обновлять дизайн и добавлять контент.

Это не замена нормальному курсу или учебнику, формальные доказательства всё равно лучше изучать в профильных материалах. Сайт про другое: про интуицию, которую учебник не даёт, потому что её нельзя напечатать на бумаге.

Если когда-то застревал на том, что такое дисперсия или почему доверительный интервал не то, чем кажется, зайди и покрути сам.
Начать можно с самого простого, а потом постепенно переходить к более сложным концепциям

Буду рад фидбеку в комментах к этому посту🍕


Я не люблю А/В-тесты 🤷

На днях увидел очередную рекламу курса по А/В-тестам и поймал себя на мысли: почему это стало едва ли не самой хайповой темой в аналитике?

На каждом собесе обязательно спросят про А/В. Грейд аналитика часто меряют тем, насколько глубоко он шарит в стат.методах: мощность, поправки на множественные сравнения, бутстрап, CUPED.

Со стороны кажется, будто умение грамотно раскатить эксперимент - это высшая ступень твоего развития как профессионала.

Но это не так.

Сразу оговорюсь, что дело не в самих А/В.
Смущает меня именно то, сколько места им отвели в профессии.

А/В - это просто один из инструментов в наборе аналитика. Такой же, как когортный анализ, регрессии, юнит-экономика или causal inference методы, про которые я писал отдельно. Никакой не священный грааль. Обычная отвёртка из ящика с инструментами 🛠

Причём отвёртка с важной оговоркой: сам по себе А/В-тест не приносит компании ни рубля.

Он не повышает прибыль, он помогает принять решение. Это инструмент фасилитации: снизить неопределённость и понять, катить фичу дальше или откатывать. Ценность создаёт само изменение в продукте, а тест лишь измеряет, сработало оно или нет.

А теперь смотрите, что происходит. Вокруг этого измерительного инструмента строят всю роль.

Аналитик = калькулятор А/В-тестов.

Человек, который с максимальной точностью посчитает, что новая кнопка дала +0.3% к конверсии.

Звучит, как по мне, обидно.

Я уже писал, что разница между джуном и сеньором - это переход от «калькулятора» к «партнёру». Так вот культ А/В загоняет аналитика обратно в калькулятор, только теперь с красивым стат.аппаратом.

Я считаю, аналитик должен стремиться быть партнёром бизнесу и приносить деньги, а не вылизывать точность оценки эффекта до третьего знака после запятой.

Тут нужна честная оговорка. В очень зрелых компаниях, где трафик гигантский, инкремент в 0.1% может стоить десятков миллионов долларов.

Там борьба за этот знак после запятой полностью оправдана, и сильная экспертиза в экспериментах действительно критична. Вопрос, скорее, в том, что интереснее лично мне.

А мне неинтересно копаться в микрооптимизациях и ловить +0.1%. Интереснее искать решения, которые дают эффект хотя бы +5%. Их не найти, гоняя сотый А/В на цвет кнопки. Они находятся, когда ты понимаешь бизнес, а не только формулу Стьюдента.

Уважайте А/В как инструмент. Но перестаньте видеть в нём вершину профессии.

Это не значит, что я не буду спрашивать А/В на собесах. Сори, без них всё-таки сейчас никуда.

А как у вас - А/В это сердце вашей работы или один из инструментов в ящике?

Ставьте ❤️‍🔥, если солидарны со мной и 💔, если нет

394 2 3 11 15

Как создать себе второй мозг?🧠

Что если я вам скажу, что сейчас можно создать себе второй мозг?

Систему, которая хранит всю информацию о вас, помнит контекст и помогает с ними работать одинаково эффективно со всеми вашими сферами жизни областями жизни. Неважно, создаете ли вы контент, анализируете показатели здоровья, разбираетесь с собственными мыслями или изучаете новые навыки.

Второй мозг сможет стать вашим персональным помощником в любой задаче.

Как это работает?

Я думаю многие так или иначе ведут заметки: в сохраненках тг, на телефоне, Notion, Evernote и других сервисах. Часть этой информации теряется, забывается и устаревает.

Формально второй мозг - это структурированная система заметок + набор ии-агентов и скилов, которые имеют контекст и закрывают ваши задачи.

Однако основная задача второго мозга не только накапливать информацию и структурировать ее, но и превратить в своего рода "операционную систему агентов" в которой один агент-оркестратор видит весь контекст и управляет другими саб-агентами.

Например, один может выступать в качестве карьерного коуча и опираться на твои заметки, другой быть экспертом в аналитике и помогать изучать новые темы, третий профессиональным редактором - для вычитки и редактирования постов (все посты я пишу сам, но редактирую все-таки с помощью ии), четвертый - аналитиком контента, пятый - ревьюером идей, шестой - персональным нутрициологом и тд.

Сейчас это все можно сделать и с помощью классических ии. Ключевое отличие здесь в том, что в данном случае все управляется через одно окно. Ты пишешь/ говоришь агенту свою задачу и он ее реализует.

При этом эта система развивается вместе с вами: вы добавляете заметки, открываете для себя новое направление и система развивается вместе с вами.

Эдакий Джарвис из Железного человека, которому можно задавать любые вопросы из своей жизни и он сможет дать ответ на все, что угодно.

Что по стеку?⚙

Все банально - в моем случае это связка:

Obsidian + сервис хранения заметок + Claude + Skills + MCP.

Obsidian - это система управления заметками, которая умеет индексировать их превращать их в структурированный граф связей.

Таким образом мысли не затеряются.

Сервис хранения заметок - Заметки должны где-то хранится: в облаке, локально и тд. Поэтому надо включить такой сервис и подключить по MCP. Какой у меня - я не скажу)

Claude - основной инструмент для управления хранилищем, но можно использовать и любой другой.

На основе их моделей я делаю разные скиллы для своих задач.

При этом с целью сохранения токенов в скилы выбираю разные модели: Haiku для выгрузок/ загрузок, Opus для редактирования и брейнштормов, Sonnet - для оркестрации и управления агентами. Пока токенов хватает, но и задач у меня немного.

Skills + MCP - любые скиллы и конвекторы для решения ваших задач. Можно подключать все, что угодно: хоть озвучивание ответов ии-агентов голосом, хоть видео-редакторы или генераторы презентаций.

Как этим пользоваться💻

Я могу либо написать в чат, либо добавить заметку в папку входящие. Агент-оркестратор сам определит задачу и либо сложит заметку куда надо и проиндексирует, либо вызовет агент, который будет решать мою задачу.

Важно отметить, что эта штука не настраивается по кнопке и надо закладывать время на то, чтобы все структурировать и настроить.


Но мне, с моей любовью к раскладыванию всего по полочкам это только в радость.

Не все работает идеально: например, у меня есть желание делать ролики для своих музыкальных треков. Делать ролики я не умею и не хочу учиться, но продвигаться как-то надо. Поэтому я сделал агента, который должен писать сценарии для рилсов в Инстаграмм, но пока получается херня.

Но я думаю, что со временем я соберу подходящие промпты и референсы, чтобы получать тот результат который мне нужен.

Так, например, уже получилось сделать хорошего ии-агента для рефлексии, который помогает выявить паттерны в поведении и структурирует мысли.

Делали ли вы что-то подобное? Поделитесь в комментариях👇


Кто хотел пособирать ИИ-агентов руками?

Google и Kaggle проведут бесплатный 5-дневный интенсив по агентам и вайбкодингу.

Дадут:
• практику по созданию ИИ-агентов, от прототипов до продакшена;
• работу с памятью, контекстом, инструментами и API;
• практические кейсы и задания для отработки навыков;
• разборы и материалы от Google.

Для кого:
Всех, кто хочет разобраться в ИИ-инструментах на практике. Базовое знание Python, ИИ и Google AI Studio желательно.

Формат:
• онлайн, 5 дней
• задания, кодлабы, подкасты и ежедневные AMA (Ask Me Anything) сессии с экспертами Google
• можно проходить в удобное время (будет запись), примерно 1-2 часа в день.

Как получить:
Зарегистрироваться на Kaggle

Старт 15 июня.


🍕Что такое каннибализация?

Представьте ситуацию: ваши продуктовые маркетологи добавили в меню новую пиццу - анчоусы с ананасами (простите за мой вкус) с целью бустануть выручку в компании.

Проходит месяц после запуска, вы с командой открываете дашборд - и видите восходящий график заказов, продажи новинки уверенно растут. Вроде бы успех и пора праздновать.😏

Но потом смотрите на общую выручку пиццерии и замечаете, что она почти не изменилась.

Куда же делись деньги за эти 10 000 пицц?

А никуда. Часть клиентов просто взяла новинку вместо тех пицц, которые покупала раньше.

Это и есть каннибализация - когда новый продукт растёт за счёт ваших же старых продаж, а не за счёт нового спроса или клиентов конкурентов. Деньги перекладываются из одного кармана в другой, а в сумме бизнес не растёт.

Где встречается каннибализация?👀

А много где:
- Новая позиция в меню отъедает заказы у старых блюд вместо того, чтобы приводить новых гостей.

- Скидочная акция дарит людям скидку, которые купили бы и по полной цене.

- Дешёвая версия товара перетягивает спрос с более дорогой и маржинальной (продажи в штуках растут, а прибыль падает).

- Новую точку открыли слишком близко к старой - и вместо новых клиентов она забирает часть гостей у соседнего ресторана.

Когда это нормально?🤔

Каннибализация - не всегда зло.
Иногда на неё идут осознанно: например, запускают акцию, которая отъедает часть продаж по полной цене, но взамен растит частоту заказов или приводит новых клиентов.

Вопрос не в том, чтобы каннибализацию исключить, а в том, чтобы знать её масштаб и сознательно на него соглашаться.

А чтобы знать масштаб, его нужно измерить.

Как посчитать каннибализацию через A/B 🧪

-> Шаг 1: Делим аудиторию

Одной половине пользователей показываем меню с новинкой, другой - старое меню без неё.

Вторая группа (контроль) нужна, чтобы поймать всё, что влияет на выручку помимо новинки: сезон, погоду, параллельные акции.

Без неё вы потом не докажете, что старые пиццы просели именно из-за новинки, а не из-за того, что закончился предновогодний пик.

-> Шаг 2: Выбираем метрику для оценки

Хочется взять продажи новой пиццы и сказать: вот сколько денег она принесла. Но эта цифра показывает только саму новинку и молчит о том, что стало с остальным меню.

Считать нужно суммарную выручку на пользователя - по всему меню целиком. Только она покажет, прибавилось денег или они просто перетекли внутри ассортимента.

-> Шаг 3: Считаем реальный прирост

Допустим, в тесте новая пицца принесла 100 рублей с пользователя. Но суммарная выручка в тесте оказалась выше контроля только на 60 рублей.

Эти 60 рублей и есть реальный, инкрементальный прирост - деньги, которых без новинки в кассе бы не появилось.

-> Шаг 4: Вычисляем каннибализацию

Дальше простая арифметика. Каннибализация - это разница между продажами новинки и реальным приростом.

Каннибализация = Продажи новинки − Инкрементальный прирост общей выручки

В нашем кейсе:

Каннибализация = 100 (продажи пиццы с анчоусами) - 60 (инкремент продаж в тесте относительно контроля) = 40 рублей

Перепроверить себя можно с другой стороны: посмотрите, насколько в тесте просели продажи старых пицц по сравнению с контролем.

Они упадут ровно на те же 40 рублей - деньги не пропали, они переехали в новинку.

💡 Главное: радоваться нужно не продажам новинки, а тому, что выросла суммарная выручка. Если новинка собрала 10 000 заказов, но в сумме денег не прибавилось - вы просто переложили их из кармана в карман.

А вы сталкивались с каннибализацией в своих продуктах? Поделитесь в комментах 👇


Трагедия в 4х актах

> В курсоре стали быстро кончаться лимиты

> Купил подписку на Клод за 210 долларов, чтобы решить эту проблему

> Подключил гугл док к клоду через коннектор

> После 4х сообщений лимиты кончились..


Метрики 101. Часть 5: Такси и доставка (Uber, Яндекс Go, Самокат)

В прошлом посте мы разбирали маркетплейсы, где логистика может занимать дни. Сегодня мы будем анализировать On-Demand услуги (такси, доставка).

Главное отличие здесь - фактор реального времени.

Если на маркетплейсе товар везут со склада, то в такси или экспресс-доставке алгоритм обязан найти вам исполнителя за секунды и в радиусе пары километров.

Баланс спроса и предложения меняется каждую минуту: пошел ливень - спрос улетел в космос🚀. Кончился - и вот уже цены возвращаются к прежним уровням.

Как этим управлять?

Давайте ответим на этот вопрос с помощью иерархии метрик.

🌟 Level 0: North Star Metric

Для сервисов такси и доставки главная метрика - Number of Completed Rides/Orders (Количество успешных поездок/заказов).

И это логично: чем больше выполненных заказов, тем ценнее платформа для клиентов. Невозможно оказывать полезный клиенту сервис и при этом иметь малое количество выполненных заказов.

📈 Level 1: Драйверы роста

Количество поездок раскладывается на две стороны маркетплейса и метрику их баланса:

Demand (Спрос):

Trips = MAU × Trips per User

Здесь MAU - количество активных пассажиров, а Trips per User - частота использования сервиса.

Supply (Предложение):

Supply Hours = Active Drivers × Hours per Driver

Supply Hours - суммарное время водителей на линии.
Эта метрика показывает количество водителей и их доступное время работы.

Fulfillment Rate (Доля выполненных поездок):

Процент запросов, которые завершились успешной поездкой. Эта показывает, насколько эффективно платформа сводит пассажиров с водителями. Мы не сможем достичь высокого количества успешных поездок, если не будем следить и за этой метрикой.

🛠 Level 2: Operational Metrics

- ETA (Estimated Time of Arrival): Ожидаемое время прибытия курьера или машины. ETA сильно влияет на конверсию в заказ, поэтому за ней важно следить.

- Surge Multiplier (Коэффициент повышенного спроса): главная причина высоких цен на такси. Он временно сбивает избыточный спрос со стороны пассажиров и привлекает водителей в «горячую» зону повышенным заработком.

- Cancellation Rate (Доля отмен): Разделяется на отмены со стороны пользователя (передумал, долго ждать) и со стороны водителя (не поехал на невыгодный заказ).

- Utilization Rate (Утилизация): Процент времени, которое водитель проводит непосредственно везя пассажира, а не катаясь «холостым» в поисках заказа.

🛡 Контр-метрики (Guardrails)

Конечно же не стоит забывать и про контр-метрики:

- Surge Bounce Rate: Доля пользователей, которые открыли приложение, увидели космический ценник из-за коэффициента и сразу закрыли его.

- Driver Churn Rate (Отток водителей): Если алгоритмы заставляют водителей делать долгие «холостые» подачи за копейки, они уйдут в другие агрегаторы.

- Safety / Accident Rate: Метрики безопасности. Если экспресс-доставка заставляет курьеров доставлять заказы за 15 минут любой ценой, вырастет число аварий и штрафов, что уничтожит репутацию бренда.

💡Важно помнить: райдтех - это гиперлокальный маркетплейс. Нам не важно, что в среднем по городу баланс спроса и предложения идеален.

Если в 18:00 у конкретного бизнес-центра стоит 500 пассажиров и нет ни одной машины, у нас локальный коллапс.

Поэтому ключевые метрики мы обязаны мониторить в разрезе микрозон (например, через гексагоны) и коротких временных слотов.

Показано 20 последних публикаций.