Как запустить ML-модель в реальном продукте?
Это завершающий пост из серии о построении NBA для банковских продуктов. Мы уже построили модели, научились быстро их обучать и нашли способ работать даже при небольшом количестве данных. Но на практике этого оказалось мало. Чтобы система заработала в реальных условиях, пришлось внести ещё несколько изменений.
Холдирование клиентов
Представим, что менеджер собирает аудиторию в Excel-файл и передаёт его в отдел рассылок. Между этим моментом и фактической отправкой письма может пройти от нескольких часов до нескольких дней.
За это время могут возникнуть две неприятные ситуации:
Чтобы этого избежать, мы использовали механизм холдирования. Как только клиент попадает в аудиторию одной кампании, система временно резервирует его. Пока коммуникация не будет отправлена или отменена, он становится недоступен для других выгрузок.
Оценка эффективности
Следующая проблема возникла при оценке качества моделей. В классическом A/B-тестировании есть две группы: А — тестовая группа, которая получает коммуникацию; Б — контрольная группа, которая ничего не получает.
Дальше остаётся сравнить конверсии. Но для наших банковских продуктов такой подход работает не всегда. После коммуникации продукт часто подключает меньше 1% клиентов. Поэтому нужны большие выборки и длительные эксперименты.
Что мы сделали, чтобы не ждать:
Таким образом, эффективность NBA определяется не только качеством алгоритмов. Важно научиться правильно выбирать аудиторию, быстро обучать модели и работать при небольшом количестве данных. Тогда можно перейти от массовых рассылок к действительно персонализированным коммуникациям.
💜 Этот пост написал Евгений Наговицын, ML-разработчик в Точка Банк
Это завершающий пост из серии о построении NBA для банковских продуктов. Мы уже построили модели, научились быстро их обучать и нашли способ работать даже при небольшом количестве данных. Но на практике этого оказалось мало. Чтобы система заработала в реальных условиях, пришлось внести ещё несколько изменений.
Холдирование клиентов
Представим, что менеджер собирает аудиторию в Excel-файл и передаёт его в отдел рассылок. Между этим моментом и фактической отправкой письма может пройти от нескольких часов до нескольких дней.
За это время могут возникнуть две неприятные ситуации:
• Аудитории начнут пересекаться. Пока одна команда готовит рассылку, другая может выбрать тех же самых клиентов для своей кампании. В результате один человек получает сразу несколько писем или звонков подряд.
• Аудитория может «сгореть». Например, менеджер сформировал выборку из 1000 клиентов, но к моменту запуска коммуникации большая часть из них уже попала в другие кампании. В итоге сообщение отправится лишь небольшой части аудитории, труд менеджера будет напрасным.
Чтобы этого избежать, мы использовали механизм холдирования. Как только клиент попадает в аудиторию одной кампании, система временно резервирует его. Пока коммуникация не будет отправлена или отменена, он становится недоступен для других выгрузок.
Оценка эффективности
Следующая проблема возникла при оценке качества моделей. В классическом A/B-тестировании есть две группы: А — тестовая группа, которая получает коммуникацию; Б — контрольная группа, которая ничего не получает.
Дальше остаётся сравнить конверсии. Но для наших банковских продуктов такой подход работает не всегда. После коммуникации продукт часто подключает меньше 1% клиентов. Поэтому нужны большие выборки и длительные эксперименты.
Что мы сделали, чтобы не ждать:
1. Стали использовать прокси-метрики. Вместо подключения продукта начали учитывать другие сигналы — клики. Например, для баннеров оценивали click rate — эта метрика накапливается быстрее и позволяет понять, работает ли стратегия.
2. Перешли от проверки статистической значимости к оценке вероятности улучшения. Для этого смоделировали конверсии с помощью бета-распределения и оценивали вероятность того, что новая модель покажет результат лучше базовой.
3. Добавили скрытый контроль. Стали автоматически оставлять часть клиентов в контрольной группе. Это позволяет постепенно накапливать данные и оценивать модели в долгосрочной перспективе.
Таким образом, эффективность NBA определяется не только качеством алгоритмов. Важно научиться правильно выбирать аудиторию, быстро обучать модели и работать при небольшом количестве данных. Тогда можно перейти от массовых рассылок к действительно персонализированным коммуникациям.
💜 Этот пост написал Евгений Наговицын, ML-разработчик в Точка Банк