▫️Если вы развиваете
поиск,
рекомендательные системы или любой другой алгоритм ранжирования, тогда держите статью. В ней авторы показывают, как получать результаты, сопоставимые с классическими A/B-тестами, используя в
10-100 раз меньше данных.
Каждый, кто запускал A/B-тесты, сталкивался с одной и той же проблемой.
Есть идея. Есть гипотеза. Но чтобы понять, работает ли она, приходится ждать неделю, две, а иногда и месяц. Не потому, что эксперимент сложный. А потому что статистике нужно много данных.
Можно ли узнать ответ раньше?
Исследователи Microsoft решили проверить это на примере поисковых систем.
Вместо классического A/B-теста они использовали метод interleaving: пользователю одновременно показываются результаты двух алгоритмов ранжирования, а победитель определяется по поведению этого же пользователя. Такой подход резко снижает разброс между пользователями и позволяет принимать решения значительно быстрее.
Но возникла другая проблема. Высокая чувствительность достигалась ценой качества -
interleaving не всегда выбирал того же победителя, что и полноценный A/B-тест.
Тогда исследователи изменили не сам алгоритм interleaving, а то, как начисляется кредит каждому алгоритму.
Вместо простого подсчета кликов они начали учитывать более богатые сигналы удовлетворенности пользователя: вероятность того, что клик действительно решил задачу, длительность просмотра страницы, позицию результата и другие поведенческие признаки.
Результат впечатляет.
На данных из 38 онлайн-экспериментов и более 3 миллиардов кликов совпадение с итогами классических A/B-тестов выросло с 76% до 85%, а
interleaving сохранил свое главное преимущество - ему по-прежнему требовалось на один-два порядка меньше данных, чем традиционному эксперименту.
Для меня главный вывод выходит далеко за рамки поиска.
Мы часто обсуждаем, какая метрика лучше: CTR, конверсия, удержание, GMV. Но иногда настоящий прорыв происходит не тогда, когда появляется новая метрика, а тогда, когда мы начинаем по-другому интерпретировать уже существующие сигналы.
Иногда самый быстрый эксперимент - это не тот, который быстрее заканчивается.
А тот, который извлекает максимум информации из каждого взаимодействия пользователя.
_______________CRO & Personalization 🪐