🤩🤩Чем лучше становится AI, тем ценнее становятся A/B-тесты.
На первый взгляд это звучит парадоксально.
Сегодня LLM могут за минуты предложить десятки вариантов заголовков, экранов или пользовательских сценариев. Кажется, что скоро они смогут и предсказывать, какой вариант победит.
Помните про исследование от Spotify🎵? Ребята показали, почему это не так.
Они сравнили прогнозы LLM с результатами 417 реальных A/B-тесто. Без калибровки модель смогла восстановить лишь 39% эффекта, который наблюдался у настоящих пользователей. Чтобы приблизиться к реальности, ей понадобились исторические данные человеческих экспериментов.
И здесь возникает ключевое ограничение.
Калибровка работает только тогда, когда новая гипотеза похожа на уже проверенные. Но если идея действительно новая, сравнить ее не с чем - человеческих данных еще не существует.
Посмотрите на один из наших недавних экспериментов.
Мы протестировали небольшое изменение интерфейса повторного заказа. Оно выглядело логичным, современным и удобным (подсмотрено у Amazon). Многие, вероятно, внедрили бы его без раздумий.
Но A/B-тест показал обратное: Add to Cart снизился на 2.58%.
В этом и заключается главный парадокс эпохи AI.
Искусственный интеллект может сделать генерацию идей практически бесплатной. Значит, вокруг нас станет еще больше решений, которые выглядят убедительно.
Но единственный способ понять, какие из них действительно улучшают продукт, - показать их реальным пользователям.
AI строит гипотезы. Эксперименты принимают решения.
И именно поэтому ценность A/B-тестирования в ближайшие годы, скорее всего, не уменьшится, а станет только выше.
_______________
CRO & Personalization 😎
На первый взгляд это звучит парадоксально.
Сегодня LLM могут за минуты предложить десятки вариантов заголовков, экранов или пользовательских сценариев. Кажется, что скоро они смогут и предсказывать, какой вариант победит.
Помните про исследование от Spotify🎵? Ребята показали, почему это не так.
Они сравнили прогнозы LLM с результатами 417 реальных A/B-тесто. Без калибровки модель смогла восстановить лишь 39% эффекта, который наблюдался у настоящих пользователей. Чтобы приблизиться к реальности, ей понадобились исторические данные человеческих экспериментов.
И здесь возникает ключевое ограничение.
Калибровка работает только тогда, когда новая гипотеза похожа на уже проверенные. Но если идея действительно новая, сравнить ее не с чем - человеческих данных еще не существует.
Посмотрите на один из наших недавних экспериментов.
Мы протестировали небольшое изменение интерфейса повторного заказа. Оно выглядело логичным, современным и удобным (подсмотрено у Amazon). Многие, вероятно, внедрили бы его без раздумий.
Но A/B-тест показал обратное: Add to Cart снизился на 2.58%.
В этом и заключается главный парадокс эпохи AI.
Искусственный интеллект может сделать генерацию идей практически бесплатной. Значит, вокруг нас станет еще больше решений, которые выглядят убедительно.
Но единственный способ понять, какие из них действительно улучшают продукт, - показать их реальным пользователям.
AI строит гипотезы. Эксперименты принимают решения.
И именно поэтому ценность A/B-тестирования в ближайшие годы, скорее всего, не уменьшится, а станет только выше.
_______________
CRO & Personalization 😎