2606.17165v1.pdf
🤲 Кажется, что A/B-тестирование стоит на пороге революции.
Зачем ждать недели и тратить миллионы на трафик, если можно запустить эксперимент на тысяче AI-агентов и получить ответ за несколько минут?
Именно эту идею проверили исследователи из Spotify в новой работе про LLM-based A/B testing.
Но их главный вывод оказался неожиданным.
Проблема не в том, что LLM плохо предсказывают поведение людей. Во многих задачах они действительно показывают впечатляющие результаты. Проблема в другом: даже если модель отлично воспроизводит прошлые эксперименты, это почти ничего не говорит о ее способности предсказывать результат нового вмешательства.
Авторы предлагают смотреть на LLM не как на замену пользователям, а как на суррогатную метрику - примерно так же, как медицина использует биомаркеры вместо долгосрочных исходов.
Если между ответами модели и поведением людей существует стабильная связь, ее можно откалибровать на исторических экспериментах и использовать для оценки будущих эффектов.
Звучит многообещающе.
Но здесь возникает фундаментальное ограничение.
Эту связь можно опровергнуть на прошлых экспериментах, но нельзя доказать для будущих.
Другими словами, если модель успешно воспроизводила тысячу предыдущих тестов, это не гарантирует, что она не ошибется на тысяча первом.
Это напоминает фундаментальную проблему прогнозирования. Мы можем проверить модель на прошлом, но не можем доказать её правоту в будущем.
С LLM-экспериментами ситуация аналогична: успешное воспроизведение сотен прошлых тестов повышает доверие к модели, но не гарантирует корректность оценки для нового продукта, новой функции или нового пользовательского сценария.
Еще один интересный результат: стохастичность LLM оказывается не багом, а фичей. Авторы показывают, что несколько независимых ответов модели для одного и того же сценария работают лучше одного. Усреднение снижает шум, уменьшает смещение и делает оценки заметно стабильнее.
Поэтому наиболее вероятное будущее экспериментов выглядит не как замена людей на AI
Скорее это гибридная модель:
⏺люди продолжают служить источником истины;
⏺ LLM помогают быстро отсеивать слабые гипотезы;
⏺ ключевые решения по-прежнему подтверждаются реальными экспериментами.
Именно поэтому главный вывод статьи звучит гораздо менее футуристично, чем ожидалось:
LLM могут сделать эксперименты дешевле и быстрее, но не избавят нас от необходимости проводить эксперименты на людях. Это исследование интересно не только тем, что отвечает на вопрос могут ли AI-агенты заменить пользователей. Оно показывает гораздо более важную вещь: где проходит граница между прогнозированием и причинно-следственным выводом.
Почему AI может помочь найти выигрышную гипотезу, но не способен самостоятельно подтвердить её эффект, - читайте в новой работе от Spotify 🎵
CRO & Personalization 🍧
👍 Проголосовать за канал 🫶
Зачем ждать недели и тратить миллионы на трафик, если можно запустить эксперимент на тысяче AI-агентов и получить ответ за несколько минут?
Именно эту идею проверили исследователи из Spotify в новой работе про LLM-based A/B testing.
Но их главный вывод оказался неожиданным.
Проблема не в том, что LLM плохо предсказывают поведение людей. Во многих задачах они действительно показывают впечатляющие результаты. Проблема в другом: даже если модель отлично воспроизводит прошлые эксперименты, это почти ничего не говорит о ее способности предсказывать результат нового вмешательства.
Авторы предлагают смотреть на LLM не как на замену пользователям, а как на суррогатную метрику - примерно так же, как медицина использует биомаркеры вместо долгосрочных исходов.
Если между ответами модели и поведением людей существует стабильная связь, ее можно откалибровать на исторических экспериментах и использовать для оценки будущих эффектов.
Звучит многообещающе.
Но здесь возникает фундаментальное ограничение.
Эту связь можно опровергнуть на прошлых экспериментах, но нельзя доказать для будущих.
Другими словами, если модель успешно воспроизводила тысячу предыдущих тестов, это не гарантирует, что она не ошибется на тысяча первом.
Это напоминает фундаментальную проблему прогнозирования. Мы можем проверить модель на прошлом, но не можем доказать её правоту в будущем.
С LLM-экспериментами ситуация аналогична: успешное воспроизведение сотен прошлых тестов повышает доверие к модели, но не гарантирует корректность оценки для нового продукта, новой функции или нового пользовательского сценария.
Еще один интересный результат: стохастичность LLM оказывается не багом, а фичей. Авторы показывают, что несколько независимых ответов модели для одного и того же сценария работают лучше одного. Усреднение снижает шум, уменьшает смещение и делает оценки заметно стабильнее.
Поэтому наиболее вероятное будущее экспериментов выглядит не как замена людей на AI
Скорее это гибридная модель:
⏺люди продолжают служить источником истины;
⏺ LLM помогают быстро отсеивать слабые гипотезы;
⏺ ключевые решения по-прежнему подтверждаются реальными экспериментами.
Именно поэтому главный вывод статьи звучит гораздо менее футуристично, чем ожидалось:
LLM могут сделать эксперименты дешевле и быстрее, но не избавят нас от необходимости проводить эксперименты на людях. Это исследование интересно не только тем, что отвечает на вопрос могут ли AI-агенты заменить пользователей. Оно показывает гораздо более важную вещь: где проходит граница между прогнозированием и причинно-следственным выводом.
Почему AI может помочь найти выигрышную гипотезу, но не способен самостоятельно подтвердить её эффект, - читайте в новой работе от Spotify 🎵
CRO & Personalization 🍧
👍 Проголосовать за канал 🫶