Trisigma — про эксперименты


Channel's geo and language: Russia, Russian
Category: Edutainment


Канал про эксперименты, статистику и анализ данных
Черемисинов Виталий: @vitche (сотрудничество)
Мирмахмадов Искандер: @iskndr_m (гл. автор)
Trisigma — https://trisigma.io
A/B платформа Sigma — https://expf.ru/sigma
Консалтинг — https://expf.ru

Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Category
Edutainment
Statistics
Posts filter


Привет! Это Вит.

🔵В четверг прошёл наш первый митап в Ташкенте. И прошёл он отлично! Будем считать это хорошим знаком для Trisigma в СНГ!

Спасибо всем, кто пришёл и посмотрел нас в онлайне! Продуктивно поговорили и про экономику A/B в компаниях, и про саму культуру экспериментов, и про инструменты и методики в контексте кейсов. Также буду рад вашей обратной связи в комментариях.

Чуть позже поделюсь статьями по итогам митапа. А пока рекомендую посмотреть запись стрима, особенно, если интересно послушать про A/B в других компаниях.




Trisigma — канал про A/B-тестирование

#trisigma




Привет!

Уже завтра увидимся с вами на Trisigma to Tashkent. Регистрация открыта, так что можно подать заявку и на офлайн, и на онлайн.


Привет, на связи Вит.

И я с новостью, к которой мы долго готовились и ждали:

«Платформа A/B-тестирования Trisigma станет доступна компаниям в Армении, Грузии, Казахстане и Узбекистане»


Многие, уверен, уже догадывались об этом после новости про митап в Ташкенте. Теперь всё официально, и о планах можно в заметке «Коммерсанта» прочитать.

Приходите обсудить и этот шаг, и эксперименты 1 октября. Не забудьте зарегистрироваться и на офлайн, и на онлайн.




Trisigma — канал про A/B-тестирование

#trisigma


Привет! Это Вит.

Мы выкатили всю программу Trisigma to Tashkent. В карточках можно посмотреть то, о чём будем говорить на митапе
1 октября.

🔵Регистрация открыта. Ждём и в Ташкенте, и в онлайне всех, кто работает с экспериментами, продуктом и данными.



Trisigma — канал про A/B-тестирование

#trisigma


Привет! Это Вит.

1 октября мы проведём первый митап в Ташкенте — Trisigma to Tashkent.  Это смелый и важный для нас шаг. Да и для комьюнити тех, кто делает A/B-культуру в России и СНГ, думаю, тоже. 

Программу собрали на весь день. Среди спикеров — TBC и Uzum. Вот о чём будем говорить:

— Как культура экспериментов превращает продуктовую команду в data-driven, а не data-informed.
— Как выстроить аналитику так, чтобы она помогала, а не мешала бизнесу.
— Как в разных компаниях устроен процесс работы с данными, и почему в одной он работает как нужно, а в другой нет.
— Как оценить экономический эффект от внедрения A/B-культуры в бизнесе.

После дискуссии и обсуждений проведём демо Trisigma. 

Буду рад видеть вас очно. Также можно подключиться из любой точки онлайн.

🔵Регистрируйтесь и отправляйте коллегам — ждём всех, кто работает с продуктом и данными.

И до встречи в Ташкенте 1 октября!   




Trisigma — канал про A/B-тестирование

#trisigma


Всем привет, это Искандер

🔵 Предлагаю вам взглянуть на пейпер Amazon и Northeastern «Agent A/B: Automated and Scalable A/B Testing on Live Websites with Interactive LLM Agents». Исследование предлагает систему, которая использует LLM-агентов с разными персонажами для автоматизированного и масштабируемого A/B-тестирования веб-интерфейсов — агенты имитируют поведение реальных пользователей (поиск, клики, покупки), что позволяет обойти ограничения традиционных тестов.

Проблема

Авторы сначала опросили шесть практиков из екома, которые регулярно катят тесты на аудитории от миллиона человек. Картина знакомая до боли: путь от идеи до финального решения занимает от трёх месяцев до года, трафика на всех не хватает, тесты на пересекающиеся куски интерфейса приходится ставить в очередь. В итоге до теста доезжает мало гипотез, а ранние прототипы не проверяются никак, кроме как «показали коллегам и спросили, все ли ок».

Что предлагают авторы

Авторы предлагают вставить перед тестом фазу симуляции. LLM генерит 100 000 персон с возрастом, доходом, профессией и привычками в покупках, из них сэмплят 1000 штук и раскидывают 500/500 на контроль и тритмент. Дальше каждый агент через Selenium ходит по живому Amazon.com: ищет, кликает товар, применяет фильтр, покупает или уходит. Страницу парсят не в скриншот и не в сырой HTML, а в урезанный JSON только с товарами, ценами и фильтрами. Сессия обрезается на 20 действиях. Под капотом Claude 3.5 Sonnet.

Тестировали сокращение панели фильтров: в тритменте выбрасывали опции, у которых похожесть на поисковый запрос ниже 80%. Агенты в тритменте купили 414 раз против 403 в контроле, χ²(1)=5.51, p=0.03. Средний чек подрос с $55 до $61, но незначимо. Параллельно тот же тест крутили на 2 млн живых пользователей, и направление эффекта совпало.

Когда это реально нужно

Когда у вас очередь из гипотез и дефицит трафика, а решать, что катить первым, приходится на глазок. Тысяча агентов обошлась в 875 млн токенов и примерно $2900, и это заметно быстрее, чем ждать две недели набора трафика.

От себя

Я придерживаюсь такого мнения, что пока не наступила эпоха AGI и у агентов будет отсутствовать скилл к обобщению, то ценность от симуляционных пользователей низкая и они не заменят живой трафик даже в грубом приближении. Однако, идея использования агентов для приоритезации и чистки бэклога, замер приблизительного импакта и ускорение продуктового груминга выглядит очень даже неплохо.




Trisigma — канал про A/B-тестирование

#trisigma


Всем привет! На связи Вит и это пост по следам вчерашней FuckUp Night.

🔵 Вчера мы собрали друзей, и каждый из них поделился своей фейл-историей — из регулярной работы или больших профессиональных событий.

➖Беслан Курашов, сооснователь Karpov.Courses — рассказал, как его компанию продали без него.

➖Роман Нестер, Segmento (продан Сберу) и Arteus LLM — про то, как создавал стартап и продавал его Сберу. И поделился, какие сложности вообще возникают при продаже своего бизнеса корпорации.

➖Валерий Бабушкин, BP — рассказал историю из регулярной практики: как проблема прогнозирования спроса сказывается на наличии товаров на полках.


Про такие провалы обычно не говорят, а, если и обсуждают, то тихо и за закрытыми дверями. А рассказывать про них важно и нужно! Именно в таких кейсах больше опыта и профессионализма, открытости и глубины. Нравится, как про это сказал Роман Нестер:

«Надоели всем истории успеха, потому что все вроде уже понимают, сколько в них вранья, натяжек, недосказанностей. А факап заставляет тебя не просто встать на тумбочку и рассказать стих, какой ты молодец, а оказаться уязвимым и от этого настоящим. Ненастоящее нам и ИИ расскажет».


А как вам такой формат? Что запомнилось? Что понравилось, а что нет? Жду в комментах 👇




Trisigma — канал про A/B-тестирование

#trisigma


Привет!

Сегодня встречаемся на FuckUp Night в 18:00 по Москве.
Записи не будет, поэтому ждём всех на эфире!

🔵 Главное, не забудьте зарегистрироваться.



Trisigma — канал про A/B-тестирование

#trisigma


Привет! Это Вит.

Мы с Романом Нестером, Валерием Бабушкиным и Бесланом Курашовым (plevako.ai и karpov.courses) приглашаем вас на наш FuckUp Night 26 августа.

От формата отходить не будем — поделимся своими историями, где всё пошло не по плану. И поговорим про культуру ошибок: как не зацикливаться на промахах и использовать их в свою пользу.

Встречу проведём онлайн, поэтому подключиться можно из любой точки и всем, кто принимает решения на основе данных.

🔵 Важно! Записи не будет, поэтому приходите на эфир. Главное, не забудьте зарегистрироваться.




Trisigma — канал про A/B-тестирование

#trisigma


Привет! Это Вит.

Выпустили на Хабре AvitoTech короткое интервью. Короткое, потому что это — выжимка из выпуска AviTalk. Внутри для себя можно найти ответы на эти вопросы:

— если идти в свое дело, то каким может быть путь;
— можно ли делать бизнес с друзьями;
— каким может быть предпринемательский Оскар;
— практические советы тем, кто хочет свой бизнес.

Как и всегда, жду в комментариях после прочтения 👇

Trisigma — канал про A/B-тестирование

#trisigma


Всем привет, это Искандер.

🔵 Предлагаю вам взглянуть на пейпер Airbnb про interleaving.

Проблема
Airbnb улучшает поиск по жилью, метрики у них конверсионные, вплоть до бронирования. Бронируют редко, куда реже, чем кликают в обычном e-commerce. Значит A/B нужно много трафика и много недель, а идей по ранжированию всегда больше, чем свободных слотов под тесты. В классических A/B физически сложно это все уместить.

Что предлагают авторы
Пользователей не делят на контроль и тест. Выдачу двух ранкеров смешивают и показывают одному человеку сразу, поэтому сравнение идёт внутри одного пользователя, а не между группами.
Смешивают через team drafting. Т.к. пользователю мы показываем результаты обоих ранкеров, то все что делает сплиттер, это рандомизация порядковых номеров для каждого элемента в выдаче (AABABB, BABBAB и т.п.)
Победителя определяют по preference margin и обычному одновыборочному t-тесту.

Когда это реально нужно
Когда узкое горлышко именно в A/B: много гипотез по ранжированию или рекомендациям, и при этом мало трафика или редкая конверсия. У Airbnb interleaving дал 50x ускорение, эксперимент забирает около 6% A/B-трафика и треть длительности, а с A/B сходится в 82% случаев. По сути это способ дёшево отсеять слабые идеи до полноценного теста.

От себя
Interleaving это не замена A/B, а предварительный фильтр для полноценного A/B. Он меряет относительное предпочтение между двумя ранкерами, а не абсолютный прирост бизнес-метрики. Разработка и интеграция tdi достаточно дорогостоящее занятие, поэтому к этой практике имеет смысл переходить только тогда, когда количество АБ над ранжированием достаточно емкое.


Trisigma — канал про A/B-тестирование

#trisigma


Привет, это Вит.

🔵Я уже рассказывал вам про то, что мы запустили блог на сайте Trisigma. Сегодня про две статьи оттуда, которые помогут точно ответить на вопрос: Когда останавливать A/B-тест.

Первая, а точнее первая часть про MDE (Minimum Detectable Effect). В ней про то, что такое MDE, почему без него невозможно понять, сколько на самом деле должен длиться тест, и как не тратить недели на эксперименты, которые изначально не способны дать полезный результат.

Вторая — про Монте-Карло, метод с помощью которого можно оценить возможные результаты чего угодно. В его основе — многократное симулированное моделирование исходов каких-либо событий (всё, как в рулетке, собственно оттуда и название).




Trisigma — канал про A/B-тестирование

#trisigma


Всем привет, это Искандер.

🔵И я к вам с новым обзором. Сегодня предлагаю взглянуть на пейпер Netflix «Evaluating Decision Rules Across Many Weak Experiments», как оценивать правила принятия решений по множеству слабых A/B‑тестов.

Проблема

Компания гоняет тысячи экспериментов, но правило «когда катить фичу» методологически прорабатывается без должного внимания. Катим, «если стат.значимо». Или «катим, если аплифт положительный». А сколько эта политика приносит в сумме по всему корпусу экспериментов, никто не считает.

Что предлагают авторы

Netflix взяли исторические эксперименты, на них применили правила «катим/не катим» по двум подходам (старый подход с вынесением вердикта по результатам и новый). Сложили по всем тестам вердикты (катим/не катим) и получили, сколько метрики каждое правило принесло бы суммарно. Хорошее правило катит больше реально плюсовых фич и меньше минусовых.

Загвоздка в том, что истинный эффект вы не знаете, у вас только замер с шумом. Наивный путь — взять замер сразу и как критерий отбора, и как размер выигрыша. Тогда вылезает winner's curse: тесты, которые выглядят лучшими, наполовину просто везучий шум, и суммарную отдачу вы завышаете сами себе.

Авторы чинят это через cross-validation. Данные каждого теста режут на две части. На одной половине правило решает «катить / не катить», на другой меряют, сколько north star реально набежало от этого решения. Отбор и подсчёт выигрыша идут по независимым данным, поэтому шум, из-за которого тест «выстрелил», больше не подкручивает оценку вверх. Так по всей истории получают честную суммарную отдачу каждого правила и сравнивают правила между собой.

Когда это реально нужно

Когда у вас много серых экспериментов и вы хотите настроить саму политику раскатки. На 123 исторических тестах Netflix новое правило дало +33% к накопленному north star против прежнего, и его в итоге внедрили. Выигрыш тут не в новом стат.методе, а в том, что порог принятия решения подобрали по реальной отдаче корпусу.

От себя

На мой взгляд, тут ловушка вот в чём: как только вы начинаете подбирать правило под свои данные, вы сами создаёте winner's curse уже на уровне корпуса. Методологически я бы страховался историческим holdout'ом и сравнением корпуса с ним, т.к. основной проблемой выбранного правила раскатки (не важно какого) является отсутствие перевалидации себя же. Можно, в принципе, тогда катить treatment всех серых тестов (и это возможно будет лучше по % выигрыша в north star, чем другое правило), но должен быть механизм перевалидации правил на эмпирических данных. Лучше holdout мне ничего в голову не пришло.



Trisigma — канал про A/B-тестирование

#trisigma




Привет! На связи Вит.

Мы ищем старшего аналитика данных в Trisigma. Команда у нас одна из самых сильных на рынке. Поэтому и задачи ждут интересные:
— проводить R&D;
— проектировать дизайн продуктовых инкрементов, развивать движок Semantic Layer и документацию (подходы, best practices, статьи);
— проектировать аналитические решения для клиентов и внедрять их.


🔵Откликайтесь напрямую на карьерном сайте. И обязательно пересылайте знакомым, которым может быть интересна позиция.


Trisigma — канал про A/B-тестирование


#trisigma


Привет! Это Даня Никольский, бэкенд-инженер Trisigma.

Недавно я рассказывал, как мы в внедрили Switchback в нашу платформу. Сейчас мы вместе с коллегами написали большой гайд про такие эксперименты. Рассказали, как они устроены, почему для них не подходит обычный t-тест и какая инфраструктура нужна, чтобы проводить их в промышленном масштабе.

🔵Читайте по этой ссылке. А вопросы — оставляйте в комментариях 👇


Trisigma — канал про A/B-тестирование


#trisigma


Ребят, это Вит, и я к вам с очень крутой новостью!

🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог!

Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned!




Trisigma — канал про A/B-тестирование


#trisigma


Есть мнение, что

CUPED переоценён — в большинстве кейсов он не даёт значимого выигрыша.


Согласны? Сталкивались? Ждём в комментариях 👇




Trisigma — канал про A/B-тестирование


#trisigma


«Когда_ИИ_не_будет_работать»_Вит_Черемисинов.pdf
87.3Mb
Привет! На связи Вит.

🔵Не так давно выступал на KARPOF.CONF, делюсь записью и удобным конспектом. Говорил про AI, а точнее про то, как выстроить аналитическую инфраструктуру, чтобы он был активом.

Запись есть только в ВК (смотреть можно без регистрации), а конспект — прикрепил в пдф.

Буду рад вашим кейсам с AI и в экспериментах, и в аналитике в целом. Делитесь, как используете и насколько это эффективно.




Trisigma — канал про A/B-тестирование


#trisigma

20 last posts shown.