Разбор моей технички на продакта ИИ-ассистента.
Часть 2 🧠
Обещал работу над ошибками — держите.
[Где я зафакапил]
Перепутал прокси-метрику с целевой: сказал «целевая — добавление в корзину, прокси — покупка». На что получил вопрос: «А что прокси прокcирует, если идёт ПОСЛЕ целевой?» Прокси всегда раньше по воронке: показ → клик → добавление → покупка.
Попробовал «отдать задачу отбора аналитику» — это красный флаг: механику отбора датасета обязан спроектировать сам продакт.
На «сколько кейсов разметить вручную» ответил «15–20%», не подумал, что там миллионы запросов. Правильно: пара сотен случайных кейсов на сегмент — достаточность выборки почти не зависит от её генеральной совокупности (см. стандартное распределение).
Главный фейл — оффлайн-оценка. «Как выбрать лучшее решение ДО выкатки на людей» — я дважды отвечал про AB и продуктовые метрики. А ждали: golden set с эталонами, precision@k, side-by-side разметка.
[Что понял про LLM-продукты]
Это гибрид продуктового и DS-собеса: рамку держишь продуктовую, а руки должны знать разметку и оффлайн-метрики. AB тут не дефолт, качество меряется не воронкой, и каждый термин проверяют на механику (если ты не знаешь что такое eval/golden set/recall то с тобой не о чем говорить).
Полный разбор — решение и структура кейса с пост-анализом каждого моего ответа — в ноушн
😎 трудности воспитывают в нас характер чемпионов
😄 детские ошибки, я вот такие кейсы щёлкаю как орешки
Часть 2 🧠
Обещал работу над ошибками — держите.
[Где я зафакапил]
Перепутал прокси-метрику с целевой: сказал «целевая — добавление в корзину, прокси — покупка». На что получил вопрос: «А что прокси прокcирует, если идёт ПОСЛЕ целевой?» Прокси всегда раньше по воронке: показ → клик → добавление → покупка.
Попробовал «отдать задачу отбора аналитику» — это красный флаг: механику отбора датасета обязан спроектировать сам продакт.
На «сколько кейсов разметить вручную» ответил «15–20%», не подумал, что там миллионы запросов. Правильно: пара сотен случайных кейсов на сегмент — достаточность выборки почти не зависит от её генеральной совокупности (см. стандартное распределение).
Главный фейл — оффлайн-оценка. «Как выбрать лучшее решение ДО выкатки на людей» — я дважды отвечал про AB и продуктовые метрики. А ждали: golden set с эталонами, precision@k, side-by-side разметка.
[Что понял про LLM-продукты]
Это гибрид продуктового и DS-собеса: рамку держишь продуктовую, а руки должны знать разметку и оффлайн-метрики. AB тут не дефолт, качество меряется не воронкой, и каждый термин проверяют на механику (если ты не знаешь что такое eval/golden set/recall то с тобой не о чем говорить).
Полный разбор — решение и структура кейса с пост-анализом каждого моего ответа — в ноушн
😎 трудности воспитывают в нас характер чемпионов
😄 детские ошибки, я вот такие кейсы щёлкаю как орешки