Качество данных - часть 2. В
прошлом посте рассказывала базовые проверки качества данных.
Сейчас само качество.
Дисклеймер: у каждого пользователя свои критерии. Но если убрать всё лишнее, на практике всё сводится к одному -
сравнение с эталоном или с правильной выборкой.
Что пользователи берут за эталон:
→ цифры конкурентов - сходится ли у нас трафик с тем, что показывают другие
→ свои же Google Analytics и Search Console - это по факту эталон, с которым люди сравнивают в первую очередь
→ свой опыт (зп, скиллы позиции и тп)
Для понимания - новые данные могут появляться путем
- сбора у пользователей
- круалинга/скрепинга. Зп с вакансий.
- анализа/подсчета сырых данных. Например метрика трафика везде считается.
Чаще всего сейчас продукты редко показывают ака сырые данные путем круалинга, показывают уже проанализированные/проагрегированные метрики.
Возьмем для примера, что у вас есть домены и их киворды. Вы как продакт решили, что важна категории этих доменов по типу ecommerce, SaaS and etc.
Этапы тестирования полученных данных:
- Первый этап - ручная проверка. Доменный эксперт смотрит рандомную выборку в 100–200 доменов и условно ставит да/нет насколько результат соответствует правде.
- Второй этап - найти откуда-то больше выборку условно 2000-3000 тысячи доменов и прогнать проверку, чтобы посчитать точность попадания.
- Третий этап - тестируем на пользователях. Тут смотрим на поведеческих метрики
- Хотят ли они поменять эти категории? Как часто?
- Лайки/дизлайки
В третьем этапе я могу еще накидать метрики для других примеров:
- ML рекомендации в поиске работы - какая средняя позиция в поиске на которую пользователь откликнулся. Чем выше - тем релеватнее мы ему подкинули job posting.
- ML чатбот для CS - % обращений решенных без человека.
То есть все метрики базируются на Task complition.
Вы как продакт - сталкиваетесь с таким тестированием?