Репост из: Kantor.AI
Про признак «у пользователя день рождения» в ML
В этом году на день рождения (он был уже давно, сейчас просто вспомнил историю) я получил очень много поздравлений, и что-то меня побудило всем поздравившим ответить в тот же день.
В итоге больше половины моих ответов телеграм удалил, решив, что я спамер. Даже были прецеденты, когда мы с человеком попереписывались, а на следующий день его реплики есть, а мои все потерли.
В этом нашелся и позитивный момент, я до сих пор случайно нахожу диалоги с поздравлениями и снова радуюсь им, но конечно основное, что меня позабавило, это что в классификаторе спама либо нет признака «у пользователя ДР», либо он не работает. И это, кстати, частый недостаток ML моделей в B2C сервисах.
Например, в одной компании, где я работал, два моих коллеги мужского пола постоянно определялись внутренним классификатором пола как женщины, а один из них на этот счет даже неплохо плевался желчью. Причина тому была очень простой: у них день рождения 8 марта, и они получают аномально высокое для мужчины количество звонков в этот день. Среди тысяч сотрудников оказалось достаточно мужчин, родившихся 8 марта, чтобы баг исправился сам собой, когда для модели сделали нормальные признаки.
Общий же рецепт довольно простой: при разработке модели хорошо бы подумать, почему она может ошибаться на каких-то примерах, и что сделать, чтобы не ошибалась. Как правило первые ответы на этот вопрос будут касаться наличия и актуальности нужных признаков, корректности собранного таргета, баланса классов и в целом репрезентативности выборки.
В этом году на день рождения (он был уже давно, сейчас просто вспомнил историю) я получил очень много поздравлений, и что-то меня побудило всем поздравившим ответить в тот же день.
В итоге больше половины моих ответов телеграм удалил, решив, что я спамер. Даже были прецеденты, когда мы с человеком попереписывались, а на следующий день его реплики есть, а мои все потерли.
В этом нашелся и позитивный момент, я до сих пор случайно нахожу диалоги с поздравлениями и снова радуюсь им, но конечно основное, что меня позабавило, это что в классификаторе спама либо нет признака «у пользователя ДР», либо он не работает. И это, кстати, частый недостаток ML моделей в B2C сервисах.
Например, в одной компании, где я работал, два моих коллеги мужского пола постоянно определялись внутренним классификатором пола как женщины, а один из них на этот счет даже неплохо плевался желчью. Причина тому была очень простой: у них день рождения 8 марта, и они получают аномально высокое для мужчины количество звонков в этот день. Среди тысяч сотрудников оказалось достаточно мужчин, родившихся 8 марта, чтобы баг исправился сам собой, когда для модели сделали нормальные признаки.
Общий же рецепт довольно простой: при разработке модели хорошо бы подумать, почему она может ошибаться на каких-то примерах, и что сделать, чтобы не ошибалась. Как правило первые ответы на этот вопрос будут касаться наличия и актуальности нужных признаков, корректности собранного таргета, баланса классов и в целом репрезентативности выборки.