Does-It-Look-Sequential
В репозитории опубликован код Does-It-Look-Sequential — исследования о том, насколько популярные наборы данных действительно подходят для оценки последовательных рекомендаций. Авторы разбирают частую проблему в этой области, где модели вроде SASRec и GRU4Rec предполагают, что порядок действий пользователя несет полезный сигнал, но сами наборы данных не всегда содержат сильные последовательные зависимости. Для проверки авторы используют простую идею со случайным перемешиванием пользовательских историй. Если после перемешивания качество модели почти не меняется, значит модель в основном опиралась не на порядок действий, а на другие свойства данных. В работе предложены три способа такой проверки. Первый считает короткие последовательные правила до и после перемешивания. Два других смотрят на падение HitRate@10 и NDCG@10, а также на изменение списка рекомендаций через Jaccard@10. Эксперименты проведены на 19 наборах данных, включая Beauty, Diginetica, RetailRocket, Yoochoose, Steam, ML-20m, 30Music, Yambda-50M, Gowalla, Yelp и другие часто используемые бенчмарки. Авторы показывают, что Diginetica, Foursquare, Gowalla, RetailRocket, Steam и Yelp имеют сравнительно слабую последовательную структуру. Отдельно анализируется влияние предобработки, фильтрации редких пользователей и объектов, удаления уже просмотренных объектов из рекомендаций и выбора гиперпараметров. Оказывается, такие технические детали могут заметно менять выводы о том, есть ли в данных полезный порядок. В конце авторы разделяют наборы данных по типам зависимостей: где история работает почти как набор объектов без порядка, где важны только недавние действия, где достаточно одного-двух последних объектов, и где есть более сложная структура порядка. Работа будет полезна исследователям рекомендательных систем и ML-инженерам.
статья | код
В репозитории опубликован код Does-It-Look-Sequential — исследования о том, насколько популярные наборы данных действительно подходят для оценки последовательных рекомендаций. Авторы разбирают частую проблему в этой области, где модели вроде SASRec и GRU4Rec предполагают, что порядок действий пользователя несет полезный сигнал, но сами наборы данных не всегда содержат сильные последовательные зависимости. Для проверки авторы используют простую идею со случайным перемешиванием пользовательских историй. Если после перемешивания качество модели почти не меняется, значит модель в основном опиралась не на порядок действий, а на другие свойства данных. В работе предложены три способа такой проверки. Первый считает короткие последовательные правила до и после перемешивания. Два других смотрят на падение HitRate@10 и NDCG@10, а также на изменение списка рекомендаций через Jaccard@10. Эксперименты проведены на 19 наборах данных, включая Beauty, Diginetica, RetailRocket, Yoochoose, Steam, ML-20m, 30Music, Yambda-50M, Gowalla, Yelp и другие часто используемые бенчмарки. Авторы показывают, что Diginetica, Foursquare, Gowalla, RetailRocket, Steam и Yelp имеют сравнительно слабую последовательную структуру. Отдельно анализируется влияние предобработки, фильтрации редких пользователей и объектов, удаления уже просмотренных объектов из рекомендаций и выбора гиперпараметров. Оказывается, такие технические детали могут заметно менять выводы о том, есть ли в данных полезный порядок. В конце авторы разделяют наборы данных по типам зависимостей: где история работает почти как набор объектов без порядка, где важны только недавние действия, где достаточно одного-двух последних объектов, и где есть более сложная структура порядка. Работа будет полезна исследователям рекомендательных систем и ML-инженерам.
статья | код