Scaling Law for Recommender Systems.
Я на Датафесте рассказывал про масштабирование рексистем: хотим как в NLP/CV, чтобы можно было увеличивать модельки и получать серьезные приросты по качеству рекомендаций. Пока таких эффектов не наблюдается, особенно с т.з. dense части моделей (энкодеров). Давайте посмотрим на статьи:
Scaling Law for Recommendation Models: Towards General-purpose User Representations (NAVER, 2021).
Активность пользователя в разных сервисах — это разные модальности, e.g. поиск vs еком. Учат модель на contrastive learning, затем переиспользуют векторы модальностей в downstream тасках. Демонстрируют скейлинг по размеру обучающего датасета и по длине посл-ти событий. Нет таймсплита для оценки качества (делят на train/test по юзерам).
Understanding Scaling Laws for Recommendation Models (Meta, 2022).
Показывают, что типичная для меты нейросетевая архитектура DLRM не скейлится с точки зрения размера энкодера, но скейлится по кол-ву данных для обучения. Прозвучало роковое "parameter scaling is out of steam for the model architecture under study, and until a higher-performing model architecture emerges, data scaling is the path forward", другими словами "надо искать новую архитектуру, чтобы заскейлиться".
Pivotal Role of Language Modeling in Recommender Systems: Enriching Task-specific and Task-agnostic Representation Learning (NAVER, 2022).
Одна из первых работ про LM-ки в рекомендациях: представляют историю пользователя в виде сплошного текста, e.g."tomcruise movies → missionimpossible → mi7 release date → [EOS]", учат языковую модель, тюнят ее под рекомендательный сценарий с двухбашенной моделью. Утверждают, что есть скейлинг по размеру энкодера, но опять-таки нет таймсплита (leave-one-out strategy, когда замеряем кач-во на последнем взаимодействии пользователя).
Scaling Generative Pre-training for User Ad Activity Sequences (Amazon Ads, 2023).
Учат next event prediction, формируют отдельные лоссы по предсказанию всех признаков события. Утверждают, что скейлинг для претрейн лосса по размеру энкодера есть, и что прирост на downstream тасках тоже имеется. Таймсплита нет.
Breaking the Curse of Quality Saturation with User-Centric Ranking (Meta AI, 2023).
Утверждают, что для ранжирующих моделей даже по обучающим данным нет скейлинга. Предлагают user-centric подход: представлять айтемы через обучаемые эмбеддинги пользователей. Показывают, что такой подход скейлится хотя бы по данным.
Scaling Law of Large Sequential Recommendation Models (Gaoling School of Artificial Intelligence, 2023).
Для канала эта статья была историческим моментом, когда я разразился постом на тему неправильных эвалов в рекомендашках :) Учат next item prediction, приходят к выводу что в рексисе скейлинг по энкодеру даже лучше, чем в NLP. Но опять нет тайм-сплита и leave-one-out схема.
Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations (Meta AI, 2024)
Показывают, что софтмакс в трансформере вредит, а затем и остальную часть энкодера очень сильно меняют. Переходят к генеративной постановке и для ранжирования, и для ретривала. Тема скейлинга все еще на раскрыта; только промелькнул абзац "We observe this phenomenon across three orders of magnitude, up till the largest models we were able to test (8,192 sequence length, 1,024 embedding dimension, 24 layers of HSTU)".
Wukong: Towards a Scaling Law for Large-Scale Recommendation (Meta AI, 2024).
Вышла примерно в одно время с прошлой статьей, но при этом предлагает концептуально другой подход с очень кастомным способом стакинга факторизационных машин. Утверждают, что scaling law для энкодера выполняется.
Еще есть серия статей про sparse часть моделей, т.е. матрицы эмбеддингов, которые у Меты/Гугла достигают триллионных размеров (например, см 1, 2, 3).
Я на Датафесте рассказывал про масштабирование рексистем: хотим как в NLP/CV, чтобы можно было увеличивать модельки и получать серьезные приросты по качеству рекомендаций. Пока таких эффектов не наблюдается, особенно с т.з. dense части моделей (энкодеров). Давайте посмотрим на статьи:
Scaling Law for Recommendation Models: Towards General-purpose User Representations (NAVER, 2021).
Активность пользователя в разных сервисах — это разные модальности, e.g. поиск vs еком. Учат модель на contrastive learning, затем переиспользуют векторы модальностей в downstream тасках. Демонстрируют скейлинг по размеру обучающего датасета и по длине посл-ти событий. Нет таймсплита для оценки качества (делят на train/test по юзерам).
Understanding Scaling Laws for Recommendation Models (Meta, 2022).
Показывают, что типичная для меты нейросетевая архитектура DLRM не скейлится с точки зрения размера энкодера, но скейлится по кол-ву данных для обучения. Прозвучало роковое "parameter scaling is out of steam for the model architecture under study, and until a higher-performing model architecture emerges, data scaling is the path forward", другими словами "надо искать новую архитектуру, чтобы заскейлиться".
Pivotal Role of Language Modeling in Recommender Systems: Enriching Task-specific and Task-agnostic Representation Learning (NAVER, 2022).
Одна из первых работ про LM-ки в рекомендациях: представляют историю пользователя в виде сплошного текста, e.g."tomcruise movies → missionimpossible → mi7 release date → [EOS]", учат языковую модель, тюнят ее под рекомендательный сценарий с двухбашенной моделью. Утверждают, что есть скейлинг по размеру энкодера, но опять-таки нет таймсплита (leave-one-out strategy, когда замеряем кач-во на последнем взаимодействии пользователя).
Scaling Generative Pre-training for User Ad Activity Sequences (Amazon Ads, 2023).
Учат next event prediction, формируют отдельные лоссы по предсказанию всех признаков события. Утверждают, что скейлинг для претрейн лосса по размеру энкодера есть, и что прирост на downstream тасках тоже имеется. Таймсплита нет.
Breaking the Curse of Quality Saturation with User-Centric Ranking (Meta AI, 2023).
Утверждают, что для ранжирующих моделей даже по обучающим данным нет скейлинга. Предлагают user-centric подход: представлять айтемы через обучаемые эмбеддинги пользователей. Показывают, что такой подход скейлится хотя бы по данным.
Scaling Law of Large Sequential Recommendation Models (Gaoling School of Artificial Intelligence, 2023).
Для канала эта статья была историческим моментом, когда я разразился постом на тему неправильных эвалов в рекомендашках :) Учат next item prediction, приходят к выводу что в рексисе скейлинг по энкодеру даже лучше, чем в NLP. Но опять нет тайм-сплита и leave-one-out схема.
Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations (Meta AI, 2024)
Показывают, что софтмакс в трансформере вредит, а затем и остальную часть энкодера очень сильно меняют. Переходят к генеративной постановке и для ранжирования, и для ретривала. Тема скейлинга все еще на раскрыта; только промелькнул абзац "We observe this phenomenon across three orders of magnitude, up till the largest models we were able to test (8,192 sequence length, 1,024 embedding dimension, 24 layers of HSTU)".
Wukong: Towards a Scaling Law for Large-Scale Recommendation (Meta AI, 2024).
Вышла примерно в одно время с прошлой статьей, но при этом предлагает концептуально другой подход с очень кастомным способом стакинга факторизационных машин. Утверждают, что scaling law для энкодера выполняется.
Еще есть серия статей про sparse часть моделей, т.е. матрицы эмбеддингов, которые у Меты/Гугла достигают триллионных размеров (например, см 1, 2, 3).