Разбор докладов с конференции
И вот подошел к концу второй день конференции Data Fusion, на котором было множество различных секций, дискуссий и кейс-сессий. Я решила написать о парочке докладов, которые мне больше всего понравились.
➡️Первый доклад «Ключевые проблемы рекомендаций на последовательностях и варианты их решения». Посвящен проблемам в Sequential рекомендациях. В первой части рассматривалась проблема разделения данных: популярный leave-one-out допускает temporal leakage и формирует нереалистичный горизонт предсказания, что может негативно влиять на ранжирование и выводы о моделях. В качестве альтернативы предложен global temporal split с выбором целевых взаимодействий Last / Random / Successive - такие схемы лучше соответствуют задаче next-item prediction, уменьшают утечки и дают более стабильные результаты, хотя и сокращают число тестовых пользователей.
⭐️В целом, проблема LOO очень понятна, особенно для последовательных данных, и было интересно услышать об обоснованности сочетания GTS с разными способами выбора целевых взаимодействий.
➡️Во второй части освещена проблема Item Cold start: в sequential моделях новые объекты не имеют обученных эмбеддингов. Frozen content embeddings оказываются негибкими, а полный fine-tuning приводит к drift представлений и ухудшает cold-start. В качестве trade off использовался frozen content-based embedding + маленький обучаемый delta-вектор с ограниченной нормой, который позволяет модели аккуратно адаптироваться под взаимодействия, сохраняя семантику контентных признаков.
➡️Еще понравился доклад про победившее решение на соревновании Data Fusion «Страж» (задача классификации неподтвержденных операций клиентов банка). Построено чисто на нейронных сетях: данные формировались окнами (~3 месяца транзакций или 512 токенов), для каждого пользователя создавали 5–10 окон, чтобы покрыть повторяющиеся паттерны. Модель - стандартный Encoder трансформер: блок трансформера включал 2 ModernBERT (для глобальных паттернов) + 2 CNN (для локальных).
⭐️Думаю, что в ближайшем будущем многие табличные задачи будут решаться с помощью трансформеров, но при этом остается важной проблема инференса в продакшене (latency и ресурсы).
Посмотреть доклады с конференции можно уже на официальном сайте https://data-fusion.ru
И вот подошел к концу второй день конференции Data Fusion, на котором было множество различных секций, дискуссий и кейс-сессий. Я решила написать о парочке докладов, которые мне больше всего понравились.
➡️Первый доклад «Ключевые проблемы рекомендаций на последовательностях и варианты их решения». Посвящен проблемам в Sequential рекомендациях. В первой части рассматривалась проблема разделения данных: популярный leave-one-out допускает temporal leakage и формирует нереалистичный горизонт предсказания, что может негативно влиять на ранжирование и выводы о моделях. В качестве альтернативы предложен global temporal split с выбором целевых взаимодействий Last / Random / Successive - такие схемы лучше соответствуют задаче next-item prediction, уменьшают утечки и дают более стабильные результаты, хотя и сокращают число тестовых пользователей.
⭐️В целом, проблема LOO очень понятна, особенно для последовательных данных, и было интересно услышать об обоснованности сочетания GTS с разными способами выбора целевых взаимодействий.
➡️Во второй части освещена проблема Item Cold start: в sequential моделях новые объекты не имеют обученных эмбеддингов. Frozen content embeddings оказываются негибкими, а полный fine-tuning приводит к drift представлений и ухудшает cold-start. В качестве trade off использовался frozen content-based embedding + маленький обучаемый delta-вектор с ограниченной нормой, который позволяет модели аккуратно адаптироваться под взаимодействия, сохраняя семантику контентных признаков.
➡️Еще понравился доклад про победившее решение на соревновании Data Fusion «Страж» (задача классификации неподтвержденных операций клиентов банка). Построено чисто на нейронных сетях: данные формировались окнами (~3 месяца транзакций или 512 токенов), для каждого пользователя создавали 5–10 окон, чтобы покрыть повторяющиеся паттерны. Модель - стандартный Encoder трансформер: блок трансформера включал 2 ModernBERT (для глобальных паттернов) + 2 CNN (для локальных).
⭐️Думаю, что в ближайшем будущем многие табличные задачи будут решаться с помощью трансформеров, но при этом остается важной проблема инференса в продакшене (latency и ресурсы).
Посмотреть доклады с конференции можно уже на официальном сайте https://data-fusion.ru