TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AI VK Hub

21 Jul, 13:00

Открыть в Telegram Поделиться Пожаловаться

Несмотря на взрывной рост рекомендательных трансформеров, генеративных рекомендаций и так далее, классические методы на основе матричных факторизаций всё ещё применяются в рекомендательных системах.

Преимущество современных подходов в том, что они позволяют работать с пользователем в долгосрочной перспективе и учитывать её при построении рекомендаций. Так делают, например, PinnerFormer, OneRec. При этом матричные факторизации обычно работают жадно: набираем top-K по похожести между эмбеддингами в данный момент времени.

Исследователи AI VK Михаил Трапезников и Максим Утушкин предложили подход, который снимает это ограничение и позволяет рекомендательным системам учитывать будущие изменения состояния пользователя.

Решение подробно изложено в статье Planning over Matrix-Factorization MDPs for Candidate Generation. Статья принята на воркшоп по Customer Journey на KDD 2026.

Подход

Исследователи работали с популярной моделью матричных факторизаций ALS (Alternating Least Squares), ориентируясь на механику обновления профилей в сервисе Profile Stream в VK. В нём эмбеддинг пользователя не просто фиксируется после обучения, а обновляется по явной формуле после каждого батча новых пользовательских взаимодействий.

Исследователи применили технику MCTS (Monte Carlo Tree Search) — представили возможные последовательности рекомендаций в виде дерева, чтобы найти путь в дереве, соответствующий оптимальной последовательности рекомендаций. Для офлайн-экспериментов при построении дерева рассматривались набор действий из top-K по близости эмбеддингов и оптимистичная среда.

Вершина дерева — текущее состояние, ветви из вершины — k возможных рекомендаций. При переходе по ветви считаем, что пользователю понравилась рекомендация (оптимистичный сценарий), попадаем в новое состояние — и там всё повторяется.

Процесс

Можно представить процесс в виде RL-среды:

🔸 Состояние — текущее эмбеддинговое представление пользователя
🔸 Действие — показ айтема пользователю
🔸 Награда — сумма близостей к понравившимся айтемам
🔸 Обновление состояния происходит согласно формулам обновления в ALS

Такое представление открывает возможность применения различных RL-подходов, которые позволяют не просто работать с сиюминутными наградами, но и планировать на несколько шагов вперёд.

В работе рассматривались датасеты MovieLens-1M, KuaiRec, Yambda и VK-LSVD. Сравнения производились под протоколами Leave-last-n и Global time split. Первый откладывает последние взаимодействия каждого пользователя, второй режет данные по глобальной временной отсечке — это ближе к проду.

Результат

➡️ На Leave-last-n планирование обходит обычный статический top-K на всех датасетах. В частности, на срезах VK-LSVD Recall@10 растёт примерно в полтора раза
➡️ На Global time split выигрыш сохраняется на MovieLens-1M и VK-LSVD

Главное, что доказало исследование — использование обучения с подкреплением поверх относительно легковесной ALS возможно. В дальнейшем планируются исследования стохастической динамики среды из логов и дистилляции агента в быструю политику в духе MuZero.

#aivkhub #rl #mcts #als

1.6k 15 16 27
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot