Всем привет! На связи Данила Бочарников, DS-инженер команды поискового ранжирования в Авито. Сегодня разбираем свежую статью от Netflix про их эксперимент с LLM ранжированием.
🧠 GenRec: от тысяч фич к тексту
Netflix опубликовал статью о рекомендательном ранкере на базе их собственной foundation модели. Вместо инжиниринга тысячи фич модель получает на вход контекст о пользователе и кандидате в виде текста.
Обучение проходит в два этапа:
Фаза 1: адаптация open-source LLM под доменные данные Netflix.
Фаза 2: дообучение на логах.
⚙️ Технические нюансы
На второй фазе GenRec обучался на объёме данных в ~40 раз меньше, чем предыдущая продовая модель. Вместо медленной генерации токенов добавили scoring head, ранжирующий всех кандидатов за один forward pass.
Контекст удалось сжать примерно в 3 раза без потери качества.
📊 Результаты
GenRec обошёл продовый ранкер в офлайне на 1.5% по MRR.
A/B-тест на 10% трафика в течение четырёх недель показал статистически значимый рост:
— по краткосрочной вовлечённости: +0.115%
— по долгосрочному удержанию: +0.006%
Опрос: станут ли LLM стандартом для ранжирования в ближайшие 2–3 года?
🔥 — Да, это новый стандарт
🤔 — Частично, гибридные подходы останутся
👎 — Нет, слишком дорого и нестабильно
Пишите своё мнение в комментариях 👇
🧠 GenRec: от тысяч фич к тексту
Netflix опубликовал статью о рекомендательном ранкере на базе их собственной foundation модели. Вместо инжиниринга тысячи фич модель получает на вход контекст о пользователе и кандидате в виде текста.
Обучение проходит в два этапа:
Фаза 1: адаптация open-source LLM под доменные данные Netflix.
Фаза 2: дообучение на логах.
⚙️ Технические нюансы
На второй фазе GenRec обучался на объёме данных в ~40 раз меньше, чем предыдущая продовая модель. Вместо медленной генерации токенов добавили scoring head, ранжирующий всех кандидатов за один forward pass.
Контекст удалось сжать примерно в 3 раза без потери качества.
📊 Результаты
GenRec обошёл продовый ранкер в офлайне на 1.5% по MRR.
A/B-тест на 10% трафика в течение четырёх недель показал статистически значимый рост:
— по краткосрочной вовлечённости: +0.115%
— по долгосрочному удержанию: +0.006%
Краткий итог такой: сдвиг парадигмы развития ранжирования к context engineering для LLM. А полную статью смотрите на arXiv
Опрос: станут ли LLM стандартом для ранжирования в ближайшие 2–3 года?
🔥 — Да, это новый стандарт
🤔 — Частично, гибридные подходы останутся
👎 — Нет, слишком дорого и нестабильно
Пишите своё мнение в комментариях 👇