TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Науки о данных | МФТИ

4 Oct, 12:08

Открыть в Telegram Поделиться Пожаловаться

Задача: нужно улучшить рекомендательную систему на базе LLM. Что даст эффект — изменить размер модели или способ инициализации новых токенов? 

Александр Калистратов, выпускник Центра «Пуск» МФТИ, в выпускной работе исследовал рекомендательные системы на базе LLM.

Обычно товар в рекомендательной системе представлен своим ID. Александр действовал иначе: представил каждый товар как последовательность специальных токенов — семантический идентификатор. Если у товаров совпадает часть такой последовательности, они похожи по смыслу. Эти новые токены Александр добавил в словарь LLM. 

Эксперимент проводился на подмножестве Amazon Pet Supplies: 63 тыс. товаров и больше 100 тыс. историй покупок.

Модель проверяли на четырех задачах, и они делятся на два типа:
— семантические — сгенерировать текст по идентификатору и, наоборот, получить идентификатор по тексту;
— коллаборативные — предсказать сопутствующий товар и следующий товар в истории взаимодействий пользователя.

Как на качество влияет размер модели 

Сначала Александр сравнил четыре LLM семейства Qwen разного размера: 0,6 млрд, 1,7 млрд, 4,8 млрд и 8 млрд параметров. 

На семантических задачах более крупные модели лучше связывали идентификаторы с информацией о товаре: точнее генерировали идентификатор по тексту и текст по идентификатору. Основной прирост был при переходе от модели с 1,7 млрд параметров к модели с 4 млрд. Дальше разница между моделями сокращалась и уже не достигала статистической значимости. 
На коллаборативных задачах увеличение модели прироста не дало.

Как влияет способ инициализации новых токенов

Когда в словарь LLM добавляют новый токен, для него нужно задать эмбеддинг — вектор, с которым модель будет дальше работать. Александр проверил четыре способа задать начальные значения этих эмбеддингов.

Лучше всего сработал вариант, в котором использовали знания, уже заложенные в модели. Названия товаров разбивали на знакомые LLM токены и брали их эмбеддинги, чтобы на их основе инициализировать новые токены. По словам Александра, так они сразу оказывались «почти в правильном месте» в векторном пространстве. 

На семантических задачах этот способ показал значимо лучший результат. А вот на предсказание сопутствующего и следующего товара способ инициализации не влиял.
Собственный метод Александра — проекция кодовой книги — оказался худшим из четырех.

Что в итоге

Если нужно научить модель связывать новые идентификаторы с текстом, имеют значение и размер модели, и способ инициализации.

А в задачах на предсказание сопутствующего или следующего товара ни увеличение модели, ни способ инициализации прироста в этом эксперименте не дали.

Как говорит Александр, для одних рекомендательных задач есть смысл «запариваться с большим размером модели и всеми вытекающими», а для других — нет.


⏺Полную запись эфира смотрите по ссылке: https://vkvideo.ru/video-224205661_456239143

66 0 2 1
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot