Хочу рассказать про небольшую идею как можно семантик айдисы и текст поженить в 1 пространство
Референс - GLIDE от спотифая
В чем цель
Хотят чтобы разговорная LLM моделька смогла начать понимать токены сидов с одном пространстве с токенами текстов.
Контекст
В пейпере ребята использую RQ KMEANS для нарезания сидсов по вектору айтема. Потом использовать llm-ку для рекомендаций треков. При этом в zero shot режиме подавать текст в LLM и менять инструкцию на ходу исходя из бизнес требований
Что сделали
Взяли простую идеяю за основу: а давайте модельки на вход дадим токены сидсов и будем генерировать описание /тайтл айтема. Сидсы инитятся новыми токенами в ллмке. И веса самой модели (кроме эмбедингов) - заморожены. И все.
Что думаю
Один мой товарищ на физтехе, который N лет занимается ллмками в Яндексе сказал, что если выбросить эмбеды из ллмки вообще и заморозить корпус и обучить NTP то веса быстро сойдутся. Поэтому очень верю в такой подход и для сидов тоже
Референс - GLIDE от спотифая
В чем цель
Хотят чтобы разговорная LLM моделька смогла начать понимать токены сидов с одном пространстве с токенами текстов.
Контекст
В пейпере ребята использую RQ KMEANS для нарезания сидсов по вектору айтема. Потом использовать llm-ку для рекомендаций треков. При этом в zero shot режиме подавать текст в LLM и менять инструкцию на ходу исходя из бизнес требований
Что сделали
Взяли простую идеяю за основу: а давайте модельки на вход дадим токены сидсов и будем генерировать описание /тайтл айтема. Сидсы инитятся новыми токенами в ллмке. И веса самой модели (кроме эмбедингов) - заморожены. И все.
Что думаю
Один мой товарищ на физтехе, который N лет занимается ллмками в Яндексе сказал, что если выбросить эмбеды из ллмки вообще и заморозить корпус и обучить NTP то веса быстро сойдутся. Поэтому очень верю в такой подход и для сидов тоже