Postlar filtri




29 лайков - не ожидал :)

Расскажу еще пару инсайдов. Этот пр не очень большой по объему но мержился 2 недели


Я в телевизоре

Не секрет, что последние полгода занимаюсь задачами связанными с семантиками. Но перед самими семантиками нужно получить вектор айтема. И так получилось что лучше всего у нас зашла deepvk/USER-BGE-M3 моделька из hf. Решили катить ее в прод.

Наш прод сетап: тритон + обертка. Сами модели в onnx формате. И оказалось, что в onnx модели не работает FA (никакой вообще), если модель принимает на вход маску. Ну а у нас работа с текстом - без маски не куда. И когда катнули в прод - модель работала медленее торча из коробки. Пошли разбираться.

И в такой ситуации благодаря кодексу получилось законтребьютить фикс . Суть фикса простая - обработать случай с маской и передавать в вызов cudNN (либа для работы с нейронками на c++) . Onnx сделать поверх нее.


И вот на прошлой недели релизнули 1.29.0 с этим фиксом. Это мой первый опенсорс контрибьют и он не был очень сложным.

Также в либы есть соглашение , где надо поставить галочку что кодом можно пользоваться, при этом права на код остаются за разработчиком. Для контраста, код который пишется в компании, как будто самому разрабу не принадлежит, а тут есть ощущение, что свой кусочек полетит скоро ко всем на серваки :)


Camila Alibaeva dan repost
Всем привет) меня зовут Камила, и я тоже приглашаю в свою DS команду в Авито

🔎 Data Scientist в команду поиска Авито
Москва / гибрид / возможна удалёнка или офисы Авито в РФ и Армении
Уровень: крепкий Middle+ / Senior
💰 Middle: 300–450 000 ₽/мес на руки
💰 Senior: 450–550 000+ ₽/мес на руки

Ищу DSа в поиск — туда, где ML напрямую влияет на то, что человек увидит после запроса, насколько быстро найдёт нужное и вернётся ли потом ещё раз.
Ты подходишь нам, если тебя драйвит не только момент ресерча, а продукт и то, как ты сам на него влияешь, потому что наша команда находится в самом сердце поиска — L1, и мы напрямую определяем, какие айтемы попадут на выдачу по конкретному запросу

🧑‍💻 Что за задачи
Улучшать векторный поиск на L1-стадии. Нужно учить эмбеддинги запросов и объявлений, чтобы поиск быстрее и точнее доставал релевантные айтемы из огромного объёма данных (более 200кк активных айтемов в индексе).

Что предстоит делать:
— обучать модели эмбеддингов для запросов и айтемов (в тч multimodal)
— экспериментировать с архитектурами и адаптировать SOTA под реальные задачи Авито
— развивать пайплайны для быстрого тестирования моделей векторного поиска
— генерить продуктовые гипотезы и проверять их
— самостоятельно запускать и разбирать A/B-тесты
— ставить задачи бэкенду по интеграции и инфраструктуре
— плотно работать с аналитиками и инженерами

✅ Что важно уметь
— опыт в Deep Learning
— уверенный Python
— умение работать с параллельными и распределёнными вычислениями
— базовая продуктовая и статистическая аналитика
— самостоятельный дизайн и анализ A/B-тестов
— навык формулировать гипотезу и доводить её до измеримого результата
— опыт в поиске / рекомендациях будет плюсом

🚀 Почему может быть интересно
— огромный масштаб: поиск Авито — это десятки миллионов пользователей и сотни миллионов объявлений
— прямое влияние на продукт
— любая сота, лишь бы прод держал (у нас уже есть rt VLM)
— никакой работы в стол
— сильная DS культура
— мощное железо для экспериментов
— бюджет на обучение и конфы
— ДМС со стоматологией с первого дня
— можно работать удалённо или из офисов Авито (в России и Ереване)

📩 Как откликнуться
Пишите в Telegram: @camalibi
В сообщении можно сразу кинуть:
— резюме / LinkedIn
— пару строк про опыт в DL, поиске, рекомендациях
— GitHub / Kaggle / статьи / проекты, если есть что показать
Отсмотрю сама и передам дальше, если метчимся

625 0 17 1 16

Мне за это не платят, хочу порекомендовать хорошую команду


Ну и самое главное - llama лучше qwen. @anton39reg


также сравнили разные претрейны которые энкодят семантики. Самым эффективным оказался простой классификатор. По префиксу предсказывает следующий токен


А вот как выглялила архитектура для хешинга префиксов сидсов перед падачей в ллмку


Вот как выглядили кривые обучения. Красная это хешинг + претрейн


Ну и раз пошла такая пьянка вот еще статья, которая использует 2 перспективных подхода сразу - https://arxiv.org/pdf/2606.00324
Пейпер от пинтереста

В чем суть?
Также хотим LLM научить понимать сиды . Один из челленжей, что [5, 1] и [6, 1] - префиксы семантиков имеют разный смысл для 1 , которая на 2-ом месте.

Что делают?
Применяют префикс-хеш трюк из метовской статьи - https://arxiv.org/abs/2504.02137 . То есть берем hash([5, 1])/ T - где T размер хэш таблицы. Таким образом можно менять количество эмбедингов, которые кодируют семантики - больше параметров в саму модельку, и помочь начать различать префиксы на уровне обучения.

И вторая идея наследуют вайб прошлого поста: учат дополнительный энкодер по семантикам предсказывать тексты. Это позволяет сразу в модельку зашить информацию про токены семантиков.

Саму модельку учат на последовательностях (text, sisds, text1, sids1) предсказывать NTP. (ниже картинка какие еще есть).

Результат
Пробовали дополнительный энкодер предобучать перед тем как подавать в основную задачу и это вырастило метрику. Также префикс хешинг дал аплифт. В качестве бейзлайна взяли ванила LLM на NTP шечку.

В Итоге притрейн дал качество как и хешинг причем кратный


В тут вторая строчка показывает какой аплифт дает приземление текстов и сидов в 1 пространство


Вот кстати такой промт подают в LLM-ку


Хочу рассказать про небольшую идею как можно семантик айдисы и текст поженить в 1 пространство
Референс - GLIDE от спотифая

В чем цель
Хотят чтобы разговорная LLM моделька смогла начать понимать токены сидов с одном пространстве с токенами текстов.

Контекст
В пейпере ребята использую RQ KMEANS для нарезания сидсов по вектору айтема. Потом использовать llm-ку для рекомендаций треков. При этом в zero shot режиме подавать текст в LLM и менять инструкцию на ходу исходя из бизнес требований

Что сделали
Взяли простую идеяю за основу: а давайте модельки на вход дадим токены сидсов и будем генерировать описание /тайтл айтема. Сидсы инитятся новыми токенами в ллмке. И веса самой модели (кроме эмбедингов) - заморожены. И все.


Что думаю
Один мой товарищ на физтехе, который N лет занимается ллмками в Яндексе сказал, что если выбросить эмбеды из ллмки вообще и заморозить корпус и обучить NTP то веса быстро сойдутся. Поэтому очень верю в такой подход и для сидов тоже


🚀 Data Scientist (Recommendation Systems) в Авито
Middle / Senior / Senior+ | Полная удалёнка / офисы (Мск, СПб, Минск)
💰 Middle: 250–400 000 ₽/мес на руки
💰 Senior/Senior+: 400–550 000+ ₽/мес на руки

🧠 Кого ищем
DS, которые не боятся production и хотят внедрять SOTA в персонализацию главной страницы Авито

У нас полный цикл: от чтения статьи до ONNX и A/B-теста на десятках миллионах пользователей.

🔥 Чем предстоит заниматься

🔹 Generative Recommendation
– Semantic ID, end‑to‑end генеративные модели (❤️OneRec, TIGER).
– Масштабирование на multi-GPU/multi-node (кластер H100)
– Построение семантик (Semantic ID) с помощью RQ-VAE / RQ-KMEANS
– Multimodal энкодеры (текст + изображения)
– Файнтюнинг


🔹 Production DL
– ONNX, TorchScript, Triton
– Доставка семантических ID и векторных эмбеддингов (Redis + Sphinx + ANN)

🔹 Аналитика и итерации
– A/B-тесты, продуктовые метрики
– Умение признать проигрыш, закатать рукава и растащить прод

✅ Что нужно уметь

✔️ PyTorch / Lightning
✔️ Обучали трансформеры, Seq2Seq, двухбашенки в проде
✔️ Работа с большими данными
✔️ Читаете статьи (KDD, RecSys) и реплицируете идеи в код

Middle: самостоятельная реализация подзадач, помощь в исследованиях, написание production‑кода.
Senior / Senior+: архитектурные решения, лидирование направлений (OneRec / Multimodal / файнтюнинг), менторство, R&D.

🍀 Будет плюсом
– Опыт в рекомендательных системах (особенно OneRec/GR)
– Зелёные А/Б (и красные — тоже опыт)
– Open Source contributions
- Участие в соревнованиях

🚀 Почему у нас кайф

⚡️ HPC-кластер с H100 — обучайте большие модели
⚡️ Полный Research‑to‑Production — мы сами режем ONNX, поднимаем инференс
⚡️ Прямое влияние — каждый процент качества видят миллионы
⚡️ Сильная команда — бывшие исследователи и лиды, внутренние митапы, бюджет на конференции
⚡️ Готовы запускать самые смелые гипотезы - пару раз положили Авито :harold:


🛋 Условия

✅ Удалёнка из любой точки мира или офис (Москва, Самара, Санкт-Питербург)
✅ ДМС со стоматологией с первого дня
✅ Современная техника (Mac/PC)
✅ Оплата конференций, книг, английского

📩 Как откликнуться

Пиши сразу в Telegram: @tolkkk1
В сообщении:
— ссылка на резюме / LinkedIn
— пара слов о твоём опыте в DL / RecSys
— GitHub / Kaggle (если есть)

Никаких HR-фильтров — читаю лично


Всем привет!
Вакансия в мою команду


Всем привет!
Хочу поделиться запуском соревы - https://ods.ai/competitions/avitotechmlcup2026

Так как времени не так много, а соревы я люблю то нашел такое хобби:
запускать соревы самому

В этот раз вложились гораздо больше чем год назад (задача про ноды):
1) Большой относительно рекомендаций объем данных - в 20 раз больше с прошлым годом
2) Более продуманная метрика - есть баланс по вертикалям + геп. В прошлый раз был весьма обрезанный датасет
3) Гораздо ближе к текущему проду чем в прошлом году - завязываемся на item_id, а не на ноды

Залетайте в соревку и делитесь инсайдами :)
PS это сорева сделана полностью на добровольных началах из за любви к ds. Ну почти - мне еще дадут мерчь :)


На Тему семантиков айдисов

Глобально есть 3 основных этапа:
1) Подготовка вектора айтемов
2) Подготовка самих семантиков
3) какой нить декодер поверх семантиков

Хочу поделится 2-мя неочевидными на мой взгляд лайфхаками из статей, в которые я верю (но не проверил полностью)

Номер раз - не 1, а N векторов айетмов
В статье OneRec ребята используют Qformer для формирования вектора айтма.
Коротко - на основе контентна айтема готовят сразу 4 вектора для 1 айтема.
И потом применяют kmeans алгоритм сразу к 4 этим векторам


Номер два - использовать LLM для формирования позитивных пар.
Идея простая - давайте возьмем пары айтемов из истории пользователя, которые идут друг за другом.
Тут возникает проблема - что это не всегда что-то осознанное. В статье QARM-2 исследователи используют LLM - Qwen3 0.6B для разметки пар. Подают тайтлы и параметры объявлений из истории пользователя и спрашивают LLM: а есть ли какая то связь?
По результатом репорт - удалось выкинуть 70% нерелевантных пар

Почему верю в оба подхода?
1 вектор айтема может быть сильно беден и отражать только 1 явный сигнал. Для i2i задачи это может быть и не плохо, но в семантиках надо информацию разложить в иерархию, лучше иметь максимально широкое представление про айтем

Разметка LLM уже отлично зашла в нашей другой задаче. Даже небольшая LLM может повысить качество дефолтного датасета. Не ошибка - прогнать свой датасет через LLM и попросить улучшить . Это повысело качество финальной модели


Wazowski Recommends dan repost
Вместо итогов года, хочу поделиться моим списком лучших — самых значимых или просто понравившихся — статей, которые я прочитал за последние два года (про 2024 раньше не писал). В порядке прочтения.

Unified Embedding
Статья DeepMind о том, что можно использовать одну универснальную таблицу эмбеддингов для многих sparse фичей. Полезная практическая статья.
Обзоры в Рекомендательной и у Дани.

Actions Speak Louder than Words
Громкая статья от Meta. Первая показала, что можно обучать огромные модели для рекомендаций. Ввела HSTU и новое представление истории. Лично для меня это был первый намёк на то, что когда-нибудь мы сможем отказаться от всех ручных фичей.
Обзоры в Рекомендательной и у Даши.

Revisiting Neural Retrieval on Accelerators
Meta показала, что retrieval можно делать на GPU без индекса. Также вводят для второй стадии модель mixture-of-logits (MoL), которая является более выразительной, но всё ещё относительно дешевой в вычислениях функцией. Для меня это была первая статья, показавшая, что retrieval можно делать лучше, чем всем привычным HNSW. И я сам потом работал над этим подходом. Обзоры у меня и у Саши.
А в последующей статье показали, что можно всё-таки и с индексами и без GPU напрямую искать топ по MoL. Обзор в Рекомендательной.

Серия Semantic IDs от DeepMind
- Generative Retrieval (обзоры у Саши и в Рекомендательной)
- Better Generalization (обзор у Дани)
- PLUM (обзоры у Кирилла и в Рекомендательной)
Номер 1 по значимости, самый существенный сдвиг парадигмы последнего времени. Токенизатор рекомендательного мира, представляющий контентную информацию об объектах в виде кодов из конечного словаря, полученного из иерархической кластеризации (RQ-VAE). Использование этой токенизации для нового метода retrieval, для более эффективных эмбеддингов в ранжировании и для связи с LLM. Уже повлияло на всю индустрию. Must read.

Streaming Vector Quantization Retriever
Одна вещь, которая меня больше всего смущала в Semantic IDs, — что RQ-VAE обучается отдельно, не end-to-end совместно с рекомендательной задачей. В этой статье ByteDance как раз исправили это. Правда, тут не иерархический RQ-VAE, а одноуровневый VQ-VAE. Зато real-time.
Обзор в Рекомендательной.

Stop Regressing
Единственная статья не про рекомендации, хотя и в рекомендациях тоже может быть полезной. DeepMind о том, как в задачах регресии (на примере value function в RL) моделирование распределения таргета (вместо точечной оценки) с помощью Histogram Loss улучшает масштабируемость. Про сам Histogram Loss можно прочитать и в оригинальной статье. Для меня это теперь достаточно близкая тема.
Про статью я узнал из выступления Дмитрия Бабаева на ICML Recap (а также в ML Underhood).

Серия OneRec от Kuaishou
- OneRec
- OneRec Technical Report
- OneRec-V2 Technical Report
- OneRec-Think
(и ещё какое-то количество статей, но я, признаюсь, даже последние две ещё только собираюсь прочитать)
Не называю это номером 1 по значимости только лишь потому, что оно во многом является продолжением Semantic IDs. Но всё же доводит их до того, что многие уже называют революцией — первая индустриальная end-to-end рекомендательная система, без нескольких стадий ранжирования. Вот примерно так будут выглядеть системы нового поколения. Must read.
Обзоры у Саши, в Рекомендательной и у Коли (1, 2, 3).

Correcting the LogQ Correction
Приз моей личной симпатии, потому что
1) улучшили знаменитую технику Гугла LogQ-коррекции,
2) я сам какое-то время думал на эту тему,
3) я рад за Кирилла и команду 😉
Обзор у автора.


На этом всё. Надеюсь, это будет кому-нибудь полезно. Мне самому было бы очень полезно, если бы авторы дружественных каналов позаимствовали такой формат! (только не «лучшие посты года»...)


Слишком хорошо, чтобы потерять


Че то подросло

20 ta oxirgi post ko‘rsatilgan.