Фильтр публикаций


Уже на этой неделе с 23 мая стартует Data Fest 2026! А 24 мая пройдёт секция ML in Advertising.

Делюсь анонсом докладов: все про внедренные решения в проде и прикладные подходы, которые можно применять не только в AdTech.

🔹«Реранкер в ритейле: как превратить рекламу в рекомендацию»
Как заменить фиксированные рекламные слоты умным ранжированием, которое подбирает рекламу под конкретного пользователя. Трансформер + градиентный бустинг, поддержка разных стратегий продвижения и результаты A/B.

🔹«Как устроено ранжирование рекламных объявлений в Авито»
Устройство предсказания CTR и ранжирования рекламы в Авито. Эмбеддинги пользователей и объявлений как признаки для двубашенной модели user-item — архитектура, обучение, результаты.

🔹«Мультимодальный суп: Превращение кучи рекламных баннеров в осмысленные кластеры»
Как из тысяч шумных рекламных баннеров автоматически собрать осмысленные кластеры-кампании с помощью дообученного CLIP, OCR и HDBSCAN.

Жду вас 24 мая в Loft Hall, зал Ratusha с 16 часов (ул. Ленинская Слобода, 26, стр. 15) 😉


Как кластеризовать миллионы объектов с высокой размерностью и сложной структурой данных?

Когда мы работаем с эмбеддингами (например, BERT4Rec), то сталкиваемся с тремя проблемами: миллионы объектов, высокая размерность и невыпуклые формы кластеров. При снижении размеренности мы теряем часть информации. Тут возникает дилемма: при снижении размерности мы неизбежно теряем часть информации. Если оставляем в исходном виде, то для большинства методов возникают проблемы с вычислительной сложностью и масштабируемостью.

О том, как мы повысили качество предсказания CTR за счет кластеризации миллионов товаров, я расскажу на конференции Data Fest 2026, на которой также буду модерировать секцию ML in Advertising.

Что обсудим:
🔹Какой метод выбрать, когда объектов миллионы, а кластеры имеют сложную форму
🔹Как мы внедрили это в предсказание CTR
🔹Кейсы за пределами рекламы: как вычислять сопокупки и строить кластерные рекомендации

Следующие посты будут анонсу выступлений других докладчиков нашей секции!

⏰ Когда: 24 мая с 11.00 и до вечера
📍Где: ул. Ленинская Слобода, 26, стр. 15 (Loft Hall, зал Ratusha)
📌 Регистрация

Подробнее о спикерах и докладах будет обновляться информация на странице мероприятия.


Репост из: ODS Events
Привет!

Вечер четверга — самое время вспомнить о том, что хотелось подать заявку на спикерство на Data Fest 2026 😊

📣 Стать спикером 📣

Ждём ваши темы в форме! Полный список секций доступен на странице подачи докладов (кстати, у нас добавились ML in Funtech, LeanAI, LLM Inference, ML in DBMS и ML in Rust) и они ждут своих героев 😎
⭐ Финальный дедлайн — 30 апреля, успевайте!


🙌 Стать участником 🙌

Первые регистрации участников на офлайн дни Феста уже открыты:
23 мая (сб): Data Fest 2026 в гостях у X5 Tech в Москве
24 мая (вс): Data Fest 2026 в гостях у Яндекса в Белграде
28 мая (чт): Data Fest 2026 в гостях у Школы 21 в Уфе
31 мая (вс): Data Fest 2026 в гостях у Яндекса в Москве

📍 Москва, Санкт - Петербург, Новосибирск, Алматы, Белград, Уфа + онлайн. Отправляйте свои анкеты и следите за обновлениями, впереди много интересного и анонсы других площадок 👍


Разбор докладов с конференции

И вот подошел к концу второй день конференции Data Fusion, на котором было множество различных секций, дискуссий и кейс-сессий. Я решила написать о парочке докладов, которые мне больше всего понравились.

➡️Первый доклад «Ключевые проблемы рекомендаций на последовательностях и варианты их решения». Посвящен проблемам в Sequential рекомендациях. В первой части рассматривалась проблема разделения данных: популярный leave-one-out допускает temporal leakage и формирует нереалистичный горизонт предсказания, что может негативно влиять на ранжирование и выводы о моделях. В качестве альтернативы предложен global temporal split с выбором целевых взаимодействий Last / Random / Successive - такие схемы лучше соответствуют задаче next-item prediction, уменьшают утечки и дают более стабильные результаты, хотя и сокращают число тестовых пользователей.

⭐️В целом, проблема LOO очень понятна, особенно для последовательных данных, и было интересно услышать об обоснованности сочетания GTS с разными способами выбора целевых взаимодействий.

➡️Во второй части освещена проблема Item Cold start: в sequential моделях новые объекты не имеют обученных эмбеддингов. Frozen content embeddings оказываются негибкими, а полный fine-tuning приводит к drift представлений и ухудшает cold-start. В качестве trade off использовался frozen content-based embedding + маленький обучаемый delta-вектор с ограниченной нормой, который позволяет модели аккуратно адаптироваться под взаимодействия, сохраняя семантику контентных признаков.

➡️Еще понравился доклад про победившее решение на соревновании Data Fusion «Страж» (задача классификации неподтвержденных операций клиентов банка). Построено чисто на нейронных сетях: данные формировались окнами (~3 месяца транзакций или 512 токенов), для каждого пользователя создавали 5–10 окон, чтобы покрыть повторяющиеся паттерны. Модель - стандартный Encoder трансформер: блок трансформера включал 2 ModernBERT (для глобальных паттернов) + 2 CNN (для локальных).

⭐️Думаю, что в ближайшем будущем многие табличные задачи будут решаться с помощью трансформеров, но при этом остается важной проблема инференса в продакшене (latency и ресурсы).

Посмотреть доклады с конференции можно уже на официальном сайте https://data-fusion.ru


Видео недоступно для предпросмотра
Смотреть в Telegram
Первый день на Data Fusion 2026

Сегодня, 8 апреля, я побывала на первом дне конференции Data Fusion 2026 в технологическом кластере «Ломоносов».

Data Fusion – крупнейшая экспертная конференция по работе с данными и технологиями ИИ. Здесь собираются те, кто создает наше технологическое будущее.

➡️На конференции было очень много докладов и обсуждений про AI-агентов — это стало популярной темой первого дня. Разбирали, как агенты меняют корпоративные системы, AgentOps, вопросы безопасности и внедрение в высоконагруженные продукты.

➡️Было интересно послушать мнения коллег из крупных компаний на дебатах «Да или нет вайб-кодингу?». Обсуждали, как такой подход незаметно вошел в повседневную работу, и как его используют в реальных проектах.

➡️Дополнительно хотела отметить сессию Explainable AI, где выступали коллеги из Китая и говорили о том, как делать модели искусственного интеллекта понятными и прозрачными для бизнеса и регуляторов.

Завтра, 9 апреля, продолжение программы: международный трек, дополнительные сессии по агентам, рекомендательным системам, AI в медицине и другим направлениям.

Смотрите в ролике мой небольшой обзор первого дня 😉

data-fusion.ru


Новости

Давно я тут ничего не писала, был небольшой перерыв. Для всех новеньких меня зовут Никулина Анастасия, я в ML и аналитике в совокупности уже больше 9 лет. В этом канале вы найдете кучу полезных статей тык. У меня есть свой ютуб канал про машинное обучение с аудиторией более 40 тыс человек тык.

А теперь к самому вкусному. Открылась регистрация на подачу докладов на Data Fest 2026. В этом году на конференции появятся новые интересные секции, одну из которых буду вести я 🥳

Записывайтесь, подавайте свои доклады, а лучше всего в секцию ML in Advertising, очень жду вас там! ❤️

Конференция пройдет с 23 по 31 мая в Москве, Питере и др. городах, подробнее тут

Зарегистрировать свой доклад можно здесь


Рады приветствовать всех новых участников!

Здесь мы обсуждаем машинное обучение: алгоритмы, новинки из мира ML, а также делимся реальным опытом, который редко можно встретить в учебниках. Кроме того, на канале появляются анонсы образовательных курсов, которые уже завершили более 2000 студентов.

➡️Что почитать?

➖Многорукие бандиты в музыкальных рекомендациях
➖Почему лосс не падает, и модель не обучается?
Оптимизируем размер памяти DataFrame в 3 раза
В каких случаях использовать деревья решений?
➖Ключевые научные работы по NLP
➖Что такое контрастирование обучение?
➖Полезные книги по ML


➡️Обучение Data Science для начинающих 3.0

Друзья, мы запустили новую версию курса по машинному обучению! Теперь вы можете проходить материалы в удобное для вас время и в собственном темпе — независимо от графика других студентов.

❗️Мы снизили стоимость курса, поскольку формат стал ориентированным на самообучение. Тем не менее, у вас будет доступ к чату студентов, где можно общаться, обмениваться мнениями и задавать вопросы другим студентам!

Что вы изучите:
➖Математику для Data Science
➖Как проводить АБ-тестирование
➖Классические ML-алгоритмы с полным разбором архитектуры и применения алгоритмов на практике: от линейных моделей до бустингов
➖NLP: от TF-IDF до LLM
➖Deep Learning: основные тренды, база по нейросетям
➖Computer Vision: примеры из области
➖MLOps: production code, FastAPI, Streamlit, линтеры
➖Дополнительно: Airflow, MLFlow, многопоточность, мультипроцессинг, временные ряды, Superset и пр.

В расширенном тарифе Grandmaster доступно 2 больших продвинутых блока:

➡️NLP — от базовой обработки текста (токенизация, лемматизация, regex и др.) до LLM. Научитесь дообучать модели с Hugging Face и применять их для анализа тональности, диалогов и кода (GraphCodeBERT, CodeT5 и др.)

➡️Рекомендательные системы — коллаборативная, контентная и гибридная фильтрация. Изучите ключевые алгоритмы (User/ItemKNN, ALS, NCF, SVD++), метрики (включая beyond accuracy) и продвинутые методы: нейросети, автоэнкодеры, графовые и контекстно-адаптивные рекомендации.

📎 Всю актуальную информацию можно найти на сайте PyMagic


➡️Обзор докладов по рекомендательным системам

Недавно завершилась ежегодная конференция Data Fusion. В этом году она особенно порадовала разнообразием секций, однако ключевое внимание было уделено теме данных — важнейшему компоненту любой модели, который, к сожалению, часто остаётся в тени.

Я решила попробовать новый формат и подготовила обзор на часть докладов из секции, посвящённой рекомендательным системам. На самом деле интересных выступлений было гораздо больше, и многие из них заслуживают отдельного внимания.

Что из этого получилось — смотрите в новом ролике! 😉

https://youtu.be/0S3e1iXR9Vs?si=eNxMR40cQ08n3pi9


Собираемся на Data Fusion! 🚀

16-17 апреля в Москве в кластере Ломоносов пройдет крупнейшая конференция Data Fusion по BigDate и AI. Программа конференции каждый год достаточно насыщенная, и этот год не исключение: в расписании как бизнес-, так и технические треки. В этом году будут выступления ведущих ученых, разбор кейсов ML в различных отраслях, дебаты «наука vs бизнес», а также узкопрофильные сессии по DataOps, CV, RAG и нейротехнологиям.

В прошлом году я лично была на площадке, мне конференция очень понравилась: организация, интересные доклады, сессии. А ещё была супер возможность поддержать коллегу, который рассказывал о рекомендательных системах в маркетплейсе 🌿

В этом году, к сожалению, не смогу присутствовать лично, поэтому буду следить за трансляцией. Но если у вас есть возможность прийти и послушать доклады вживую — очень рекомендую! Это отличный шанс пообщаться с коллегами, которых давно не видели, и задать спикерам вопросы напрямую.

Кстати, как вам идея выпустить новый ролик на ютубе с разбором докладов и статей из конференции с моими комментариями? В том числе как такие технологии работают на практике) Если ждешь, то ставь 🔥

Ссылка на регистрацию: https://data-fusion.reg.events/guest/?&erid=2VtzqvwUtXT


🚀 Подкаст Data Breakfast с Анастасией Никулиной. Часть вторая — Курсы в Data Science

🎙 О чём спросили?
▫️ Как создать курс, который меняет карьеру?
▫️ Платные vs бесплатные курсы: когда и зачем платить?
▫️ Почему YouTube-лекции — не всегда достаточно?
▫️ Как не стать «инфоцыганом» и заслужить доверие аудитории?
▫️ Pet-проекты: как превратить их в козырь для резюме?
▫️ Университет vs онлайн: что выбрать новичку?

🎧 Слушайте там, где удобно:
▫️ Telegram-плеер
▫️ Яндекс.Музыка
▫️ Страница выпуска

➡️ Первый выпуск можно посмотреть в группе ODS Piter, для этого необходимо добавиться туда и зайти на этот пост 😉


Репост из: RWB делает ML
#мнение_эксперта
В конце февраля DeepSeek устроили неделю опенсорса и 5 дней публиковали репозитории с кодом их проектов ⚙️

FlashMLA — механизм декодирования для больших языковых моделей.
DeepEP — коммуникационная библиотека, специально разработанная для MoE и EP.
DeepGEMM — библиотека для эффективных вычислений General Matrix Multiplications.
DualPipe — инновационный алгоритм двунаправленного конвейерного параллелизма.
Fire-Flyer File System (3FS) — высокопроизводительная распределенная файловая система.

Остальные подробности про каждый проект читайте на карточках!

———
Спасибо за разбор Павлу Дмитриеву, Machine Learning Engineer в CoreCV
🌟 @wb_space
📹 @wb_tech


В феврале нам удалось встретиться с Марком Паненко (Chief DS Ozon Fintech) в Москве и записать для вас целых две части подкаста Data Breakfast 🥰

В первой части мы обсудили тему личного бренда в Data Science: зачем и для кого он нужен, какие инструменты для этого существуют и многое другое.
За несколько лет на ютубе, большого количества разных экспериментов на разных площадках, анализа других специалистов, собственных успех и неудач, в том числе опыта с продвижением наших DS из WB, мне есть что рассказать!

Краткое саммери:
- Личный бренд, зачем строить, если ты не инфлюенсер?
- YouTube, блог или LinkedIn — где стартовать новичку?
- Как преодолеть страх критики и нехватку времени?
- Главный миф о личном бренде в DS. Spoiler: «Идеальность» — это иллюзия.
- Реальные кейсы из Wildberries: как экспертиза превращается в доверие.

Ссылка на сообщение в группе ODS Piter, где размещен подкаст. Присоединяйтесь и слушайте!

Ставьте ❤️ и мы выпустим 2ую часть подкаста, но уже на другую тему 😉

Инвайт в группу https://t.me/+R7S2T7UvxVoxYTdi


🔖ТОП-5 книг по ML

Мы на канале не раз разбирали книги по машинному обучению. Чтож, я предлагаю не останавливаться на этом и разобрать еще несколько интересных источников информации для вашего серого вещества 🧠

➡️Я оценивала книги по следующим критериям:
- Базовые знания
- Практические задание
- Глубина изложения
- Актуальность

Спойлер, данный перечень подойдет для начинающих, либо для специалистов с базой в мл (классические алгоритмы).

Честно говоря, найти прям крутые книги для опытных специалистов очень и очень тяжело, скорее это симбиоз из выступлений на конференциях, статей.

https://www.youtube.com/watch?v=ABIB9BNyYV0

Выше список из рассмотренных книг из видео ☝️


Полезные книги по машинному обучению 📚

1) Машинное обучение с PyTorch и Scikit-Learn, Себастьян Рашка
2) PyTorch. Освещая глубокое обучение, Лука Антига, Томас Виман, Эли Стивенс
3) Грокаем машинное обучение, Луис Серрано
4) Data Science. Наука о данных с нуля, Джоэл Грас
5)Аналитика и Data Science. Для не-аналитиков и даже 100% гуманитариев, Никита Сергеев


🚀💥 WOMEN IN DATA SCIENCE MEETUP: ТО, ЧТО ВЗОРВЁТ ВАШ 2025 ГОД! 💥🚀

Друзья, приготовьтесь: 7 марта в суперсовременном зале Sber на Уральской, 1 пройдёт событие, которое перевернёт ваше представление о Data Science! Это не просто митап — это билет в будущее, где женщины-гении данных диктуют правила игры. Вы точно не хотите это пропустить.

🔥 ПОЧЕМУ ЭТО БОМБА?

Легендарные спикеры:

Полина Федотова (Сбер) раскроет, как ИИ управляет роботами уже сегодня — да, это не фантастика!
Анна Текучева (Wildberries) научит ловить «модные словечки» в поиске так же ловко, как браконьеров-рыболовов 🎣 (да, она это делала!).
Анастасия Функнер, Ольга Павлова, Анна Ефимова (Ozon Банк) покажут, как создать ML-платформу будущего из симбиоза Golang, MLOps и магии.
Алена Феногенова (Sber) припасла сюрприз на стыке AGI и NLP — даже название доклада пока засекречено!

Круглый стол со звездами:

Нонна Шахова, Эмели Драль, Ирина Голощапова и Анастасия Никулина обсудят, как женщины меняют правила в DS — от старта в карьере до управления ML-революцией.

После партии науки — рок-н-ролл!

Ваши мозги перегреются? Отдохнём под «Rock Data Band» — они сыграют кавер-хиты (это нужно слышать!). Плюс активности, нетворкинг и море энергии.

🎯 ВЫ ПОПАДЁТЕ:
— В футуристический зал Sber.
— На доклады, которые даже на конференциях уровня AAA не всегда услышишь.
В сообщество тех, кто уже сегодня решает, куда повернёт AI.

📌 ДЕТАЛИ:

🗓 7 марта | ⏰ 15:30 сбор гостей, 16:00 старт
📍 Sber Hall (СПб, Уральская 1, лит. Ч)
🎟 Регистрация — места ограничены!

P.S. Спешите: скоро откроем названия ещё двух секретных докладов. Это будет жарко, как GPU при тренировке LLM!

#WiDS #ODS_SPB #WomenInTech #DataScienceIsFemale 💻👩🔬🎸

Вы готовы увидеть, на что способны женщины в Data Science? Тогда жмите на ссылку — пока места не кончились! 🔥


➡️ Обучение Data Science для начинающих

Уже 10 февраля у нас стартует 8-ой поток курса по Data Science.

Что вы изучите:
➖Математику для Data Science
➖Как проводить АБ-тестирование
➖Классические ML-алгоритмы: от линейных моделей до бустингов
➖Научитесь разбираться в ML-алгоритмах и грамотно их применять
➖NLP: от TF-IDF до Transformers
➖Deep Learning: основные тренды, база по нейросетям
➖Computer Vision: примеры из области
➖MLOps: production code, FastAPI, Streamlit, линтеры
➖Дополнительно: Airflow, MLFlow, многопоточность, мультипроцессинг, временные ряды, Superset и пр.

Также у нас есть расширенная версия курса с обучением почти на 1 год, дополнительно включающая:
➡️NLP: от базовой обработки текста (токенизация, лемматизация, регулярные выражения и пр.) до продвинутых моделей: Word2Vec, LSTM, Attention, Transformer (BERT, GPT). Научитесь дообучать модели с Hugging Face и применять их в задачах анализа тональности, диалогов и обработки кода (GraphCodeBERT, CodeT5)
➡️Рекомендательные системы: коллаборативная, контентная и гибридная фильтрация. Изучите алгоритмы (User/ItemKNN, ALS, NCF, SVD++), метрики валидации (классификационные, регрессионные, ранжирующие, beyond accuracy). Разберете продвинутые методы: двухуровневые модели, ранжирование, нейросетевые подходы, автоэнкодеры и графовые рекомендации. Особое внимание уделено последовательным и контекстно-адаптивным системам.

📎 Вся актуальная информация о кол-ве теоретического и практического материала, преподавателях, статстике трудоустройства выпускников на сайте PyMagic


➡️ Что такое контрастивное обучение?

Давайте сегодня немного разомнемся и попробуем разобрать новый материал! Не будем замыкаться в рамках классического машинного обучения, а пойдем чуть дальше. Сегодня разберем одну из важных и интересных тем, потому что этот метод набирает все больше оборотов и используется в совершенно разных задачах.

Контрастивное обучение (Contrastive Learning) — это метод самообучения (self-supervised learning), который позволяет моделям извлекать полезные представления из данных без явных меток. Основная идея заключается в том, чтобы научить модель различать похожие и непохожие объекты, используя функцию потерь, называемую Contrastive Loss.

➡️ Как работает контрастивное обучение?
Ф
ормируются пары:
- "положительные" — состоящие из похожих объектов, например аугментированных версий одного изображения, или объектов, которые были оценены пользователем высоко или с которыми он активно взаимодействовал в задачах рекомендаций.
- "отрицательные" — из различных объектов, например, изображений из разных классов, текстов с разным содержанием, или объектов, с которыми пользователь не взаимодействовал.

Модель обучается с использованием Contrastive Loss, минимизируя расстояние между эмбеддингами (представлениями) положительных пар и максимизируя расстояние между отрицательными.

➡️ В чем преимущество?
Не требует размеченных данных, что особенно полезно, когда метки отсутствуют или их недостаточно. Модель учится выделять важные признаки. Этот метод универсален и применим к разным типам данных: изображениям, тексту и аудио.

➡️ Примеры применения:
SimCLR - популярный фреймворк для контрастивного обучения для CV
MoCo (Momentum Contrast) - метод контрастивного обучения с моментумом (плавное обновление), улучшает качество представлений за счет стабильных негативных примеров
CLIP от OpenAI - модель, которая связывает текст и изображения с помощью контрастивного обучения, позволяя, например, искать изображения по текстовым запросам
- PTLS (pytorch-lifestream) - опенсорс библиотека, позволяющая строить эмбеддинги из событийных данных на основе метода контрастивного обучения CoLES

Помимо этого, контрастивное обучение можно применять и для обучения рекомендательных систем, например, в рамках подхода, основанного на контенте (Content-Based).


Репост из: RWB делает ML
#дайджест_wbs
Какие новости в мире DS удивили за прошедшие пару недель? Узнали у коллег👇

➡️ Релиз Deepseek-V3
Модель, содержащая 671 млрд параметров, демонстрирует возможности, сравнимые с проприетарными системами (GPT-4, Claude), но при этом остается открытой для сообщества.

Баланс инновационной архитектуры внимания и умной системы балансировки нагрузки позволяет модели работать быстрее и эффективнее предшественников.
Впечатляет способность модели предсказывать несколько токенов одновременно, что существенно ускоряет обработку информации.
Обучение модели экономично: было затрачено ~5.6 млн долларов, что значительно меньше, чем для аналогичных систем (за счет использования современных методов оптимизации и 8-битной точности вычислений).

DeepSeek-V3 в решении мат. задач и программировании превосходит другие открытые модели. Она отлично работает с китайским языком и может обрабатывать тексты до 128 тыс. токенов.

➡️ VLM с ризонингом от Qwen
QVQ-72B-Preview продолжает успех Qwen в области reasoning-моделей. Новая модель является VLM (в отличие от QwQ, которая работала только с текстом), достигает 70.3 баллов в тесте MMMU и превосходит большинство открытых моделей в математических и физических задачах (MathVista, MathVision, OlympiadBench).

Основными проблемами QVQ-72B являются неожиданное переключение между языками, склонность к излишне подробным ответам и потерю внимания к визуальному контенту при длительном анализе.

➡️ HuggingFace выпустили smolagents
Это компактные интеллектуальные агенты для решения сложных задач через взаимодействие ИИ с внешними инструментами. Агенты отличаются простотой, гибкостью и минимальными вычислительными затратами, идеально подходя для задач вроде обработки текстов, анализа данных и интеграции с API.

Smol Agents легко настраиваются, позволяют быстро прототипировать решения и экономить ресурсы. Открытый код делает их доступными для всех, от исследователей до разработчиков.

➿➿➿➿➿
Комментарии подготовили ML- и DS-специалисты Wildberries 💘

🌟 @wb_space
📹 @wb_tech


➡️Кстати, у нас в Wildberries теперь регулярно выходит не просто дайджест новостей из мира ML, но и экспертные комментарии наших коллег. Они делятся своим мнением о самых актуальных темах и делают содержательный анализ.

➡️Кроме того, мы активно расширяем нашу команду специалистов по Data Science, так как 2024 год завершился для нас крайне продуктивно, поэтому будем рады видеть вас в нашей команде 🏆

Показано 20 последних публикаций.

5 638

подписчиков
Статистика канала