TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
ML Underhood

3 Jul, 16:18

Открыть в Telegram Поделиться Пожаловаться

ICML стартует уже в понедельник!

Мы уже рассказывали о Spotlight-работе, которую наши исследователи представят на конференции в Сеуле. Сегодня расскажем о других, не менее крутых статьях.

GraphPFN: A Prior-Data Fitted Graph Foundation Model

Исследователи из Yandex Research Дмитрий Еремеев, Олег Платонов, Глеб Баженов, Артём Бабенко, Людмила Прохоренкова создали графовую foundation model, развивающую подход Prior-Data Fitted Networks (PFN). Она предварительно обучается на миллионах специально сгенерированных синтетических графов, а затем может эффективно решать задачи на реальных данных как в режиме in-context learning, так и после дообучения. На широком наборе реальных графовых датасетов GraphPFN обходит все остальные протестированные модели.

Unveiling the Role of Data Uncertainty in Tabular Deep Learning

Авторы из Yandex Research Николай Карташев, Иван Рубачёв и Артём Бабенко, исследуют, почему современные методы глубокого обучения показывают высокое качество в задачах на табличных данных. Многие успешные идеи последних лет — эмбеддинги числовых признаков, retrieval-augmented-архитектуры и продвинутое ансамблирование (TabM) — неявно повышают способность моделей работать с высокой неопределённостью в данных. Статья предлагает новый взгляд на недавний прогресс в DL на табличных данных, помогает понять, какие механизмы могут стоять за успехами современных табличных моделей, и задаёт направление для разработки новых методов.

Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls

Исследователи Яндекса — Кирилл Шевкунов и Людмила Прохоренкова — рассматривают задачу поиска наиболее релевантных объектов для заданного запроса.
Авторы предлагают способ строить эмбеддинги запросов и объектов с использованием информации от самой модели ранжирования. Подход учитывает релевантность запроса набору опорных объектов. Это позволяет получать более информативные представления и эффективнее находить кандидатов для дальнейшего ранжирования.

One-Step Gradient Delay Is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

Среди авторов статьи — исследователи Яндекса Филипп Змушко, Егор Петров, Нурсултан Абдуллаев и Михаил Хрущев. Работа выполнена в сотрудничестве с BRAIn Lab и MBZUAI.

В статье исследуется асинхронный pipeline parallelism для обучения больших языковых моделей. Такой подход позволяет повысить загрузку GPU, избавляясь от простоев видеокарт в пайплайне, однако долгое время считалось, что задержка градиентов ухудшает качество обучения. Авторы показывают, что проблема зависит не столько от факта самой задержки, сколько от типа используемого параллелизма, а также оптимизатора. В частности, Muon сохраняет значительную устойчивость в асинхронном режиме, а предложенная техника, основанная на Error-Feedback, дополнительно сокращает разрыв между синхронным и асинхронным обучением, позволяя обучать модели на масштабе 10B MoE без потери качества.

SoftSign: Smooth Sign in Your Optimizer for Better Parameter Heterogeneity Handling

Дмитрий Феоктистов из Yandex Research совместно с коллегами из BRAIn Lab предлагают новый подход к оптимизации нейронных сетей, основанный на сглаженной версии sign-обновлений. Он позволяет учитывать различия в поведении отдельных параметров модели и адаптировать величину обновлений во время обучения под них. На основе этой идеи разработали оптимизаторы SoftSignum и SoftMuon. Они стабильно превосходят классические sign-based-методы и AdamW на широком наборе задач.

О работах, которые представим на воркшопах, расскажем отдельно. И даже покажем, как это выглядело вживую.

#YaICML2026

ML Underhood

2.2k 9 19 3 37
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot