Фильтр публикаций


Обзор движков для инференса LLM

LLM-движок размещает веса и KV cache, собирает запросы в батчи, выбирает ядра и держит SLO по TTFT и TPOT. Выход длиной T токенов требует T последовательных decode-итераций, поэтому на каждом шаге движок решает, кого обработать следующим.

TensorRT-LLM
, LMDeploy, vLLM, SGLang и llama.cpp решают задачу с разными приоритетами. Как это происходит, рассказываем в карточках.

#aivkhub #llm #обзор

415 0 17 3 11

Видео недоступно для предпросмотра
Смотреть в Telegram
Репортаж с KDD 2026 ⬆️

На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.

Что обсуждали на KDD, какие тренды появились и как прошла презентация работ команды, рассказывает старший исследователь AI VK Research Артём Матвеев 🎬


Подробнее об исследованиях

➡️ Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction
🟣Обзор статьи

➡️ Planning over Matrix-Factorization MDPs for Candidate Generation
🟣 Обзор статьи

#aivkhub #конференция #kdd #recsys #репортаж


Expressiveness-Efficiency Trade-off: длина кода SID против стоимости генерации

В авторегрессивных декодерах каждый дополнительный токен Semantic ID (SID) требует отдельного шага генерации. Чем длиннее код, тем точнее он различает айтемы, но и тем выше задержка. Это третья из фундаментальных проблем генеративных рекомендаций.

Часть 1
Часть 2
Часть 3

Стороны компромисса

Кодовое пространство SID содержит K ** L кодов, где K — размер кодбука, а L — число уровней. Длинные SID уменьшают коллизии и лучше различают тонкие атрибуты, позволяя эффективнее использовать сильные энкодеры. В экспериментах RPG увеличение длины с 4 до 16–64 токенов примерно удвоило NDCG@10.

С другой стороны, так как декодер генерирует SID токен за токеном, то число прямых проходов пропорционально произведению ширины beam на длину SID. Например, TIGER ограничивается 4 уровнями с кодбуком 256, и при длине SID 32 и более beam search становится неприемлемым. Короткие SID порождают обратную проблему: рост коллизий и усложнение разрешения айтема.

Проблема в архитектуре, а не в длине

Ключевой вывод: компромисс верен для TIGER-подобных архитектур, но не фундаментален. Его причина в последовательной зависимости residual quantization и авторегрессивного декодирования.

RQ квантует остатки последовательно: каждый токен уточняет предыдущий, создавая иерархию от грубых категорий к тонким атрибутам, но требуя L шагов декодера. Авторегрессивный декодер усиливает это ограничение: каждый шаг зависит от предыдущего, ошибки накапливаются, а beam search умножает стоимость на ширину поиска.

Подходы к решению проблемы

1️⃣Параллельная генерация длинных SID

RPG заменяет residual quantization на Optimized Product Quantization: токены независимы, так как каждый кодирует ортогональное подпространство эмбеддинга. Модель предсказывает все токены одновременно через multi-token prediction.

Поиск валидных SID ведётся через граф семантически близких кодов, сложность которого не зависит от числа айтемов. Это позволяет использовать SID длиной до 64 токенов без пропорционального роста задержки.

2️⃣Адаптивное сжатие длинного кода

Например, ACERec сохраняет длинный 32-токенный SID, но до подачи в последовательную модель сжимает его через cross-attention в малое число латентных токенов. Декодер работает на компактном представлении, а скоринг сводится к параллельному вычислению логитов по кодбукам и суммированию для каждого айтема.

Таким образом, стоимость определяется числом латентных токенов, а не длиной SID.

3️⃣Кластерные SID в гибридном пайплайне

Промышленные системы отходят от требования «один айтем, один SID». GLIDE использует 4-уровневый SID с кодбуком 256, а коллизии внутри групп разрешаются выбором популярнейшего эпизода.

CQ-SID трактует SID как cluster ID: трёхуровневый кластерный код с крупными кодбуками позволяет сократить beam вдвое при том же качестве. Генеративный канал работает как источник кандидатов, а финальный ранкер обеспечивает точную идентичность.

4️⃣Коллизии как часть дизайна

Google в задаче ранжирования видео показал, что семантические коллизии полезнее случайных: близкие айтемы делят статистическую силу, что улучшает обобщение и холодный старт. Но для доменов, где точная идентичность важнее семантической близости, разрешение коллизий на основе популярности может систематически вытеснять длинный хвост.

Итог

Компромисс выразительности и эффективности снимается переходом к параллельной или гибридной генерации. Оптимум определяется не длиной SID, а совместным выбором кодбука, декодера, ограничением поиска и слоя разрешения.

#aivkhub #genrecsys #recsys


Weak Semantic Reasoning: проблема понимания Semantic ID

Даже согласованный токенизатор не отвечает на главный вопрос: понимает ли LLM структуру каталога или просто запоминает популярные переходы? Это вторая из трёх фундаментальных проблем генеративных рекомендаций: разрыв между заложенным в Semantic ID (SID) смыслом и тем, что модель фактически выучила.

➡️ Часть 1
➡️ Часть 2

Рассуждения в стиле «LLM не видела SID на претрейне» логически ошибочны. Отсутствие кода в обучающих данных не исключает, что модель выучит его роль после адаптации. Эксперименты с произвольными символьными метками подтверждают: трансформер осваивает искусственные знаковые системы при достаточном объёме адаптационных данных.

Четыре рассогласованных пространства

SID создают 4 потенциально несовместимых геометрии:

🟣Item geometry: непрерывные эмбеддинги айтемов
🟣SID geometry: дискретные кодовые последовательности
🟣LLM representation: скрытые состояния и эмбеддинги токенов внутри модели
🟣Autoregressive likelihood: условные вероятности последующих токенов

Нет причин ожидать, что эти пространства изоморфны

Общий префикс в SID может отражать устройство токенизации, а не понятие, которое модель интерпретирует как категорию. Так, иерархия RQ-VAE остаётся свойством кодировщика: первый код грубо приближает эмбеддинг, последующие корректируют остатки. Каузальное внимание не знает, что первая позиция соответствует родительскому кластеру, а четвёртая — листовому узлу: позиционные эмбеддинги кодируют порядок, но не роль в онтологии.

Три уровня понимания

🟣Token recognition: модель генерирует и валидно декодирует SID
🟣Structural understanding: модель использует префикс как иерархию
🟣Semantic reasoning: модель выводит корректные отношения для незнакомых комбинаций атрибутов и доменов

Рост метрик ранжирования после SID-aware обучения не доказывает структурного понимания. Если большинство пользователей после айтема A выбирают B, модель предсказывает SID(B) без знания о том, что A и B из одной категории. Recall@K и NDCG не различают зазубривание, интерполяцию и рассуждение.

Три направления решения

1️⃣ Совместная оптимизация токенизатора и рекомендателя. Например, DIGER делает квантование дифференцируемым через Gumbel exploration: градиент от рекомендательного лосса пробрасывается в токенизатор, и кодбук корректируется под итоговую задачу

2️⃣ SID-языковое выравнивание. Так, SIDReasoner строит двунаправленную связь между кодами и естественным языком, переводя SID в заголовок и обратно, а PLUM расширяет словарь SID-токенами и проводит continued pre-training на доменных данных до fine-tuning

3️⃣ Семантико-коллаборативное выравнивание. Например, DAS объединяет квантование контентных признаков с коллаборативным сигналом, очищенным от популярностного смещения. Такой подход особенно полезен в сценариях холодного старта, где контентные признаки покрывают новые айтемы, а коллаборативные фильтруют поведенческий шум.

Методологический пробел

Бенчмарка для оценки рассуждения над SID не существует. Для проверки нужны:

🟣Prefix intervention: заменить префикс, сохранив суффикс, и измерить эффект
🟣Random-SID control: переставить SID между айтемами, сохранив частоты
🟣Held-out composition split: исключить комбинации пар атрибутов и проверить обобщение
🟣Faithfulness test: изменить промежуточный reasoning trace и проверить, меняется ли рекомендация

Без этих тестов улучшение NDCG остаётся инженерным результатом, но не доказательством семантического рассуждения.

#aivkhub #genrecsys #recsys


📢 Исследователи AI VK Research научили двухбашенный трансформер над историей оптимизировать удовлетворённость пользователя за всю сессию. Работа принята на воркшоп конференции KDD 2026, которая проходит сейчас в Южной Корее.

Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.

На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.

➡️ Подробнее в статье на Хабре.

#aivkhub #ml #recsys


Продолжаем разбирать, как работают генеративные рекомендательные системы и какие задачи в этом направлении сейчас решают ведущие AI-команды мира.

➡️ Здесь начало статьи.

Tokenizer Dissociation: разрыв оптимизации

Токенизатор обучается отдельно от рекомендательной модели. После заморозки кодбука Semantic ID градиенты целевой задачи перестают поступать в токенизатор. Это первая из трёх фундаментальных проблем генеративных рекомендаций, обозначенных в прошлом посте.

Стандартный пайплайн

Из контентных и коллаборативных признаков энкодер строит непрерывные эмбеддинги айтемов, далее их превращают в дискретные Semantic ID через иерархическую кластеризацию или векторное квантование. Получившийся кодбук замораживается, рекомендательная модель учится на фиксированных токенах: предсказывает следующий Semantic ID или сразу ранжированный список Semantic ID. На инференсе сгенерированные токены сопоставляются с айтемами через кодбук.

Где возникает разрыв

Токенизатор оптимизирует компактность кодового пространства, а рекомендательная модель минимизирует проксирующий лосс для Recall@K и NDCG. После заморозки кодбук изолируется от градиентов рекомендательной функции потерь.

Дрейф и деградация

Токенизатор группирует айтемы на основе близости их исходных эмбеддингов, стремясь минимизировать ошибку квантования кодового пространства. Рекомендательная же модель перестраивает это пространство под задачу ранжирования. Эти две геометрии неизбежно расходятся, так как компактное представление кодов конфликтует с оптимальным ранжированием.

В процессе обучения модель удаляется от исходного распределения и статическая дискретизация теряет свою дискриминативную силу, переставая быть оптимальной для финальной задачи ранжирования.

Из-за недифференцируемости операции дискретного выбора градиенты не могут пройти сквозь слой квантования и модель теряет способность корректировать границы токенов. В результате система не может адаптироваться к новым айтемам или изменившимся поведенческим паттернам.

Направления решений

1️⃣ ETEGRec (SIGIR 2025) объединяет токенизатор и рекомендатель в единую архитектуру. Градиенты от ранжирующего лосса проходят в токенизатор через sequence-item alignment и preference-semantic alignment. Попеременная EM-like оптимизация стабилизирует совместное обучение. Это самый прямой подход к проблеме, но и самый сложный в стабилизации

2️⃣ OneRec (2025) подмешивает коллаборативный сигнал к контентным признакам ещё до квантования, формируя Semantic ID на основе совместных просмотров товаров пользователями. PLUM (2025) развивает эту логику, внедряя многоэтапную схему с непрерывным предобучением на логах взаимодействий. COSETTE (2025) насыщает токенизатор сигналом непосредственно на этапе построения, заставляя токены одновременно реконструировать контент и максимизировать релевантность для рекомендации через контрастивную цель. Во всех случаях двухэтапный пайплайн сохраняется, но кодбук перестаёт быть слепым к задаче ранжирования

3️⃣ DAS (CIKM 2025) объединяет квантование и выравнивание в единый сквозной этап обучения. Contrastive alignment и dual learning синхронизируют квантованные представления пользователей и айтемов

4️⃣ Инженеры AI VK под руководством Владимира Байкалова совместно с ИТМО решали смежную задачу: пересчёт Semantic ID на свежих логах ломает совместимость с уже обученным ретривером. Предложенный метод выравнивает новые токены под старое пространство через биективный матчинг, после чего ретривер дообучается без полного переобучения


Полностью совместная, стабильная при масштабе обучающая процедура пока не разработана. Продакшен-системы сохраняют гибридный дизайн: замороженный кодбук с alignment-слоями.

#aivkhub #genrecsys #recsys


📢 Инженеры AI VK запустили единую ИИ-модель для анализа всех типов взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека.

Нейропрофиль решает главную проблему больших экосистем — изоляцию данных между разными сервисами. Вместо того, чтобы копить историю пользователя по кусочкам, трансформер объединяет все его действия в один поток.

Что это дало:

🟣Связь между разными форматами контента
🟣Масштабирование для новых продуктов
🟣Реальный буст на проде

Подробнее в статье на Хабре.

#aivkhub #discovery #recsys


Легковесная full-band модель для шумоподавления и дереверберации

Большинство моделей speech enhancement решают только шумоподавление и работают с аудио 16 кГц. Исследователи НИУ ВШЭ и VK адаптировали архитектуру FSPEN для одновременного шумоподавления и дереверберации full-band аудио (48 кГц) — 95 тыс. параметров, RTF 0.11, качество шумоподавления на уровне ground truth.

В карточках кратко разбираем, что изменили в архитектуре, на каких данных обучали модель и каких результатов добились. Подробную статью читайте на Хабре.

#aivkhub #ml #звук


🟣Alibaba: 3 релиза за 2 недели

3 августа компания анонсировала флагманскую Qwen3.8-Max, MoE на 2.4 трлн параметров (~95 млрд активных), контекст 1M токенов, модель позиционируют как «вторую после Fable 5». 27 июля тихо, без техотчёта и бенчмарков, вышла бюджетная vision-language Qwen3.7 Flash ($ 0,03 — $ 0,13 за 1M токенов, контекст 1M). 21 июля представили Qwen-Image-3.0, генерация изображений с промптом до 4 500 токенов и рендером текста от 10px, но впервые в линейке без открытых весов, бенчмарков и техотчёта.

🟣DeepSeek: Flash выходит из preview

31 июля DeepSeek перевёл DeepSeek-V4-Flash из preview в стабильную версию (билд 0731), архитектура не менялась, пересобран только пост-трейнинг — заметный рост на агентных бенчмарках (Terminal-Bench 2.1: 82.7, DeepSWE: 54.4), нативная поддержка Responses API и Codex. Цены и название в API прежние.

🟣Thinking Machines Lab: младшая модель обгоняет старшую

30 июля Thinking Machines Lab выпустила Inkling-Small — открытую MoE на 276B параметров (12B активных), которая по эффективности и части reasoning/agentic бенчмарков обгоняет старшую Inkling (975B/41B, релиз 15 июля). Обе модели доступны на Hugging Face.

🟣Agnes AI: бюджетный reasoning с сильным кодингом

24 июля сингапурская Agnes AI представила Agnes 2.5 Pro Alpha — бюджетную reasoning-модель (39 баллов по Artificial Analysis Intelligence Index, контекст 1M, $ 0,45 — $ 0,90 за 1M токенов) с неожиданно сильным coding-скором (58,8) при скромном расходе токенов на рассуждения.

🟣Anthropic: Opus 5 приближается к Fable 5

24 июля Anthropic выпустила Claude Opus 5 — по цене и скорости на уровне Opus 4.8, но по интеллектуальным бенчмаркам (Frontier-Bench, ARC-AGI 3, OSWorld 2.0) приближается к Fable 5, по внутренним оценкам — самая согласованная (aligned) модель компании на сегодня.

🟣Black Forest Labs: единая модель для видео, изображений и звука

23 июля Black Forest Labs анонсировала FLUX 3 (Early Access) — мультимодальную flow-модель, обучаемую совместно на видео, изображениях и аудио в единой архитектуре. Поддерживает генерацию видео с нативным звуком до 20 секунд и первые эксперименты с action-prediction для робототехники.

🟣Google: три Gemini для агентных сценариев

21 июля Google выпустила три модели линейки Gemini: 3.6 Flash (на 17% эффективнее по токенам, чем 3.5 Flash, $ 1,50 — $ 7,50 за 1M), сверхбыстрый 3.5 Flash-Lite (350 ток/с, $ 0,3 — $ 2,5) и специализированный 3.5 Flash Cyber для поиска и патчинга уязвимостей в связке с автономным агентом CodeMender, доступ ограничен госорганизациями и партнёрами.

🟣Poolside: компактная модель против гигантов

21 июля Poolside выпустила Laguna S 2.1 — компактную MoE (118B/8B активных), обученную менее чем за 9 недель, которая на Terminal-Bench 2.1 (70,2) и других long-horizon coding-бенчмарках конкурирует с моделями на порядок крупнее. Веса открыты на Hugging Face.

🟣Moonshot AI: первая открытая модель класса 3T

16 июля Moonshot AI представила Kimi K3 — первую открытую модель класса 3T (2,8 трлн параметров) на архитектуре Kimi Delta Attention, с нативным зрением и контекстом 1M токенов. По собственным данным компании, модель уступает только Claude Fable 5 и GPT-5.6 Sol.

Новые статьи от AI VK на Хабре

🟣Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ

🟣Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри

🟣LLM и психолингвистика: HELPER

🟣Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

#aivkhub #дайджест


Наш коллега, ведущий исследователь AI VK Research Владимир Байкалов, вернулся из Мельбурна с конференции SIGIR 2026 и подготовил обзор интересных работ, по которым виден главный тренд 2026 года: генеративные end-to-end модели не отменили каскадные пайплайны, а нашли своё место на стадии отбора. Ранжирование всё ещё делает отдельная модель. Помимо этого, видны ещё три тенденции: рекомендательные системы уходят в мультимодальные сценарии и учатся обдумывать свой ответ. Также исследователи начинают использовать в ранжирующей модели раннее связывание с историей пользователя.

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC построена по принципу Fast-Slow Thinking, при котором ресурсоёмкий анализ интересов пользователя и быстрый онлайн-инференс разделены на два контура:
🟣 Slow: LLM в фоновом процессе анализирует историю поведения, контекст и недавние запросы пользователя, после чего формирует инструкции, которые описывают его текущие интересы
🟣 Fast: во время онлайн-обработки запроса encoder-decoder модель использует подготовленную инструкцию с историей пользователя и генерирует рекомендуемые товары с помощью Semantic ID

Это близко к test-time scaling, но реализовано асинхронно: дополнительные вычисления расходуются не во время конкретного запроса, а фоном. Полученные инструкции модель использует без вызова LLM.

M²GR: Generative User Interest Modeling via Multi-Granularity Multi-Objective CoT for Industrial Recommendation

В этом исследовании модель учится предсказывать будущие интересы пользователя по истории взаимодействий. Вместо одного прямого прогноза она сначала определяет главные характеристики следующего объекта (категорию, бренд, цену и ключевые слова). Затем модель предсказывает, например, товар, по которому пользователь, вероятнее всего, кликнет, и на основе этого решения показывает товар, который пользователь может заказать.

Получается своеобразная цепочка рассуждений, но без перехода к текстовым объяснениям: промежуточными шагами служат атрибуты товаров и прогнозы действий пользователя. Авторы называют свой подход implicit reasoning: модель выполняет промежуточные рассуждения во внутреннем пространстве представлений. При этом в M²GR каждому шагу заранее задан понятный смысл, поэтому такая цепочка остаётся вполне управляемой и интерпретируемой.

Во время выдачи модель строит несколько возможных цепочек интересов пользователя, а их соответствие товарам-кандидатам передаётся основной модели ранжирования как дополнительный сигнал.

Pin-SCALE: Semantic Cascading and Alignment Learning for Engagement-Aware IDs in Cold-Start Recommendations

Интересной оказалась работа Pinterest об использовании Semantic ID для рекомендаций новых объектов. Здесь они применяются не для авторегрессивной генерации, а внутри классической двухбашенной модели поиска кандидатов. Поскольку отдельные Semantic ID разделяются между множеством похожих объектов, новый пин может получить часть поведенческого сигнала от уже известных системе объектов.

Авторы предлагают последовательно объединять SID-токены от более общих к более точным, учитывать при их построении не только содержание объектов, но и пользовательские взаимодействия, а также дополнительно сближать представления в башнях запроса и кандидата.

#aivkhub #recsys #конференция #sigir


Исследователи AI VK Research представили большой датасет VK-LSVD на The Web Conference 2026 — одной из ключевых международных конференций в сфере web science. О датасете можно почитать подробнее в нашем канале и на Хабре.

Мы подготовили обзор нескольких интересных статей, отмеченных программным комитетом конференции.

🏆 Best paper award
From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering

Работа посвящена медицинским вопросно-ответным системам на базе LLM.

В стандартном Retrieval-Augmented Generation (RAG) ответ строится с опорой на найденные в корпусе документы, тогда как Generation-Augmented Generation (GAG) использует сгенерированные LLM контекстные документы. Авторы предлагают многостадийный метод MedRGAG, который объединяет внешние и сгенерированные знания: после информационного поиска сжать его результат, определить недостающие знания, заполнить пробелы — сгенерировать соответствующие документы, выбрать из найденных и сгенерированных документов мини-корпус для контекста LLM для генерации ответа.

Авторы продемонстрировали преимущество подхода в медицинском домене, но метод очень дорогой и при замене вспомогательной языковой модели GPT-4o-mini на меньшие качество падает.

🏆 Best Short Paper Award
DualGR: Generative Retrieval with Long and Short-Term Interests Modeling

Авторы усовершенствовали генеративный retrieval для рекомендаций коротких видео и предложили три модификации стандартного генеративного пайплайна.

🟣Dual Branch Router. История пользователя делится на два окна: длинное хранит устойчивые интересы, короткое окно ловит новые. При обучении модель выбирает окно, которое точнее совпадает с coarse semantic ID целевого видео. При инференсе кандидаты генерируются сразу по обеим ветвям и объединяются в список.

🟣Search based SID Decoding. После генерации первого (грубого) semantic ID модель фильтрует историю: оставляет только действия с таким же первым ID. Например, чтобы рекомендовать видео о спорте, анализируется история просмотров только спортивных роликов, и остальная история не мешает.

🟣Exposure aware NTP Loss. Модель штрафуется за высокую вероятность первого semantic ID у показанных, но непрокликнутых видео. Штраф вводится только на первом грубом уровне: неактуальные интересы затухают быстрее, а точные semantic ID не перекрываются лишними отрицательными метками.


🏆 Seoul Test of Time Award
LINE: Large-scale information network embedding

В этой работе исследователи предложили строить embedding для вершин больших графов по методу LINE. Метод хорошо масштабируется и учитывает два типа близости: первого порядка (по рёбрам графа) и второго порядка (по схожести соседей). Оба представления обучаются отдельно и конкатенируются. Есть инженерные приёмы реализации negative sampling и edge sampling — ребро выбирается с вероятностью, пропорциональной его весу, после чего обрабатывается как бинарное.

Награда Seoul Test of Time Award особенная: её вручают за статьи, значимость которых со временем подтвердилась.

Обзор подготовил руководитель AI VK Research Александр Дьяконов.

#aivkhub #обзор #конференция



Показано 12 последних публикаций.