ИИ Песочница Sber AI Lab


Гео и язык канала: Россия, Русский
Категория: Технологии


AI & ML related papers review, news, opensource updates
GitHub: https://github.com/sb-ai-lab
Contact us for posts and promo: @oxana_y

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций




🔥 КАКИМ ИИ БУДЕТ ЗАВТРА?

обсудим на конференции AI R&D DAY!
📆 17 сентября
📍 Москва

🎚️ 22 доклада от исследователей и инженеров Сбера.

Отличная возможность обменяться опытом, задать вопросы и обсудить идеи.


Что ещё будет на конференции:
🔘Новые архитектуры и подходы к обучению моделей
🔘ИИ-агенты и инструменты для разработки
🔘Омнимодальная долгосрочная память
🔘Модальности и коммуникации
🔘Оценка качества и производительности ИИ-
решений


Sber AI Lab будет в программе:
🎙Максим Макаренко выступит с докладом
«LLM для работы с событийными данными» — о том, как адаптировать большие языковые модели для анализа последовательностей событий (транзакции, логи, поведенческие данные) и какие вызовы возникают на этом пути.
🔘 Демо библиотеки SIRIN (Semantic Inconsistency Recognition and Inspection Nexus) на стенде — покажем, как работает детекция галлюцинаций в LLM в реальном времени.
🔘Постерная сессия — наши исследования и результаты.


Участие бесплатное, количество мест ограничено.

📎 Полная программа и регистрация по ссылке. Присоединяйтесь очно или онлайн!


ВИДИМ ДАННЫЕ НАСКВОЗЬ 🤩

Даже хорошая рекомендательная модель может показать отличный результат на тесте, но провалиться в реальности. И проблема часто скрывается в данных.

Исследователи Центра практического ИИ Сбера и AIRI создали SplitLight — открытый инструмент, который помогает находить такие проблемы ещё до обучения и сравнения моделей.

Что он умеет
🟣 Ищет аномалии в данных и даёт рекомендации по их устранению. Например, сбои логирования, дублирующиеся события и сдвинутые временные метки

🟣 Проверяет реалистичность эксперимента. Не попали ли в обучение данные из будущего, учтены ли новые пользователи и объекты, насколько отличаются тренировочная и валидационная выборки

🟣 Помогает сравнивать исследования. Фиксирует ключевые статистики разбиения и подготовки данных, чтобы эксперименты можно было воспроизводить и корректно сопоставлять

🟣 Показывает общую картину. Выводит на дашборде подробную статистику по проблемам в данных


Команда проекта во главе с исполнительным директором по исследованию данных Центра практического ИИ Сбербанка Алексея Васильева протестировала SplitLight на шести популярных открытых датасетах и наглядно показала: даже незначительные изменения в разбиении способны заметно повлиять на метрики и трактовку качества модели.

А научную работу о SplitLight представили на ACM SIGIR 2026 — одной из ведущих международных конференций в области информационного поиска и рекомендательных систем.

Забрать инструмент можно на GitVerse, а также на GitHub

✈️@sb_ai_lab


⚡️Рассказываем о нашей крутой разработке в области Recsys ⬇️


Репост из: Олимпиадные школы МФТИ
Как ИИ помогает врачам ставить диагноз по фотографии?

В августе к нам на смену приезжал Константин Егоров — руководитель направления по исследованию данных Sber AI Lab, Центра практического искусственного интеллекта Сбера. На лекции он рассказал, как развивалось компьютерное зрение: от первых экспериментов на зрительной коре кошек до современных моделей глубокого обучения, которые уже сегодня помогают решать реальные медицинские задачи

После лекции мы попросили Константина ответить на несколько вопросов. Как инженер-строитель оказался в Data Science? Чем сегодня занимается Sber AI Lab? И какой совет он дал бы школьникам, которые мечтают связать свою жизнь с искусственным интеллектом?

Ответы — в карточках
#мнениеэксперта


Медицинская команда Sber AI Lab была на новой смене олимпиадной школы МФТИ, делилась опытом и знаниями.
Рассказываем, как это было 👇










ICML 2026: главные тренды

продолжаем делиться обзором и аналитикой с конференции

В Сеуле с 6 по 11 июля прошла 43-я ICML - одна из трёх самых престижных конференций по машинному обучению (A*, h5‑index 272).
Цифры:
24 661 поданных работ - самая крупная конференция за всё время (2× по сравнению с ICML 2025)
6 552 приняты (26.6%)
168 устных докладов, 5 874 постера, 44 воркшопа


🔝Топ-5 тематик принятых работ:
🔘Large language models
🔘Applications: computer vision
🔘Deep learning: generative models and autoencoders
🔘Applications: chemistry, physics, earth sciences
🔘Applications: health, medicine

🎤Ключевые доклады
🔘Pascale Fung (HKUST) - агентам в реальном мире нужны модели мира: JEPA, VLWM, VL‑JEPA вместо пиксельных предсказаний.
🔘Verena Rieser (DeepMind) - сдвиг от запретов («не навреди») к позитивному выравниванию агентов. В реальных агентских сценариях, полных ценностно-нагруженных и неоднозначных решений, слепое следование правилам вредит. Предложена Habermas Machine - ИИ как нейтральный медиатор для группового консенсуса. В adversarial multi-turn framework перестановка фактов меняет решение модели в 13–22% случаев и сдвигает итоговую позицию к мнению пользователя на 6,5%.
🔘Arvind Narayanan (Princeton) -коллаборативные агенты успешнее автономных. RSI (Recursive Self-Improvement) не приведёт к AGI автоматически. Ключевой фокус: на создание бенчмарков и человеческую валидацию.



7️⃣главных трендов
1️⃣Генерация архитектур мультиагентных систем
Вместо ручного дизайна - переиспользуемые блоки (review, voting, planning) и диффузионная генерация графа коммуникации агентов.
2️⃣ Память и контекст для долгосрочных агентов
Context Folding -экономия контекста в 10×. BEACON — вехи для точной оценки в RL. MemoryArena - бенчмарк памяти в многосессионных задачах.
3️⃣ Эволюционный поиск вместо ручного дизайна
Эволюционные стратегии впервые дообучают LLM целиком, превосходя RLHF. AutoNumerics-Zero (DeepMind) - эволюционный поиск математических функций.
4️⃣Стабильность агентского RL
ARLArena - систематический разбор причин коллапса обучения. One Tool Is Enough - агент с одним инструментом обходит модели с 32B параметров.
5️⃣ Быстрый инференс LLM
ThunderAgent- ускорение в 1.5–3.9×.
Star Elastic (Nvidia) - одна модель с несколькими размерами. AgentOmit - пропуск лишних мыслей.
6️⃣Факты и безопасность
Большинство фактологических ошибок - не отсутствие знаний, а неспособность их извлечь (DeepMind). Бинарная награда за факты снижает галлюцинации на 39%. Co-RedTeam - мультиагентный поиск уязвимостей кода.
7️⃣ Надёжность в продакшене
Исследования реальных внедрений: надёжность агентов в ПРОМе обеспечивается ограничением автономности, короткими цепочками действий и ранним вмешательством человека.

💡Выводы

✔️Агенты становятся отдельным направлением, а не продолжением LLM-практики. На конференции заметен переход от «LLM + tools» к агентам с памятью, координацией, моделями мира и длинным горизонтом планирования.
✔️Надёжность и проверяемость выходят на первый план. Вопрос уже не в том, как поднять метрику, а в том, почему система ошибается: из-за знаний, извлечения, выравнивания, reward hacking или слабой постановки задачи.
✔️Эффективность снова стала центральной темой. Много сильных работ посвящено более дешёвому инференсу, семплированию, дообучению и разрежению. Для production это часто важнее, чем ещё один процент качества без понимания цены.
✔️Diffusion-модели закрепились как отдельный фронтир для языка и теории -это видно по награждённым работам и общему вниманию к diffusion language models и методам точного семплирования.
✔️Безопасность и выравнивание обсуждаются как прикладная инженерная задача. Вопрос уже не только в том, как ограничить модель, но и в том, какие инструменты для этого создаются и как они будут использоваться на практике.

@sb_ai_lab
#icml




Репост из: Олимпиадные школы МФТИ
Как попасть в Sber AI Lab и заниматься тем, что используют миллионы людей?

Помните недавнюю лекцию Дарьи Денисовой, ведущего специалиста по исследованию данных Sber AI Lab — Центра практического Искусственного интеллекта Сбера? Она рассказала, как работают рекомендательные системы, почему алгоритмы так хорошо угадывают наши интересы и какую роль в этом играют математика, анализ данных и машинное обучение.

После лекции многие ещё долго обсуждали услышанное, а мы решили пойти дальше и поговорили с Дарьей лично. Как олимпиады помогли ей попасть в Big Tech? Чем на самом деле занимается исследователь данных? И какой совет она дала бы тем, кто уже сейчас мечтает строить технологии будущего?

Ответы — в карточках
#мнениеэксперта


💚 Sber AI Lab активно работает с молодыми талантами:
🟢лекции в вузах
🟢темы для курсовых и дипломных работ
🟢летние школы со студентами
🟢поддержка школьников.

На олимпиадной школе МФТИ Дарья Денисова рассказала про рекомендательные системы и как олимпиады помогают попасть в Big Tech. Интервью со спикером, подготовленное организаторами школы ниже ⬇️


💚Sber AI Lab активно работает с молодыми талантами:
🟢лекции в вузах
🟢темы для курсовых и дипломных работ
🟢летние школы со студентами
🟢поддержка школьников.

На олимпиадной школе МФТИ Дарья Денисова из команды Recsys рассказала про рекомендательные системы и как олимпиады помогают попасть в Big Tech. Интервью со спикером, подготовленное организаторами школы ниже ⬇️




Репост из: Sber AI
🚫 СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ

Мы выложили в Open Source сразу две модели для работы со звуком: audio-native LLM GigaChat Audio и мультиязычное SOTA-распознавание речи GigaAM Multilingual. Обе работы приняты на Interspeech 2026 — главную мировую конференцию по речевым технологиям 🔥

Чем силён GigaChat Audio?

🤩 Понимает длинные записи


Держит контекст до 2 часов аудио и свободно ориентируется внутри: находит момент, где обсуждали нужную тему, пересказывает фрагмент, собирает саммари с таймкодами. На записях 20–60 минут точность локализации событий — 48.3 IoU против ~0 у Voxtral, Phi-4 и Qwen3-Omni

🤩 Считывает эмоции


По интонации и манере речи распознаёт настроение говорящего — 90%+ на бенчмарке Dusha — и учитывает его в ответе

🤩 Распознаёт русский на слух лучше аналогов


RuBQ-Audio: 60,0 против 43,7 у Qwen3-Omni. А ещё — multi-turn диалог, перевод, классификация аудио и распознавание речи в одной модели


GigaAM Multilingual
расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский. Компактная версия на 240M параметров обгоняет Whisper Large v3 и Omnilingual 1B, а аудиоэнкодер, предобученный на 2 млн часов речи на 70+ языках, адаптируется к новым языкам с минимумом данных: на грузинском и башкирском хватило одного Common Voice, чтобы дойти до WER ~4% против 11%+ у Whisper

Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026

Модели уже работают в ГигаЧате: общайтесь голосом, присылайте голосовые сообщения и аудиофайлы.

Разработчикам предлагаем забрать GigaChat Audio и GigaAM Multilingual в Open Source вместе с датасетом TimeGround-1M


А если интересна техническая часть, читайте пост команды ↖️

✔️ Подписывайтесь на Sber AI в МАКС


Репост из: Sber AI
СКОЛЬКО ЧЕЛОВЕК ГОВОРИТ? 🤩

❤️ — слышу двоих
👍 — кажется, три
🔥 — точно больше четырёх


⚡️Sber AI Lab на ICML 2026 (A*)

📍Конференция прошла в Сеуле с 6 по 11 июля.

🔆На основном треке Андрей Веприков, исследователь Sber AI Lab и Brainlab представил статью: Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling
Авторы предложили два новых оптимизатора - SoftSignum и SoftMuon, которые плавно заменяют жёсткий знак в Sign-оптимизации. Это позволяет адаптивно регулировать размер шага для разных частей модели: на ранних этапах - быстрые шаги, на финальных - точная настройка.


🔆На воркшопах Андрей Савченко, директор по науке, Sber AI Lab и Николай Никитин, ИТМО  представили две статьи:
1️⃣ On-Demand Multi-Agent Workflow Synthesis for Multimodal Long-Horizon Reasoning (SCALE Workshop) - подход для синтеза мультиагентных workflow под запрос, адаптирующийся к сложным мультимодальным задачам.

2️⃣ AutoJudge: Automatic Generation of LLM-Based Judges from Execution Traces (FAGEN Workshop) — метод автоматической генерации LLM-судей на основе трейсов выполнения для ускорения инференса и оценки качества.


🔥- если считаете, что три работы на главной конференции по ML это крутой результат.

@sb_ai_lab
#icml


💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее

Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который мы собирали больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.


Что внутри:

🔘Собственная гибридная архитектура MLA + GatedDeltaNet с придуманной нами уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
🔘Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
🔘GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Модернизация этого слоя позволила нам стабильно обучать модели с большим количеством параметров.
🔘Линейный слой требует в 4 раза меньше KV-кеша на токен, в ту же память позволяет поместить в 2,14 раза больше контекста, throughput под нагрузкой растет на +20%;
🔘Две MTP-головы и ускорение генерации до 2,2 раза;
🔘FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
🔘Новый этап online RL после SFT и DPO.

Результаты:

🔘GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
🔘GigaChat-3.5-Ultra-Instant сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
🔘По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.

Весь стек — данные (своя LLM-фильтрация Common Crawl, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан нами end-to-end.


🤖 Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.

➡️HuggingFace | GitVerse

Показано 20 последних публикаций.